Site Reliability Engineering Lead

Infosys

Hyderabad

On-site

INR 1,200,000 - 1,800,000

Full time

6 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Infosys in Hyderabad seeks an experienced DevOps/SRE professional to monitor and optimize large-scale cloud infrastructure. You will lead incident response, RCA, and implement permanent fixes while automating deployment and operations.

The role covers cloud management, CI/CD, IaC, and incident reviews to improve reliability and performance. The candidate will collaborate with development teams, define SLAs/SLIs/SLOs, and ensure security compliance, backups, and disaster recovery.

Qualifications

  • Experience in monitoring, incident response and RCA with permanent fixes.
  • Ability to automate operational tasks and manage CI/CD pipelines.
  • Experience with cloud infra across Azure, AWS, or GCP and IaC using Terraform or ARM templates.
  • Knowledge of security compliance, backups, and disaster recovery planning.

Responsibilities

  • Monitor application and infrastructure health 24/7.
  • Ensure high availability, reliability, and performance of systems.
  • Respond to incidents, outages, and production issues.
  • Perform root cause analysis and implement permanent fixes.
  • Automate repetitive operational and deployment tasks.
  • Develop and maintain monitoring, alerting, and logging solutions.
  • Configure and manage CI/CD pipelines.
  • Support application deployments and release management.
  • Manage cloud infrastructure (Azure, AWS, or GCP).
  • Perform capacity planning and resource optimization.
  • Implement Infrastructure as Code using Terraform or ARM templates.
  • Collaborate with development teams to improve application reliability.
  • Define and track SLAs, SLIs, and SLOs.
  • Manage backups, disaster recovery, and business continuity plans.
  • Ensure security compliance and vulnerability remediation.
  • Troubleshoot Linux, networking, database, and application issues.
  • Maintain Kubernetes and containerized environments.
  • Create operational documentation and runbooks.
  • Conduct post-incident reviews and recommend improvements.
  • Continuously improve system scalability, efficiency, and stability.

Skills

Linux/Unix Administration
Cloud platforms
Python
Bash
PowerShell
Prometheus

Education

Bachelor of Engineering
BSc
BCA
Master of Engineering
MSc
MCA

Tools

Terraform
Jenkins
Azure DevOps
GitHub Actions
Kubernetes
Docker

Job description

Educational Requirements

Bachelor of Engineering, BSc, BCA, Master of Engineering, MSc, MCA

Service Line

Data Analytics Unit

Responsibilities
  • Monitor application and infrastructure health 24/7.
  • Ensure high availability, reliability, and performance of systems.
  • Respond to incidents, outages, and production issues.
  • Perform root cause analysis (RCA) and implement permanent fixes.
  • Automate repetitive operational and deployment tasks.
  • Develop and maintain monitoring, alerting, and logging solutions.
  • Configure and manage CI/CD pipelines.
  • Support application deployments and release management.
  • Manage cloud infrastructure (Azure, AWS, or GCP).
  • Perform capacity planning and resource optimization.
  • Implement Infrastructure as Code (IaC) using tools like Terraform or ARM templates.
  • Collaborate with development teams to improve application reliability.
  • Define and track SLAs, SLIs, and SLOs.
  • Manage backups, disaster recovery, and business continuity plans.
  • Ensure security compliance and vulnerability remediation.
  • Troubleshoot Linux, networking, database, and application issues.
  • Maintain Kubernetes and containerized environments.
  • Create operational documentation and runbooks.
  • Conduct post-incident reviews and recommend improvements.
  • Continuously improve system scalability, efficiency, and stability.
Key Skills
  • Linux/Unix Administration
  • Azure/AWS/GCP
  • Kubernetes
  • Docker
  • Python
  • Bash
  • PowerShell
  • Terraform
  • Jenkins
  • Azure DevOps
  • GitHub Actions
  • Prometheus
Preferred Skills
  • Technology->DevOps->Site Reliability Engineering(SRE)
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer (SRE) – Core IT Infrastructure
Site Reliability Engineer (SRE) – Core IT Infrastructure

TECEZE • Chennai District

On-site
INR 1,000,000 - 2,000,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Zorba AI • Chennai District

On-site
INR 1,200,000 - 2,400,000
Site Reliability Engineer
Site Reliability Engineer

S P A Enterprise Info Services • Chennai District

On-site
INR 1,800,000 - 2,800,000
SRE - AWS, GCP & Azure
SRE - AWS, GCP & Azure

PibyThree • Navi Mumbai

On-site
INR 1,200,000 - 1,800,000
SRE - AWS, GCP & Azure
SRE - AWS, GCP & Azure

PibyThree • Thane

On-site
INR 1,200,000 - 1,500,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Five9 • Bengaluru

On-site
INR 4,000,000 - 7,000,000
Site Reliability Engineer
Site Reliability Engineer

Tekskills • Pune District

On-site
INR 1,200,000 - 1,800,000
Restaurant d'entreprise
Indemnités de stage/alternance
Site Reliability Engineer
Site Reliability Engineer

Tekskills • Chennai District

On-site
INR 1,800,000 - 3,000,000
Site Reliability Engineer
Site Reliability Engineer

Tekskills • Bengaluru

On-site
INR 1,500,000 - 2,500,000
AWS SRE Professional
AWS SRE Professional

Infosys • Bengaluru

On-site
INR 900,000 - 1,300,000