AWS Site Reliability Engineer (SRE)

Zensar

Hyderabad, Pune District

On-site

INR 1,500,000 - 2,100,000

Full time

14 days+
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Zensar Technologies is looking for an experienced AWS Site Reliability Engineer (SRE) to join our Cloud Engineering team in Hyderabad. The role focuses on reliability, availability, scalability, and performance for mission-critical AWS-hosted applications, with emphasis on automation and operations excellence.

You will handle incident management, observability, and automation across cloud-native microservices, participate in on-call rotations, and drive continuous improvement of deployment

Qualifications

  • 2.5+ years of dedicated SRE experience.
  • Experience in Incident Management, Change Management, and RCA.
  • Experience with on-call and shift-based support.
  • Strong Linux administration and troubleshooting.
  • Automation mindset with IaC and CI/CD.
  • Experience with cloud-native architectures.
  • Proficient in monitoring and observability tooling.

Responsibilities

  • Manage large-scale production environments on AWS and ensure high availability and performance.
  • Drive SRE practices across cloud-native and microservices apps.
  • Perform incident management, RCA, and postmortem documentation.
  • Build and enhance observability with monitoring, logging, and APM tools.
  • Automate infrastructure provisioning with IaC and design CI/CD pipelines.
  • Collaborate with development teams to improve resiliency and scalability.

Skills

AWS Cloud
Site Reliability Engineering
Incident Management
Kubernetes
Docker
CI/CD
Infrastructure as Code
Python
Linux
Security Best Practices

Tools

Kubernetes
Docker
Grafana
Prometheus
Splunk
ELK Stack
CloudWatch

Job description

Zensar Technologies is looking for an experienced AWS Site Reliability Engineer (SRE) to join our Cloud Engineering team. The ideal candidate will be responsible for ensuring the reliability, availability, scalability, and performance of mission-critical enterprise applications running on AWS cloud platforms.

The role demands deep expertise in production operations, incident management, cloud-native architectures, observability, automation, and Kubernetes-based microservices environments. The candidate will work closely with development, infrastructure, and platform teams to improve system reliability, automate operations, and drive operational excellence.

Key Responsibilities
  • Manage and support large-scale production environments hosted on AWS Cloud.
  • Ensure high availability, reliability, scalability, and performance of business-critical applications.
  • Drive Site Reliability Engineering practices across cloud-native and microservices-based applications.
  • Perform incident management, troubleshooting, root cause analysis (RCA), and postmortem documentation.
  • Participate in on-call support rotations and provide timely resolution for production issues.
  • Build and enhance observability solutions using monitoring, logging, and APM tools.
  • Automate infrastructure provisioning and operational processes using Infrastructure as Code (IaC).
  • Design and implement CI/CD pipelines for application deployment and platform automation.
  • Collaborate with development teams to improve resiliency, reliability, and operational efficiency.
  • Support cloud migration initiatives and disaster recovery strategies.
  • Build monitoring and alerting solutions for Kubernetes infrastructure and backend microservices.
  • Contribute towards performance tuning, capacity planning, and reliability improvements.
  • Implement security best practices for cloud-native applications and infrastructure.
Must Have Skills
Cloud & Infrastructure
  • Strong hands-on experience with AWS Cloud services.
  • Experience in AWS Networking, Compute, Storage, IAM, Security, and Cloud Operations.
  • Experience supporting enterprise-scale production environments.
Site Reliability Engineering
  • Minimum 2.5+ years of dedicated SRE experience.
  • Strong experience in Incident Management, Change Management, Problem Management, and Production Support.
  • Expertise in RCA (Root Cause Analysis) and Postmortem Analysis.
  • Experience working in on-call and shift-based support environments.
Containerization & Microservices
  • Strong experience with Kubernetes and Docker.
  • Experience managing and supporting Microservices-based architectures.
  • Experience with Kubernetes platform monitoring and troubleshooting.
Observability & Monitoring
  • Experience with APM tools such as:
    • Splunk APM (Preferred)
    • Datadog
    • Dynatrace
    • New Relic
    • AppDynamics
  • Experience with Monitoring & Visualization tools:
    • Grafana
    • Prometheus
  • Experience with Logging platforms:
    • Splunk
    • ELK Stack
    • CloudWatch
    • Sumo Logic
DevOps & Automation
  • CI/CD pipeline implementation using Jenkins and AWS CodePipeline.
  • Experience with GitHub and GitLab.
  • Strong automation mindset and operational excellence practices.
Scripting & Programming
  • Strong scripting skills in Bash/Shell and Python.
  • Programming exposure to Java.
  • Ability to develop automation utilities and operational tools.
Operating Systems
  • Strong Linux Administration and troubleshooting experience.
Good to Have
  • Terraform and Infrastructure as Code implementation.
  • Helm Charts and Kubernetes deployment automation.
  • Service Mesh implementation experience.
  • Enterprise cloud migration projects.
  • Disaster Recovery and Business Continuity planning.
  • OAuth, Authentication and Authorization concepts.
  • Java-based Microservices application support.
  • Experience in eCommerce or large-scale customer-facing platforms.
  • Experience with OKTA, Keycloak and enterprise security frameworks.
Desired Candidate Profile
  • Strong communication and stakeholder management skills.
  • Ability to work independently with minimal supervision.
  • Excellent analytical and troubleshooting capabilities.
  • Strong understanding of cloud-native technologies and distributed systems.
  • Experience working in Agile and DevOps environments.
  • Flexible to work in shifts and participate in production on-call rotations.
  • Available to join at short notice will be preferred.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineering (SRE)
Site Reliability Engineering (SRE)

Lyzr AI • Bengaluru

Hybrid
INR 1,000,000 - 2,000,000
Site Reliability Engineer
Site Reliability Engineer

Solutions By Text • Bengaluru

On-site
INR 800,000 - 1,200,000
SRE - AWS DevOPS Engineer
SRE - AWS DevOPS Engineer

Prowess Publishing • Hyderabad

On-site
INR 900,000 - 1,500,000
SRE - AWS, GCP & Azure
SRE - AWS, GCP & Azure

PibyThree • Navi Mumbai

On-site
INR 1,200,000 - 1,800,000
SRE - AWS, GCP & Azure
SRE - AWS, GCP & Azure

PibyThree • Thane

On-site
INR 1,200,000 - 1,500,000
Site Reliability Engineer
Site Reliability Engineer

Sonata Software • Hyderabad, Chennai District, Bengaluru

Hybrid
INR 1,500,000 - 2,100,000
Senior SRE Engineer
Senior SRE Engineer

Epam Systems • Chennai District

On-site
INR 2,500,000 - 4,000,000
Site Reliability Engineer Lead (Immediate Joiner)
Site Reliability Engineer Lead (Immediate Joiner)

HiLabs • Pune District

On-site
INR 2,500,000 - 4,200,000
Site Reliability Engineer
Site Reliability Engineer

SourcingXPress • Maharashtra

On-site
INR 700,000 - 1,800,000
Site Reliability Engineer (AWS)
Site Reliability Engineer (AWS)

Infosys • Bengaluru

On-site
INR 1,500,000 - 2,100,000