Sr Lead SRE - Reliability Engineering & Problem Management

JPMorgan Chase & Co.

Hyderabad

On-site

INR 4,500,000 - 6,500,000

Full time

3 days ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

JPMorgan Chase & Co. in Hyderabad is seeking a Senior Lead Site Reliability Engineer to own RCA across major incidents and drive durable engineering improvements. You will lead deep technical reviews, validate causal analyses, and ensure corrective actions address systemic causes.

You will partner with cross-functional teams to accelerate AI-assisted reliability workflows, define SLIs/OKRs, and push resilient architectures with auditable governance.

Qualifications

  • Formal training or certification on security engineering concepts and 5+ years applied experience.

Responsibilities

  • Serve as the technical authority for Problem Management-led Root Cause Analysis reviews across major incidents and service-impacting events

Skills

RCA Expertise
SRE Engineering
AI in Operations
Incident Management
Cloud Infrastructure
Linux/Windows
Monitoring/Observability
DevOps Toolchains
Executive Communications

Tools

Splunk
Dynatrace
Grafana
Datadog
Prometheus
AppDynamics
Elastic
OpenTelemetry

Job description

Sr Lead SRE - Reliability Engineering & Problem Management
Job Information
  • Job Identification 210796575
  • Job Category Software Engineering
  • Business Unit Corporate Sector
  • Posting Date 10/05/2026, 01:32 PM
  • Locations MAGMA,UNIT-1,PHASE-IV,SY NO.83/1,PLOT NO 2, GR Floor TO 2 Floor and 5 Floor TO 16 Floor,Basement 1,2, Hyderabad, IN-TG, 500081, IN
  • Apply Before 10/30/2026, 04:00 AM
  • Job Schedule Full time
  • Job Shift Mid-Day
Job Description

As a Senior Lead Site Reliability Engineer at JPMorgan Chase within the Reliability Engineering & Problem Management team, you will serve as the technical authority for post-incident investigations and operational resilience. You will lead deep technical reviews, validate causal analysis, and ensure corrective actions address systemic causes. You will partner with cross-functional teams to drive measurable improvements in reliability, resilience, and operational excellence. You will help ensure incidents translate into lasting engineering improvements and reduction of repeat failures.

Job responsibilities

  • Serve as the technical authority for Problem Management-led Root Cause Analysis reviews across major incidents and service-impacting events
  • Lead deep-dive RCA challenge sessions, validating technical findings and causal chains through evidence-based analysis. Assess the quality and accuracy of root cause investigations, ensuring conclusions are technically sound and defensible. Challenge assumptions, unsupported conclusions, symptom-based findings, and ineffective corrective actions. Drive a culture of accountability focused on systemic learning and long-term reliability improvements
  • Evaluate detection gaps, monitoring effectiveness, observability shortcomings, automation opportunities, resilience weaknesses, process breakdowns, and human factors. Validate that corrective actions address the true root cause and reduce recurrence likelihood and impact. Review corrective actions for closure and effectiveness, ensuring intended reliability and operational outcomes. Provide technical challenge and independent review of vendor, third-party, and internal investigation reports
  • Use enterprise-authorized AI capabilities to accelerate reliability design and operational decisioning, validating outputs and handling operational data according to sensitivity and security requirements
  • Lead reuse-first adoption of AI-assisted reliability workflows across SDLC/toolchain practices, ensuring traceability, auditability, resiliency, and security controls. Define and govern Service Level Objectives, Service Level Indicators, Reliability Metrics, and Error Budgets
  • Evaluate system architecture against reliability design principles
  • Recommend resilience patterns including graceful degradation, dependency isolation, rate limiting, circuit breakers, fault tolerance, capacity management, auto-remediation, and self-healing capabilities
  • Lead reliability maturity assessments across platforms and services
  • Lead enterprise-authorized AI capabilities for RCA generation, incident analysis, log analytics, pattern discovery, problem trend analysis, and corrective action recommendations
  • Establish governance for explainability, auditability, data handling, and validation of AI-generated findings
  • Drive AI-assisted reliability workflows across the incident lifecycle

Required qualifications, capabilities and skills

  • Formal training or certification on security engineering concepts and 5+ years applied experience. Hands on experience in Infrastructure Engineering, Site Reliability Engineering, Production Engineering, Systems Engineering, or Software Engineering. Strong exposure to leading or supporting critical incident investigations
  • Experience conducting deep technical RCAs for enterprise-scale environments, working in highly regulated and mission-critical environments
  • Advanced expertise in Network Engineering, Cloud Infrastructure, Linux/Windows Platforms, Middleware Technologies, Database Technologies, Storage Platforms, Application Architecture, DevOps Toolchains, Distributed Systems, and Enterprise Monitoring Platforms
  • Strong hands-on expertise in SLO/SLI Engineering, Distributed Tracing, Telemetry Design, Reliability Metrics, Error Budget Management, and AIOps Platforms
  • Experience with tools such as Splunk, Dynatrace, Grafana, Datadog, Prometheus, AppDynamics, Elastic, and Open Telemetry
  • Deep understanding of Root Cause Analysis methodologies, Five Whys, Fault Tree Analysis, Event Correlation, Human Factors Analysis, Systemic Cause Analysis, Problem Management Governance, and Major Incident Management
  • Demonstrated experience using enterprise-authorized AI capabilities to improve reliability engineering workflows with strong validation habits and awareness of data sensitivity
  • Ability to set team practices for safe AI usage in operations while maintaining resiliency, security, and auditability outcomes
  • Strong executive communication skills. Ability to challenge senior engineering stakeholders constructively. Proven ability to influence without direct authority
  • Ability to translate technical findings into executive-ready narratives

Preferred qualifications, capabilities and skills

  • Experience leading reliability engineering initiatives in large-scale, complex environments
  • Expertise in AI-enabled incident analysis and reliability workflows
  • Experience establishing governance for explainability and auditability of AI-generated findings
  • Demonstrated ability to drive measurable improvements in reliability, resilience, and operational excellence
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Lead Site Reliability Engineer
Lead Site Reliability Engineer

JP Morgan Services India Pvt Ltd • Bengaluru

On-site
INR 3,500,000 - 7,500,000
Senior Manager of SRE
Senior Manager of SRE

JPMorgan Chase & Co. • Hyderabad

On-site
INR 4,000,000 - 7,000,000
Site Reliability Engineer II - Java/Python, Kubernetes, AWS, Terraform
Site Reliability Engineer II - Java/Python, Kubernetes, AWS, Terraform

JPMorganChase • Bengaluru

On-site
INR 1,200,000 - 2,400,000
Site Reliability Engineer II - Java/Python, Kubernetes, AWS, Terraform
Site Reliability Engineer II - Java/Python, Kubernetes, AWS, Terraform

JPMorgan Chase & Co. • Bengaluru

On-site
INR 1,800,000 - 3,000,000
Senior Director of Software Engineering - Java, AWS, RESTful, Containers
Senior Director of Software Engineering - Java, AWS, RESTful, Containers

JPMorgan Chase & Co. • Hyderabad

On-site
INR 30,000,000 - 45,000,000
Site Reliability Engineer III
Site Reliability Engineer III

JPMorgan Chase & Co. • Hyderabad

On-site
INR 1,500,000 - 2,000,000
Senior Lead Software Engineer - Java/Python, AWS
Senior Lead Software Engineer - Java/Python, AWS

JPMorgan Chase & Co. • Hyderabad

On-site
INR 3,500,000 - 6,500,000
Lead Software Engineer Java Fullstack React AWS
Lead Software Engineer Java Fullstack React AWS

JPMorgan Chase & Co. • Bengaluru

On-site
INR 2,500,000 - 4,000,000
Sr Lead Software Engineer - Java/Python, Data Engineering
Sr Lead Software Engineer - Java/Python, Data Engineering

JPMorgan Chase & Co. • Hyderabad

On-site
INR 4,500,000 - 7,500,000
Lead Software Engineer - React UI & Java
Lead Software Engineer - React UI & Java

JPMorgan Chase & Co. • Mumbai

On-site
INR 2,500,000 - 4,200,000