Senior Site Reliability Engineer

GSPANN

Hyderabad

On-site

INR 1,500,000 - 3,000,000

Full time

7 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

GSPANN in Hyderabad seeks an experienced Site Reliability Engineer to own the availability, reliability, and performance of enterprise ecommerce platforms. You will lead incident response, RCA, and postmortems while designing advanced observability and automation solutions.

You will work with cross-functional teams to build scalable architectures, apply SRE best practices, and manage on-call rotations, including weekend/public-holiday coverage.

Qualifications

  • Strong experience in Site Reliability Engineering (SRE) supporting large-scale, customer-facing applications.
  • Observability and monitoring tools such as Prometheus, Grafana, ELK Stack, Datadog, or similar platforms.
  • Designing and managing enterprise monitoring, alerting, logging, metrics, and distributed tracing solutions.
  • Programming for automation: Python, Java/J2EE, or Angular.
  • Solid incident, problem management, RCA, and postmortem processes.

Responsibilities

  • Take ownership of availability, reliability, scalability, and performance of ecommerce applications and services.
  • Lead incident management, RCA, and postmortems to drive reliability improvements.
  • Design and optimize observability solutions including logging, metrics, tracing, and alerts.
  • Build and maintain enterprise monitoring using Prometheus, Grafana, ELK Stack, Datadog.
  • Develop automation tooling with Python, Java/J2EE, or Angular.
  • Collaborate with Development, Infrastructure, DevOps, and Operations to build scalable architectures.
  • Implement SRE best practices for reliability and fault tolerance.
  • Apply networking, DNS, load balancing, and security principles to production.

Skills

SRE experience
Observability
Automation
Python
Java/J2EE
Angular
Incident management
Networking & DNS
CDN Akamai
Kafka
Cloud-native
Monitoring & tracing

Tools

Prometheus
Grafana
ELK Stack
Datadog
Akamai

Job description

Role & responsibilities
  • Take ownership of the availability, reliability, scalability, and performance of business-critical eCommerce applications and services.
  • Lead incident management activities, service restoration efforts, root cause analysis (RCA), and postmortem reviews to drive long-term reliability improvements.
  • Design, implement, and optimize observability solutions including logging, monitoring, metrics, tracing, and alerting frameworks.
  • Build and maintain enterprise monitoring solutions using Prometheus, Grafana, ELK Stack, Datadog, or equivalent observability platforms.
  • Develop proactive monitoring and alerting strategies to minimize downtime and improve system availability.
  • Create and maintain automation solutions and operational tooling using Python, Java/J2EE, or Angular.
  • Collaborate with Development, Infrastructure, DevOps, and Operations teams to build resilient, scalable, and highly available system architectures.
  • Implement SRE best practices to ensure system reliability, fault tolerance, and operational excellence.
  • Apply networking, DNS, load balancing, and security principles to optimize production environments.
  • Monitor and improve the performance of high-traffic, customer-facing digital and eCommerce platforms.
  • Configure, manage, and optimize CDN solutions such as Akamai to improve application responsiveness and content delivery performance.
  • Support and administer Apache Kafka environments for event-driven and distributed architectures.
  • Create and maintain operational dashboards, runbooks, escalation procedures, and service health reports.
  • Identify performance bottlenecks and implement solutions to improve application and infrastructure performance.
  • Partner with engineering teams to support application deployments, release validation, and platform stability.
  • Drive continuous improvement initiatives focused on automation, observability, monitoring maturity, and platform reliability.
  • Participate in rotational shifts and support on-call activities to ensure business continuity and critical incident response
Required Skills
  • Strong experience in Site Reliability Engineering (SRE) supporting large-scale, customer-facing applications.
  • Hands-on expertise with observability and monitoring tools such as Prometheus, Grafana, ELK Stack, Datadog, or similar platforms.
  • Experience designing and managing enterprise monitoring, alerting, logging, metrics, and distributed tracing solutions.
  • Strong proficiency in Python, Java/J2EE, or Angular for automation and operational tooling.
  • Solid understanding of Incident Management, Problem Management, RCA, and Postmortem processes.
  • Experience managing high-availability production environments and mission-critical systems.
  • Strong knowledge of Networking, DNS, TCP/IP, Security, and Load Balancing concepts.
  • Hands-on experience with CDN technologies, preferably Akamai.
  • Experience supporting Apache Kafka and event-driven architectures.
  • Familiarity with cloud-native environments, distributed systems, and scalable architectures.
  • Experience developing automation frameworks and improving operational efficiency.
  • Strong troubleshooting, analytical, and problem-solving skills.
  • Excellent collaboration and communication skills with cross-functional teams.
  • Willingness to work rotational shifts, weekend schedules, public holidays, and participate in on‑call support rotations.
Shift Requirements
  • Must be available to work rotational shifts (S1 & S2).
  • Required to work one weekend day as part of the regular work schedule.
  • Shift patterns may include:
Sunday to Thursday
Tuesday to Saturday
  • Expected to provide support during public holidays with compensatory time off.
  • Must be available to support night shifts during U.S. public holidays and critical business events.
  • Participate in on‑call rotations and provide production support for high‑priority incidents and escalations.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Tata Consultancy Services • Bengaluru

On-site
INR 2,800,000 - 4,000,000
Site Reliability Engineer
Site Reliability Engineer

Snapmint • Gurugram District

On-site
INR 800,000 - 1,200,000
Site Reliability Engineer
Site Reliability Engineer

Spot Your Leaders & Consulting • Pune District

On-site
INR 2,500,000 - 4,000,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Sierra Ventures • Bengaluru

On-site
INR 3,500,000 - 5,500,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Hucon Solutions • Chennai District, Bengaluru, Hyderabad

On-site
INR 1,000,000 - 1,500,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Brillio • Bengaluru Urban

On-site
INR 1,200,000 - 2,000,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Infosys • Hyderabad

On-site
INR 1,400,000 - 2,200,000
Resilience and Reliability Engineer
Resilience and Reliability Engineer

EY • Pune District, Gurugram District, Bengaluru

Hybrid
INR 1,800,000 - 2,800,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Akamai Technologies • Bengaluru

On-site
INR 2,400,000 - 3,400,000
Site Reliability Engineer
Site Reliability Engineer

NTT DATA BUSINESS SOLUTIONS • Hyderabad

On-site
INR 1,800,000 - 3,200,000