Senior Site Reliability Engineer (SRE)

GSPANN Technologies, Inc.

Pune District

Hybrid

INR 4,000,000 - 6,000,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

GSPANN Technologies, Inc. is seeking a Senior Site Reliability Engineer to safeguard uptime and performance of business-critical eCommerce platforms, leading incident response, observability, and automation efforts.

You will design, implement, and optimize observability solutions using Prometheus, Grafana, ELK Stack, and Datadog, and develop automation with Python, Java, J2EE, and Angular while collaborating with Development, Infrastructure, and DevOps teams to deliver highly available systems.

Qualifications

  • Bring strong SRE experience for large-scale, customer-facing applications.

Responsibilities

  • Manage availability, reliability, scalability, and performance of business-critical eCommerce applications and services.

Skills

SRE experience
Observability tooling
Prometheus
Grafana
ELK Stack
Datadog
Python
Java/J2EE
Angular
Akamai CDN
Apache Kafka
Monitoring
Incident management
Networking

Tools

Prometheus
Grafana
ELK Stack
Datadog
Akamai CDN
Apache Kafka

Job description

Site Reliability Engineering (SRE) Observability Prometheus Grafana ELK Stack Datadog Monitoring and Alerting Python Java Java 2 Platform Enterprise Edition (J2EE) Angular Akamai Content Delivery Network (CDN)

Description

GSPANN is hiring a Senior Site Reliability Engineer (SRE) to safeguard the uptime and performance of business-critical eCommerce platforms, leading incident response, observability, and automation efforts.

Roles and Responsibilities
  • Manage the availability, reliability, scalability, and performance of business-critical eCommerce applications and services.
  • Lead incident management activities, service restoration efforts, RCA, and postmortem reviews to drive long-term reliability improvements.
  • Design, implement, and optimize observability solutions, including logging, monitoring, metrics, tracing, and alerting frameworks.
  • Build and maintain enterprise monitoring solutions using Prometheus, Grafana, ELK Stack, and Datadog, or equivalent observability platforms.
  • Develop proactive monitoring and alerting strategies to minimize downtime and improve system availability.
  • Implement and maintain automation solutions and operational tooling using Python, Java, J2EE, and Angular.
  • Collaborate with Development, Infrastructure, DevOps, and Operations teams to build resilient, scalable, and highly available system architectures.
  • Ensure system reliability, fault tolerance, and operational excellence by applying SRE best practices.
  • Optimize production environments by applying networking, DNS, load balancing, and security principles.
  • Ensure high-traffic, customer-facing digital and eCommerce platforms perform reliably by monitoring and improving their performance.
  • Manage Akamai CDN configurations to improve application responsiveness and content delivery performance.
  • Support Apache Kafka environments for event-driven and distributed architectures.
  • Build and maintain operational dashboards, runbooks, escalation procedures, and service health reports.
  • Optimize application and infrastructure performance by identifying and resolving bottlenecks.
  • Collaborate with engineering teams to support application deployments, release validation, and platform stability.
  • Drive continuous improvement initiatives focused on automation, observability, monitoring maturity, and platform reliability.
  • Support business continuity and critical incident response by participating in rotational shifts and on-call activities.
Skills and Experience
  • Bring strong experience in SRE supporting large-scale, customer-facing applications.
  • Demonstrate hands-on expertise with observability and monitoring tools such as Prometheus, Grafana, ELK Stack, and Datadog, or similar platforms.
  • Apply expertise in designing and managing enterprise monitoring, alerting, logging, metrics, and distributed tracing solutions.
  • Work with Python, Java, J2EE, or Angular to build automation and operational tooling.
  • Demonstrate solid understanding of Incident Management, Problem Management, RCA, and Postmortem processes.
  • Manage high-availability production environments and mission-critical systems.
  • Bring strong knowledge of Networking, DNS, Transmission Control Protocol/Internet Protocol (TCP/IP), Security, and Load Balancing concepts.
  • Utilize CDN technologies, preferably Akamai, in production environments.
  • Bring experience supporting Apache Kafka and event-driven architectures.
  • Demonstrate familiarity with cloud-native environments, distributed systems, and scalable architectures.
  • Develop automation frameworks that improve operational efficiency.
  • Bring strong troubleshooting, analytical, and problem-solving skills.
  • Demonstrate excellent collaboration and communication skills with cross-functional teams.
  • Work with rotational shift schedules (S1 and S2), including one weekend day per week, following patterns such as Sunday-Thursday or Tuesday-Saturday.
  • Manage on-call rotations and production support for high-priority incidents and escalations, including coverage during public holidays (with compensatory time off) and U.S. public holidays or critical business events requiring night shifts.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer
Senior Site Reliability Engineer

GSPANN • Hyderabad

On-site
INR 1,500,000 - 3,000,000
Site Reliability Engineer
Site Reliability Engineer

Peoplefy • Pune District

On-site
INR 1,200,000 - 1,800,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

C1X • Chennai District

On-site
INR 1,800,000 - 3,200,000
SRE Reliability Engineer
SRE Reliability Engineer

NTT DATA BUSINESS SOLUTIONS • Bengaluru

On-site
INR 2,500,000 - 4,000,000
SRE Developer
SRE Developer

Cloudxtreme • Hyderabad

On-site
INR 1,500,000 - 2,400,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Hucon Solutions • Chennai District, Bengaluru, Hyderabad

On-site
INR 1,000,000 - 1,500,000
SRE
SRE

SID Global Solutions • Mumbai

On-site
INR 1,200,000 - 1,800,000
SRE
SRE

SID Global • Navi Mumbai

On-site
INR 1,200,000 - 1,800,000
Site Reliability Engineer
Site Reliability Engineer

Recro • Bengaluru

On-site
INR 3,500,000 - 6,500,000
SRE
SRE

SID Global • Hyderabad

Hybrid
INR 800,000 - 1,200,000