Lead Site Reliability Engineer (SRE)

Skillventory

Kamrup Metropolitan

On-site

INR 3,500,000 - 7,000,000

Full time

5 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Skillventory in India seeks a Senior SRE/Cloud Engineer to own end-to-end production reliability, scalability, and performance for 24x7 environments. You will define SLIs, SLOs, SLAs, and incident response while coordinating post-incident analyses.

You will design and operate GCP-based infrastructure (GKE, IAM, Load Balancers, BigQuery) with Terraform, implement CI/CD pipelines, and build observability using Dynatrace and Grafana for robust monitoring.

Qualifications

  • 11+ years in SRE/DevOps/Cloud Engineering managing high-availability, 24x7 production environments.
  • Hands-on experience with GCP, GKE, and Infrastructure as Code using Terraform.
  • Proficiency in Jenkins pipeline creation, GitHub, Python, and Shell scripting.
  • Observability experience with Dynatrace, Grafana, or Prometheus for logs, metrics and traces.
  • Strong Linux system administration skills, TCP/IP networking fundamentals, and debugging of Java/Golang microservices.
  • Solid understanding of SLIs/SLOs, Error Budgets, and modern incident management practices.
  • Nice to have: banking/financial domains, large-scale distributed systems, and cloud security/compliance.

Responsibilities

  • Own end-to-end production reliability, scalability, and performance with 24x7 on-call rotations.
  • Design, deploy, and manage GCP resources (GKE, IAM, Load Balancers, BigQuery, Pub/Sub) using Terraform.
  • Deploy and troubleshoot containerized workloads on GKE using Helm and Canary/Blue-Green deployment strategies.
  • Build automation pipelines using Jenkins, GitHub, Python, and Shell scripting to reduce manual toil.
  • Implement full-stack monitoring and alerting with Dynatrace, Grafana, and cloud logging/metrics tools.
  • Perform root-cause analysis across distributed systems, Linux networking, and Java/Golang applications.

Skills

SRE/DevOps mindset
Cloud engineering
Linux administration
Networking basics
Incident management

Tools

GCP
GKE
Terraform
Jenkins
GitHub
Python
Shell scripting
Dynatrace
Grafana
Prometheus

Job description

Key Responsibilities
  • Reliability & Operations: Own end-to-end production reliability, scalability, and performance. Establish SLIs, SLOs, SLAs, and Error Budgets while managing MTTR/MTTA through 24x7 on-call rotations and post-incident analysis.
  • Cloud & Infrastructure: Design, deploy, and manage GCP resources (GKE, VPC, IAM, Load Balancers, BigQuery, Pub/Sub) using Terraform (IaC).
  • Kubernetes & Containers: Deploy and troubleshoot containerized workloads on GKE using Helm, YAML, and Canary/Blue-Green deployment strategies.
  • Automation & CI/CD: Build automation pipelines using Jenkins, GitHub, Python, and Shell scripting to reduce manual toil.
  • Observability & Monitoring: Implement full-stack monitoring and alerting strategies using Dynatrace, Grafana, and cloud logging/metrics tools.
  • Troubleshooting: Perform root-cause analysis across distributed systems, Linux/networking layers, and Java or Golang applications.

Key Requirements
  • Experience: 11+ years in SRE, DevOps, or Cloud Engineering managing high-availability, 24x7 production environments.
  • Cloud & Tools: Strong hands-on experience with GCP, GKE, and Infrastructure as Code using Terraform.
  • CI/CD & Scripting: Proficiency in Jenkins pipeline creation, GitHub, Python, and Shell scripting.
  • Observability: Experience using Dynatrace, Grafana, or Prometheus for log, metric, and trace analysis.
  • Systems & Networking: Strong Linux system administration skills, TCP/IP networking fundamentals, and experience debugging Java/Golang microservices.
  • SRE Concepts: Solid understanding of SLIs/SLOs, Error Budgets, and modern incident management practices.
  • Pluses: Experience in banking/financial domains, high-scale distributed systems, and cloud security/compliance

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer
Senior Site Reliability Engineer

UST • Pune District

On-site
INR 1,800,000 - 3,000,000
Site Reliability Engineer (SRE) – GCP Platform
Site Reliability Engineer (SRE) – GCP Platform

ITC Infotech • Bengaluru

On-site
INR 900,000 - 1,300,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Sierra Ventures • Bengaluru

On-site
INR 3,500,000 - 5,500,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Infosys • Bengaluru

On-site
INR 900,000 - 1,500,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Zorba AI • Chennai District

On-site
INR 1,200,000 - 2,400,000
Senior Site Reliability Engineer (SRE)
Senior Site Reliability Engineer (SRE)

Lonvec Technologies Private Limited • Hyderabad

On-site
INR 3,000,000 - 5,000,000
Site Reliability Engineer (SRE) – Core IT Infrastructure
Site Reliability Engineer (SRE) – Core IT Infrastructure

TECEZE • Chennai District

On-site
INR 1,000,000 - 2,000,000
Site Reliability Engineer
Site Reliability Engineer

Vipany Global • Hyderabad

Hybrid
INR 1,800,000 - 2,400,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Mastercard • Mumbai

On-site
INR 3,500,000 - 6,000,000
Lead SRE
Lead SRE

Cvent, Inc. • Gurugram District

On-site
INR 4,000,000 - 8,000,000