Site Reliability Engineer (SRE)

Infobell It Solutions

Hyderabad

On-site

INR 2,800,000 - 4,500,000

Full time

4 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Infobell IT Solutions in Hyderabad seeks a Site Reliability Engineer (SRE) with 6-8 years of experience to ensure reliability, availability, scalability, and performance of mission-critical applications and infrastructure on GCP and Kubernetes.

You will build observability, manage SLI/SLOs, automate with Terraform/Ansible, and own CI/CD pipelines using GitHub Actions, GitLab CI/CD, Jenkins, or similar tools, collaborating with Dev and Platform teams.

Qualifications

  • 6–8 years of experience in SRE/DevOps/Platform Engineering.
  • Strong proficiency with Google Cloud Platform (GCP) and Kubernetes (GKE preferred).
  • Experience with observability tooling such as Prometheus, Grafana, Datadog, Splunk, New Relic.
  • Proficiency in Python, Go, or Java and scripting with Bash.
  • Strong Linux administration and networking fundamentals.
  • Experience with infrastructure as code (Terraform, Ansible) and CI/CD pipelines.

Responsibilities

  • Design, maintain, and optimize highly available and scalable production systems.
  • Define and manage SLIs, SLOs, and Error Budgets to improve service reliability.
  • Build and enhance observability solutions using Prometheus, Grafana, Datadog, Splunk, New Relic, and related tools.
  • Lead incident response, RCA, and post-mortem activities.
  • Manage cloud-native apps on GCP, including GKE/Kubernetes and Docker environments.
  • Develop automation and IaC solutions using Terraform and Ansible.

Skills

SRE/DevOps
GCP
Kubernetes/GKE
Observability
CI/CD
Terraform/Ansible
Automation
Incident management
Python/Go/Java
Linux/Networking

Education

Google Professional Cloud Engineer
CKA/CKAD
Terraform Associate

Tools

Prometheus
Grafana
Datadog
Splunk
New Relic
Checkly
Anodot
Coralogix
GitHub Actions
GitLab CI/CD
Jenkins
Terraform
Ansible

Job description

Site Reliability Engineer (SRE)


Role Summary

We are looking for a Site Reliability Engineer (SRE) with 6-8 years of experience to ensure the reliability, availability, scalability, and performance of mission-critical applications and infrastructure. The ideal candidate should have strong expertise in GCP, Kubernetes, observability, automation, incident management, and DevOps practices.


Key Responsibilities

  • Design, maintain, and optimize highly available and scalable production systems.
  • Define and manage SLIs, SLOs, and Error Budgets to improve service reliability.
  • Build and enhance observability solutions using tools such as Prometheus, Grafana, Datadog, Splunk, New Relic, Checkly, Anodot, and Coralogix.
  • Lead incident response, troubleshooting, RCA, and post-mortem activities.
  • Manage cloud-native applications on GCP, including GKE/Kubernetes and Docker environments.
  • Develop automation and Infrastructure as Code (IaC) solutions using Terraform, Ansible, and scripting languages.
  • Build and support CI/CD pipelines using GitHub Actions, GitLab CI/CD, Jenkins, or similar tools.
  • Collaborate with development and platform teams to improve reliability, operational efficiency, and deployment practices.

Required Skills

  • 4-8 years of experience in SRE, DevOps, Platform Engineering, or Production Operations.
  • Strong hands-on experience with Google Cloud Platform (GCP) and Kubernetes (GKE preferred).
  • Proficiency in Python, Go, or Java and scripting using Bash/Shell.
  • Strong Linux administration and networking fundamentals (TCP/IP, DNS, HTTP/S, Load Balancing).
  • Experience with observability, monitoring, distributed tracing, and OpenTelemetry.
  • Expertise in Terraform, Ansible, Infrastructure as Code, and automation.
  • Experience in production incident management, reliability engineering, and performance optimization.

Preferred Qualifications

  • Certifications such as Google Professional Cloud Engineer, CKA, CKAD, or Terraform Associate.
  • Experience supporting large-scale distributed systems and implementing SRE best practices.
  • Knowledge of cloud security, capacity planning, and operational excellence.

Key Success Measures

  • Improved uptime and system reliability.
  • Reduced MTTR and operational toil through automation.
  • Enhanced observability and proactive incident detection.
  • Consistent achievement of defined SLOs and service performance targets.





Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer
Senior Site Reliability Engineer

UST • Pune District

On-site
INR 1,800,000 - 3,000,000
Site Reliability Engineer (SRE) – GCP Platform
Site Reliability Engineer (SRE) – GCP Platform

ITC Infotech • Bengaluru

On-site
INR 900,000 - 1,300,000
Site Reliability Engineer
Site Reliability Engineer

Advance Career Solutions • Pune District

On-site
INR 1,200,000 - 1,800,000
Senior Site Reliability Engineer (SRE)
Senior Site Reliability Engineer (SRE)

Lonvec Technologies Private Limited • Hyderabad

On-site
INR 3,000,000 - 5,000,000
Site Reliability Engineer (SRE) - Google Cloud Platform
Site Reliability Engineer (SRE) - Google Cloud Platform

Aziro • Hyderabad

Hybrid
INR 1,500,000 - 3,200,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Zorba AI • Chennai District

On-site
INR 1,200,000 - 2,400,000
Site Reliability Engineering (SRE) Lead
Site Reliability Engineering (SRE) Lead

SID Global Solutions • Hyderabad

On-site
INR 3,000,000 - 5,000,000
SRE Reliability Engineer
SRE Reliability Engineer

NTT DATA BUSINESS SOLUTIONS • Bengaluru

On-site
INR 2,500,000 - 4,000,000
Site Reliability Engineering (SRE) Lead
Site Reliability Engineering (SRE) Lead

Sidglobal • Hyderabad

On-site
INR 4,000,000 - 7,000,000
SRE Engineer
SRE Engineer

Prodapt Solutions Private Limited • Chennai District

On-site
INR 1,800,000 - 3,000,000