Senior Site Reliability Engineer

Good co India

United Arab Emirates

On-site

AED 240,000 - 480,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Good co India is seeking an experienced Site Reliability Engineer to design, implement, and maintain scalable production systems using SRE best practices. You will lead incident response, improve SLOs, and drive automation across cloud platforms (AWS/Azure/GCP) with strong emphasis on reliability and observability.

The role requires 5–10 years in SRE/DevOps with hands-on Kubernetes, IaC, CI/CD, and security best practices.

Qualifications

  • Bachelor's degree or higher in a relevant field.
  • 5–10 years in SRE/DevOps/Cloud/Production Engineering.
  • Hands-on with AWS/Azure/GCP.
  • Experience managing Kubernetes/Docker/Helm/OpenShift.
  • CI/CD pipelines, GitOps, IaC (Terraform, Ansible).
  • Scripting: Python/Bash/Go.
  • Linux/Unix administration, networking, DNS, TCP/IP.
  • Observability platforms: Prometheus, Grafana, ELK, Splunk, Datadog, CloudWatch, Azure Monitor.
  • Incident management, RCA, SLO/SLI, capacity planning.
  • Microservices and cloud-native architectures.
  • DevSecOps, IAM, security best practices.

Responsibilities

  • Design, implement, and maintain highly available, scalable production systems using SRE best practices.
  • Define and improve SLIs/SLOs/SLAs and error budgets.
  • Manage cloud-native infrastructure across AWS, Azure, or GCP with focus on reliability.
  • Build and maintain CI/CD pipelines (Jenkins, GitLab CI, GitHub Actions, Azure DevOps, GitOps).
  • Automate infrastructure provisioning, deployments, monitoring, and operations using Terraform, Ansible, Python, Bash.
  • Manage Kubernetes-based platforms including cluster deployment, scaling, troubleshooting, upgrades, and workload optimization.
  • Implement observability solutions using Prometheus, Grafana, ELK, Splunk, Datadog, CloudWatch, Azure Monitor.
  • Monitor system health, analyze performance metrics, configure alerts, and identify reliability risks.
  • Lead incident response, production troubleshooting, RCA, and post-incident improvements.
  • Develop HA strategies, DR, fault tolerance, backup, and business continuity.
  • Collaborate with development, DevOps, security, and infra teams to improve delivery and reliability.
  • Implement DevSecOps including vulnerability management and security automation.
  • Maintain infra docs, runbooks, architecture diagrams, and SOPs.
  • Participate in on-call rotations and production support.
  • Mentor junior engineers and promote SRE culture.

Skills

SRE
DevOps
Cloud engineering
Kubernetes
CI/CD pipelines
Infrastructure as Code
Automation
Python scripting
Linux administration
Observability
Incident management
Microservices
Security / DevSecOps

Education

Bachelor's degree in Computer Science/IT/Engineering

Tools

Kubernetes
Docker
Helm
OpenShift
Terraform
Ansible
GitOps
Prometheus
Grafana
ELK Stack
Splunk
Datadog
CloudWatch
Azure Monitor

Job description

Role & responsibilities
  • Design, implement, and maintain highly available, scalable, and reliable production systems using SRE best practices.
  • Define and improve Service Level Indicators (SLIs), Service Level Objectives (SLOs), Service Level Agreements (SLAs), and error budget processes.
  • Manage cloud-native infrastructure across AWS, Azure, or GCP with focus on reliability, performance, and automation.
  • Build and maintain CI/CD pipelines using Jenkins, GitLab CI, GitHub Actions, Azure DevOps, and GitOps practices.
  • Automate infrastructure provisioning, deployments, monitoring, and operational workflows using Terraform, Ansible, Python, Bash, and other automation tools.
  • Manage Kubernetes-based platforms including cluster deployment, scaling, troubleshooting, upgrades, and workload optimization.
  • Implement observability solutions using Prometheus, Grafana, ELK Stack, Splunk, Datadog, CloudWatch, and Azure Monitor.
  • Monitor system health, analyze performance metrics, configure alerts, and proactively identify reliability risks.
  • Lead incident response, production troubleshooting, root cause analysis (RCA), and post-incident improvement initiatives.
  • Develop strategies for high availability, disaster recovery, fault tolerance, backup, and business continuity.
  • Optimize application and infrastructure performance, scalability, and cloud resource utilization.
  • Collaborate with development, DevOps, security, and infrastructure teams to improve software delivery and operational excellence.
  • Implement DevSecOps practices including vulnerability management, security automation, access controls, and compliance requirements.
  • Maintain infrastructure documentation, operational runbooks, architecture diagrams, and standard operating procedures.
  • Participate in on-call rotations and provide production support for critical business applications.
  • Mentor junior engineers and promote SRE culture, automation, and reliability engineering practices.

Preferred candidate profile
  • Bachelor's degree in Computer Science, Information Technology, Engineering, or a related discipline.
  • 5 to 10 years of experience in Site Reliability Engineering (SRE), DevOps, Cloud Engineering, or Production Engineering roles.
  • Strong hands‑on experience with AWS, Microsoft Azure, and/or Google Cloud Platform (GCP).
  • Proven experience managing Kubernetes, Docker, Helm, OpenShift, and containerized production environments.
  • Strong knowledge of CI/CD pipelines, GitOps, Infrastructure as Code (IaC), Terraform, Ansible, and automation frameworks.
  • Excellent scripting skills in Python, Bash, Shell, or Go for automation and operational tooling.
  • Strong understanding of Linux/Unix systems administration, networking, DNS, TCP/IP, HTTP, load balancing, and troubleshooting.
  • Experience with monitoring, logging, and observability platforms such as Prometheus, Grafana, ELK Stack, Splunk, Datadog, New Relic, CloudWatch, and Azure Monitor.
  • Strong knowledge of incident management, RCA, SLO/SLI implementation, capacity planning, performance optimization, and reliability engineering practices.
  • Experience with microservices architecture, cloud-native applications, service mesh technologies, and distributed systems.
  • Familiarity with DevSecOps, security best practices, IAM, vulnerability management, and compliance standards.
  • Strong analytical, troubleshooting, communication, and collaboration skills.
  • Experience working in Agile/Scrum environments with cross-functional engineering teams.

Preferred certifications
  • Certified Kubernetes Administrator (CKA)
  • AWS Certified DevOps Engineer Professional
  • AWS Solutions Architect
  • Microsoft Azure DevOps Engineer Expert
  • Google Professional Cloud DevOps Engineer
  • HashiCorp Terraform Associate
  • RHCE / LFCS
  • ITIL Foundation
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Head of Site Reliability Engineering (SRE)
Head of Site Reliability Engineering (SRE)

Client of Mark Williams • Dubai

On-site
AED 600,000 - 1,200,000
Site Reliability Engineer SRE
Site Reliability Engineer SRE

Dicetek LLC • Dubai

On-site
AED 300,000 - 520,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Epergne Solutions • Dubai

On-site
AED 200,000 - 300,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Epergne Solutions • Abu Dhabi

On-site
AED 180,000 - 250,000
Platform Engineer
Platform Engineer

Good co India • United Arab Emirates

On-site
AED 300,000 - 600,000
Senior DevOps Engineer
Senior DevOps Engineer

Good co India • United Arab Emirates

On-site
AED 240,000 - 420,000
Site Reliability Engineering Manager
Site Reliability Engineering Manager

Open Innovation AI • Abu Dhabi Emirate

On-site
AED 150,000 - 210,000
Senior DevOps / Site Reliability Engineer (SRE)
Senior DevOps / Site Reliability Engineer (SRE)

Stellar Technologies • Abu Dhabi

On-site
AED 360,000 - 540,000
Platform Site Reliability Engineer
Platform Site Reliability Engineer

Dicetek LLC • Abu Dhabi

Hybrid
AED 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

SUPERBOT (BOT) • Dubai

On-site
AED 350,000 - 520,000
Competitive compensation
Work visa processing assistance
Holiday bonuses
+1