SRE Engineer

Prodapt Solutions Private Limited

Chennai District

On-site

INR 1,800,000 - 3,000,000

Full time

9 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Prodapt Solutions Private Limited in Chennai is seeking a Site Reliability Engineer to design, build, and operate resilient, cloud-agnostic infrastructure and CI/CD pipelines across AWS, Azure, and GCP. You will emphasize automation, observability, and IaC to enable reliable deployments of applications and AI/data platforms.

You will have 5+ years in SRE/DevOps, strong Kubernetes experience, Terraform, and GitOps.

Qualifications

  • 5+ years in SRE/DevOps or Infrastructure Engineering.
  • Hands-on experience across at least two major cloud providers (AWS/Azure/GCP).
  • Strong IaC expertise (Terraform mandatory).
  • Deep Kubernetes knowledge in production environments.
  • Scripting skills in Python, Go or Bash.
  • End-to-end CI/CD pipeline experience and GitOps familiarity.
  • Solid networking fundamentals and observability tooling.

Responsibilities

  • Design, build, and maintain cloud-agnostic infrastructure with IaC across AWS, Azure, and GCP.
  • Build and manage multi-cloud CI/CD pipelines (GitHub Actions, GitLab CI, Jenkins, Azure DevOps, Cloud Build).
  • Define and implement SRE practices: SLIs/SLOs/SLAs, incident response, and on-call processes.
  • Set up monitoring, logging, and observability stacks (Prometheus, Grafana, Datadog, ELK/EFK).
  • Architect and manage Kubernetes clusters (EKS/AKS/GKE) and containerization (Docker).
  • Automate provisioning, scaling, patching, and configuration management (Ansible, Chef, Puppet).
  • Implement DR, RTO/RPO strategies, failover, and cost optimization across clouds.
  • Drive reliability improvements via RCA and blameless postmortems.
  • Ensure security/compliance: IAM, secrets, network security across clouds.

Skills

SRE experience
Multi-cloud
CI/CD knowledge
Networking basics
Scripting (Python/Go/Bash)
GitOps practices

Tools

Terraform
Pulumi
Ansible
Chef/Puppet
Kubernetes
GitHub Actions
GitLab CI
Jenkins
Azure DevOps
Cloud Build
Prometheus
Grafana
Datadog
ELK/EFK
Istio/Linkerd
ArgoCD
FluxCD

Job description

Overview

We are looking for a Site Reliability Engineer who can design, build, and operate resilient infrastructure and CI/CD pipelines across multiple cloud platforms (AWS, Azure, GCP). This role is central to enabling reliable, scalable, and secure deployment of applications and AI/data platforms, with a strong focus on automation, observability, and infrastructure-as-code across heterogeneous cloud environments.

Site Reliability Engineer (Multi-Cloud Infrastructure & Pipelines)

Role Title: Site Reliability Engineer (SRE) – Multi-Cloud Infrastructure & CI/CD
Domain: Cloud Infrastructure, DevOps/SRE, Platform Engineering

Key Responsibilities
  • Design, build, and maintain cloud-agnostic infrastructure using Infrastructure-as-Code (Terraform, Pulumi, or equivalent) across AWS, Azure, and GCP
  • Build and manage CI/CD pipelines (GitHub Actions, GitLab CI, Jenkins, Azure DevOps, Cloud Build) supporting multi-cloud deployments
  • Define and implement SRE practices: SLIs/SLOs/SLAs, error budgets, incident response, and on-call processes
  • Set up monitoring, logging, and observability stacks (Prometheus, Grafana, Datadog, Cloud Monitoring/Stackdriver, ELK/EFK) across environments
  • Architect and manage container orchestration platforms (Kubernetes — EKS/AKS/GKE) and containerization (Docker) for portable, cloud-agnostic workloads
  • Automate provisioning, scaling, patching, and configuration management (Ansible, Chef, or Puppet as needed)
  • Implement disaster recovery, backup, high-availability, and multi-region/multi-cloud failover strategies
  • Drive cost optimization and capacity planning across cloud providers
  • Build self-healing systems and automate incident remediation to reduce toil
  • Conduct root cause analysis (RCA) and post-incident reviews; drive reliability improvements
  • Implement security best practices: IAM policies, secrets management (Vault, Cloud KMS), network security, and compliance guardrails across clouds
  • Collaborate with development teams to embed reliability, observability, and deployment best practices into the software delivery lifecycle (DevSecOps/shift-left)
  • Support migration or workload portability initiatives between cloud providers or hybrid/on-prem environments
Required Skills & Experience
  • 5+ years of experience in SRE, DevOps, or Infrastructure Engineering roles
  • Proven hands-on experience across at least two of the three major cloud providers (AWS, Azure, GCP) — true multi-cloud experience strongly preferred
  • Strong expertise in Infrastructure-as-Code (Terraform mandatory; CloudFormation/Bicep/Pulumi a plus)
  • Deep knowledge of Kubernetes and container orchestration in production environments
  • Strong scripting/programming skills (Python, Go, or Bash)
  • Experience building and maintaining CI/CD pipelines end-to-end (build, test, deploy, rollback)
  • Solid understanding of networking fundamentals (VPCs, load balancers, DNS, service mesh — Istio/Linkerd a plus)
  • Experience with observability and monitoring tooling, and setting up alerting that ties to meaningful SLOs
  • Familiarity with GitOps practices (ArgoCD, FluxCD)
  • Strong incident management experience — triage, escalation, blameless postmortems
  • Understanding of security and compliance requirements in cloud environments (encryption, IAM, network segmentation)
Preferred Qualifications
  • Cloud certifications across multiple providers (e.g., AWS Solutions Architect/SysOps, Azure Administrator/DevOps Engineer, GCP Professional Cloud DevOps Engineer)
  • Certified Kubernetes Administrator (CKA) or CKAD
  • Experience with service mesh, API gateways, and edge/CDN configuration
  • Experience supporting AI/ML or data platform infrastructure (GPU provisioning, vector databases, model serving infra)
  • Prior experience in telecom, enterprise SaaS, or large-scale regulated environments
  • Familiarity with FinOps practices for multi-cloud cost governance
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer
Senior Site Reliability Engineer

UST • Pune District

On-site
INR 1,800,000 - 3,000,000
Site Reliability Engineer
Site Reliability Engineer

WorkSpan • Bengaluru

On-site
INR 2,200,000 - 3,600,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Zorba AI • Chennai District

On-site
INR 1,200,000 - 2,400,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

NCR Voyix • Chennai District

On-site
INR 3,000,000 - 5,400,000
Site Reliability Engineer (SRE) – Core IT Infrastructure
Site Reliability Engineer (SRE) – Core IT Infrastructure

TECEZE • Chennai District

On-site
INR 1,000,000 - 2,000,000
SRE - AWS, GCP & Azure
SRE - AWS, GCP & Azure

PibyThree • Navi Mumbai

On-site
INR 1,200,000 - 1,800,000
SRE - AWS, GCP & Azure
SRE - AWS, GCP & Azure

PibyThree • Thane

On-site
INR 1,200,000 - 1,500,000
Senior SRE Engineer
Senior SRE Engineer

EPAM Systems India Pvt Ltd • Chennai District

On-site
INR 1,800,000 - 3,200,000
Site Reliability Engineer
Site Reliability Engineer

Innodata Inc. • India

On-site
INR 2,400,000 - 4,000,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Falabella India • Bengaluru

On-site
INR 4,000,000 - 7,000,000