Site Reliability Engineer (SRE) – AI & Cloud Infrastructure

TeamPlus Staffing Solution Pvt Ltd

Pune District

On-site

INR 1,800,000 - 3,200,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

TeamPlus Staffing Solution Pvt Ltd is seeking an experienced Cloud Infrastructure Engineer to design, implement, and manage scalable AWS infrastructure with a focus on observability and reliability.

The role emphasizes building end-to-end observability, AI-enabled incident triage, and automated workflows using Terraform/CloudFormation and CI/CD pipelines. Strong scripting skills and cost optimization experience are essential.

Qualifications

  • Experience designing and managing scalable, secure cloud infra on AWS.
  • Build and maintain observability platforms using OpenTelemetry, Grafana, Datadog, CloudWatch.
  • Experience with AIOps including incident triage, RCA, and anomaly detection.
  • Lead production incident management, on-call, postmortems, and RCA.
  • Automate workloads using Terraform/CloudFormation and CI/CD pipelines.
  • Drive infrastructure rightsizing, capacity planning, and cloud cost optimization.
  • Build dashboards, SLOs, SLIs, and error budgets for reliability.
  • Develop automation scripts using Python, Bash, or Go.

Responsibilities

  • Design, implement, and manage highly available, scalable cloud infrastructure on AWS.
  • Lead production incident management, on-call response, postmortems, and RCA.
  • Build dashboards, SLOs, SLIs, and error budgets to improve service reliability.
  • Automate operational workflows using IaC and CI/CD pipelines.
  • Monitor application and infrastructure health to ensure high uptime and performance.

Skills

Cloud architecture
Observability platform
AIOps
Incident management
IaC automation
CI/CD
Cost optimization
Scripting (Python/Bash/Go)
Monitoring and alerting

Tools

Terraform
CloudFormation
OpenTelemetry
Grafana
Datadog
CloudWatch

Job description

  • Years of Experience 5–8 Years
  • Design, implement, and manage highly available, scalable, and secure cloud infrastructure on AWS.
  • Build and maintain an end-to-end observability platform using OpenTelemetry, Grafana, Datadog, CloudWatch, and related tools.
  • Implement AIOps capabilities, including:
  • LLM-assisted incident triage
  • AI-powered root cause analysis
  • ML-driven forecasting and anomaly detection
  • Intelligent alert correlation and noise reduction
  • Lead production incident management, on-call response, postmortems, and Root Cause Analysis (RCA).
  • Automate operational workflows using Infrastructure as Code (Terraform/CloudFormation) and CI/CD pipelines.
  • Drive infrastructure rightsizing, capacity planning, utilization analysis, and cloud cost optimization.
  • Build dashboards, SLOs, SLIs, and error budgets to improve service reliability.
  • Develop automation scripts using Python, Bash, or Go to eliminate manual operational tasks.
  • Monitor application and infrastructure health while ensuring high uptime and service performance.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

SourcingXPress • Maharashtra

On-site
INR 700,000 - 1,800,000
Site Reliability Engineer (SRE) – Core IT Infrastructure
Site Reliability Engineer (SRE) – Core IT Infrastructure

TECEZE • Chennai District

On-site
INR 1,000,000 - 2,000,000
Senior Site Reliability Engineer (SRE)
Senior Site Reliability Engineer (SRE)

Lonvec Technologies Private Limited • Hyderabad

On-site
INR 3,000,000 - 5,000,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Unified Consultancy Services • Karnataka

Hybrid
INR 1,500,000 - 3,000,000
SRE Engineer
SRE Engineer

Prodapt Solutions Private Limited • Chennai District

On-site
INR 1,800,000 - 3,000,000
Site Reliability Engineer
Site Reliability Engineer

Snapmint • Gurugram District

On-site
INR 800,000 - 1,200,000
Site Reliability Engineering (SRE)
Site Reliability Engineering (SRE)

Lyzr AI • Bengaluru

Hybrid
INR 1,000,000 - 2,000,000
Senior Cloud Site Reliability Engineer
Senior Cloud Site Reliability Engineer

Augusta Infotech • Bengaluru

Hybrid
INR 1,500,000 - 2,500,000
Site Reliability Engineer
Site Reliability Engineer

Lorven Technologies Inc. • Telangana

On-site
INR 1,400,000 - 2,400,000
Site Reliability Engineer
Site Reliability Engineer

SourcingXPress • Mumbai

On-site
INR 800,000 - 1,200,000