Site Reliability Engineer (SRE) – Core IT Infrastructure

TECEZE

Chennai District

On-site

INR 1,000,000 - 2,000,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

A leading technology firm in Chennai is looking for a Site Reliability Engineer (SRE) to enhance core IT infrastructure reliability. The successful candidate will design and maintain highly available systems while collaborating on automation and security efforts. A strong background in Linux/Unix administration, programming (Python, Go), and cloud platforms (AWS, Azure) is essential. This full-time role requires 6+ years of experience, addressing infrastructure reliability, operational automation, and performance monitoring.

Qualifications

  • 6+ years of experience in IT infrastructure or related field.
  • Strong problem-solving skills and ability to work under pressure.

Responsibilities

  • Design, implement, and maintain high availability & fault-tolerant infrastructure.
  • Lead incident response and root cause analysis (RCA).
  • Develop automation tools and scripts to reduce manual operations.
  • Build self-healing systems and automate operational tasks.
  • Design and maintain monitoring, logging, and alerting systems.
  • Implement infrastructure security best practices.

Skills

Linux/Unix system administration
Programming or scripting (Python, Go, Bash, Shell)
Cloud platforms (AWS, Azure, GCP)
Containerization and orchestration
Networking concepts (DNS, TCP/IP, load balancing, firewalls)
Monitoring, logging, and alerting tools

Tools

Terraform
Ansible
Docker
Kubernetes
Prometheus
Grafana
ELK
Datadog

Job description

Overview

Role: Site Reliability Engineer (SRE) – Core IT Infrastructure

Work mode: On-site (full Time)

Experience: 6+ year's

Responsibilities
  • Infrastructure Reliability & Operations
    • Design, implement, and maintain highly available and fault-tolerant infrastructure
    • Ensure reliability, performance, scalability, and security of core IT systems
    • Monitor system health, capacity, and performance using proactive observability practices
    • Lead incident response, root cause analysis (RCA), and post-incident reviews
  • Automation & SRE Development
    • Develop and maintain automation tools, scripts, and frameworks to reduce manual operations
    • Apply Infrastructure as Code (IaC) principles using tools such as Terraform, Ansible, or CloudFormation
    • Build self-healing systems and automate repetitive operational tasks
    • Improve deployment pipelines and operational workflows through engineering solutions
    • Collaborate with DevOps, development, and security teams to support CI/CD pipelines
    • Enable seamless application deployments with minimal downtime
    • Support containerized and orchestration platforms (Docker, Kubernetes, OpenShift)
    • Implement best practices for configuration management and environment consistency
  • Monitoring, Observability & Performance
    • Design and maintain monitoring, logging, and alerting systems
    • Define and track SLIs, SLOs, and SLAs
    • Optimize system performance, capacity planning, and cost efficiency
    • Enhance observability using tools such as Prometheus, Grafana, ELK, Datadog, or similar
  • Security & Compliance
    • Implement infrastructure security best practices
    • Collaborate with security teams on vulnerability management and compliance requirements
    • Ensure secure access, identity management, and audit readiness
Required Skills & Qualifications

Technical Skills

  • Strong experience in Linux/Unix system administration
  • Proficiency in programming/scripting (Python, Go, Bash, Shell, or similar)
  • Experience with cloud platforms (AWS, Azure, or GCP)
  • Hands-on experience with containerization and orchestration
  • Knowledge of networking concepts (DNS, TCP/IP, load balancing, firewalls)
  • Experience with monitoring, logging, and alerting tools
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

InOpTra Digital • Bengaluru

On-site
INR 1,200,000 - 2,000,000
SRE Engineer
SRE Engineer

Prodapt Solutions Private Limited • Chennai District

On-site
INR 1,800,000 - 3,000,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Unified Consultancy Services • Karnataka

Hybrid
INR 1,500,000 - 3,000,000
Site Reliability Engineer
Site Reliability Engineer

Tekskills • Pune District

On-site
INR 1,200,000 - 1,800,000
Restaurant d'entreprise
Indemnités de stage/alternance
Site Reliability Engineer
Site Reliability Engineer

Tekskills • Chennai District

On-site
INR 1,800,000 - 3,000,000
Site Reliability Engineering Lead
Site Reliability Engineering Lead

Infosys • Hyderabad

On-site
INR 1,200,000 - 1,800,000
Senior Site Reliability Engineer (SRE)
Senior Site Reliability Engineer (SRE)

Lonvec Technologies Private Limited • Hyderabad

On-site
INR 3,000,000 - 5,000,000
Site Reliability Engineer
Site Reliability Engineer

Tekskills • Bengaluru

On-site
INR 1,500,000 - 2,500,000
Site Reliability Engineering (SRE)
Site Reliability Engineering (SRE)

Lyzr AI • Bengaluru

Hybrid
INR 1,000,000 - 2,000,000
SRE - AWS, GCP & Azure
SRE - AWS, GCP & Azure

PibyThree • Navi Mumbai

On-site
INR 1,200,000 - 1,800,000