SRE Engineer

Tata Consultancy Services

Englewood Cliffs (NJ)

On-site

USD 110,000 - 125,000

Full time

3 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Tata Consultancy Services is seeking an experienced Site Reliability Engineer to design, implement, and maintain highly available production systems in a cloud environment. The role emphasizes automation with Shell, Python, Ansible, or Terraform and strong Linux skills.

You will manage AWS services (EC2, RDS, S3, IAM, VPC, CloudWatch) and drive monitoring with Grafana/Prometheus. Collaboration with development, QA, and support teams is essential to improve reliability and deployment processes.

Qualifications

  • 6-7 years of experience in Site Reliability Engineering, Production Support, DevOps, or Infrastructure Operations.
  • Strong understanding of Linux administration and troubleshooting.
  • Hands-on experience with AWS cloud services (EC2, RDS, IAM, VPC, CloudWatch, S3).
  • Experience with monitoring, alerting, and observability tools.
  • Knowledge of incident management, problem management, and RCA processes.
  • Experience with automation and scripting using Shell and/or Python.
  • Working knowledge of PostgreSQL and MySQL databases.
  • Experience with Git version control.
  • Understanding of CI/CD concepts and tools such as Jenkins.

Responsibilities

  • Design, implement, and maintain highly available and reliable production systems.
  • Automate operational tasks and infrastructure management using Shell, Python, Ansible, or Terraform.
  • Manage and support AWS services including EC2, RDS, S3, IAM, VPC, CloudWatch, and related cloud services.
  • Perform Linux server administration, troubleshooting, patching, and performance tuning.
  • Monitor application and infrastructure health using Grafana, Prometheus, CloudWatch, Datadog, Splunk.
  • Participate in incident management, root cause analysis (RCA), and problem management activities.
  • Define and maintain SLIs, SLOs, and SLAs to ensure service reliability.
  • Support PostgreSQL and MySQL databases for operational and basic administration tasks.
  • Collaborate with development, QA, cloud, and support teams to improve system reliability and deployment processes.
  • Drive automation, observability, capacity planning, security, and operational best practices.
  • Participate in on-call support and production issue resolution.

Skills

SRE
DevOps
Linux administration
Python scripting
Shell scripting
AWS cloud services
Monitoring & observability
Incident management
CI/CD concepts

Tools

Terraform
Ansible
Jenkins
Git
Docker
Grafana
Prometheus
CloudWatch
Datadog
Splunk

Job description

Job Description
Must Have Technical/Functional Skills
  • 6-7 years of experience in Site Reliability Engineering, Production Support, DevOps, or Infrastructure Operations.
  • Strong understanding of Linux administration and troubleshooting.
  • Hands-on experience with AWS cloud services (EC2, RDS, IAM, VPC, CloudWatch, S3).
  • Experience with monitoring, alerting, and observability tools.
  • Knowledge of incident management, problem management, and RCA processes.
  • Experience with automation and scripting using Shell and/or Python.
  • Working knowledge of PostgreSQL and MySQL databases.
  • Experience with Git version control.
  • Understanding of CI/CD concepts and tools such as Jenkins.
Roles & Responsibilities
  • Design, implement, and maintain highly available and reliable production systems.
  • Automate operational tasks and infrastructure management using Shell, Python, Ansible, or Terraform.
  • Manage and support AWS services including EC2, RDS, S3, IAM, VPC, CloudWatch, and related cloud services.
  • Perform Linux server administration, troubleshooting, patching, and performance tuning.
  • Monitor application and infrastructure health using tools such as Grafana, Prometheus, CloudWatch, Datadog, Splunk.
  • Participate in incident management, root cause analysis (RCA), and problem management activities.
  • Define and maintain SLIs, SLOs, and SLAs to ensure service reliability.
  • Support PostgreSQL and MySQL databases for operational and basic administration tasks.
  • Collaborate with development, QA, cloud, and support teams to improve system reliability and deployment processes.
  • Drive automation, observability, capacity planning, security, and operational best practices.
  • Participate in on-call support and production issue resolution.

Salary Range: $110,000-$125,000 a year

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Knack Solutions • Reston (VA)

On-site
USD 120,000 - 160,000
SRE - Site Reliability Engineer - Senior
SRE - Site Reliability Engineer - Senior

ManpowerGroup Global, Inc. • Austin (TX)

On-site
USD 66,000 - 90,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Pyramid Consulting, Inc • United States

Remote
MXN 420,000 - 640,000
Sr SRE Automation Engineer
Sr SRE Automation Engineer

Compunnel, Inc. • Austin (TX), Northern (KY)

Hybrid
USD 130,000 - 180,000
SRE Manager
SRE Manager

Mphasis • New Jersey

On-site
USD 170,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

JobCubby • Barrington (RI), Northern (KY)

On-site
USD 110,000 - 170,000
Site Reliability Engineering (SRE)
Site Reliability Engineering (SRE)

Weekday (YC W21) • New York (NY)

On-site
USD 150,000 - 250,000
Health, dental, vision insurance
Generous PTO
Learning & development
+2
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Methodic • San Francisco (CA)

On-site
USD 140,000 - 210,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

myBridge Corporation • Austin (TX)

On-site
USD 120,000 - 160,000