Senior SRE Consultant: Kubernetes & Observability

NTT DATA North America

Atlanta (GA)

On-site

USD 140,000 - 180,000

Full time

10 days ago
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

NTT DATA North America is seeking an experienced Technology Consultant - Site Reliability Engineer (SRE) to enhance reliability of distributed enterprise applications. You will collaborate across engineering, DevOps, cloud, and support teams to improve availability, scalability, and efficiency.

Responsibilities include managing Kubernetes-based apps, implementing observability, troubleshooting production issues, and driving automation to reduce toil.

Qualifications

  • 6+ years of experience in Site Reliability Engineering, DevOps, or Production Engineering/Support.
  • 4+ years of hands-on experience with Kubernetes, Docker, and containerized applications.
  • 4+ years of experience with Java, Spring Boot, Microservices, and REST APIs.
  • 3+ years of experience with observability and monitoring tools such as Splunk, Dynatrace, Prometheus, Grafana, Datadog, or ELK.

Responsibilities

  • Manage and support business-critical applications running on Kubernetes and containerized platforms.
  • Monitor application and platform health and proactively identify reliability, availability, and performance issues.
  • Troubleshoot Kubernetes deployments, pods, services, networking, configurations, and application issues.
  • Implement and enhance observability solutions covering metrics, logs, traces, dashboards, and alerting.
  • Support and troubleshoot Java/Spring Boot and Microservices-based applications.
  • Perform root cause analysis (RCA) for critical production incidents and implement permanent corrective actions.
  • Define and monitor SLIs, SLOs, SLAs, Error Budgets, and other reliability metrics.
  • Automate repetitive operational activities and identify opportunities to reduce operational TOIL.
  • Participate in incident, problem, change, and production release management activities.
  • Collaborate with engineering teams to improve application resilience, performance, scalability, and fault tolerance.
  • Support CI/CD pipelines and improve application deployment and release processes.
  • Participate in capacity planning, performance tuning, disaster recovery, and production readiness reviews.
  • Develop and maintain operational runbooks, troubleshooting procedures, and technical documentation.

Skills

Site Reliability
DevOps
Production Engineering
Problem solving

Tools

Kubernetes
Docker
Prometheus
Grafana
Splunk
Dynatrace
Datadog
ELK

Job description

NTT DATA North America is seeking an experienced Technology Consultant - Site Reliability Engineer (SRE) to enhance reliability of distributed enterprise applications. You will collaborate across engineering, DevOps, cloud, and support teams to improve availability, scalability, and efficiency.

Responsibilities include managing Kubernetes-based apps, implementing observability, troubleshooting production issues, and driving automation to reduce toil.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE: Kubernetes, Java & Observability
Senior SRE: Kubernetes, Java & Observability

Creative Solutions Services, LLC • Atlanta (GA)

On-site
USD 120,000 - 160,000
Technology Consultant - Site Reliability Engineer (SRE)
Technology Consultant - Site Reliability Engineer (SRE)

Creative Solutions Services, LLC • Atlanta (GA)

On-site
USD 120,000 - 160,000
Technology Consultant - Site Reliability Engineer (SRE)
Technology Consultant - Site Reliability Engineer (SRE)

NTT DATA North America • Atlanta (GA)

On-site
USD 140,000 - 180,000
Remote SRE Engineer — Scale, CI/CD & Cloud Ops
Remote SRE Engineer — Scale, CI/CD & Cloud Ops

NTT DATA, Inc. • Memphis (TN)

Remote
USD 87,000 - 151,000
Medical insurance
Dental insurance
Vision insurance
+3
Senior SRE Engineer - Observability & Resiliency
Senior SRE Engineer - Observability & Resiliency

Remitly • Seattle (WA), Northern (KY)

Hybrid
USD 180,000 - 225,000
Flexible PTO
Health / Dental / Vision
401k matching
+4
Observability & SRE Engineer — Cloud, Kubernetes, & Automation
Observability & SRE Engineer — Cloud, Kubernetes, & Automation

Ontrac Solutions • Arizona

Hybrid
USD 140,000 - 190,000
Verification cost reimbursement
Hybrid Site Reliability Engineer — Observability & CI/CD Lead
Hybrid Site Reliability Engineer — Observability & CI/CD Lead

NTT DATA, Inc. • Plano (TX)

Hybrid
USD 96,800 - 145,200
Medical, dental, and vision insurance
Flexible spending or health savings account
401(k) program with company match
Remote Site Reliability Engineer: CI/CD, Kubernetes & Automation
Remote Site Reliability Engineer: CI/CD, Kubernetes & Automation

NTT DATA North America • Memphis (TN)

On-site
USD 87,000 - 151,000
Health insurance
Dental and vision insurance
401k with company match
+5
Remote Senior Network Reliability Engineer (SRE)
Remote Senior Network Reliability Engineer (SRE)

Gainbridge • Zionsville (IN), Northern (KY)

On-site
USD 135,000 - 190,000
Health Insurance
Dental Insurance
Vision Insurance
+4
Senior SRE: Observability & Automation Lead
Senior SRE: Observability & Automation Lead

ISO New England Inc. • Holyoke (MA)

Hybrid
USD 134,000 - 170,000
Enhanced 401(k) and financial planning
Tuition reimbursement and professional
Onsite gym and wellness programs
+4