Senior SRE: Kubernetes, Java & Observability

Creative Solutions Services, LLC

Atlanta (GA)

On-site

USD 120,000 - 160,000

Full time

10 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

NTT DATA’s client is seeking an experienced Technology Consultant – Site Reliability Engineer (SRE) to enhance production reliability for enterprise applications. You will work with application engineering, DevOps, cloud, and infrastructure teams to boost availability, scalability, performance, and operational efficiency.

Responsibilities include troubleshooting Kubernetes deployments, implementing observability solutions, supporting Java/Spring Boot microservices, and driving automation to

Qualifications

  • 6+ years of experience in Site Reliability Engineering, DevOps, or Production Engineering/Support.
  • 4+ years of hands-on experience with Kubernetes, Docker, and containerized application environments.
  • 4+ years of experience with Java, Spring Boot, Microservices, and REST APIs.
  • 3+ years of experience with observability and monitoring tools such as Splunk, Dynatrace, Prometheus, Grafana, Datadog, or ELK.

Responsibilities

  • Manage and support business-critical applications running on Kubernetes and containerized platforms.
  • Monitor application and platform health and proactively identify reliability, availability, and performance issues.
  • Troubleshoot Kubernetes deployments, pods, services, networking, configurations, and application issues.
  • Implement and enhance observability solutions covering metrics, logs, traces, dashboards, and alerting.
  • Support and troubleshoot Java/Spring Boot and Microservices-based applications.
  • Perform root cause analysis (RCA) for critical production incidents and implement permanent corrective actions.
  • Define and monitor SLIs, SLOs, SLAs, Error Budgets, and other reliability metrics.
  • Automate repetitive operational activities and identify opportunities to reduce operational TOIL.
  • Participate in incident, problem, change, and production release management activities.
  • Collaborate with engineering teams to improve application resilience, performance, scalability, and fault tolerance.
  • Support CI/CD pipelines and improve application deployment and release processes.
  • Participate in capacity planning, performance tuning, disaster recovery, and production readiness reviews.
  • Develop and maintain operational runbooks, troubleshooting procedures, and technical documentation.

Skills

Site Reliability Engineering
DevOps
Automation
Production Engineering

Tools

Kubernetes
Docker
Java
Spring Boot
Microservices
REST APIs
Splunk
Dynatrace
Prometheus
Grafana
Datadog
ELK
Helm
AWS
Azure
GCP
Linux
Shell scripting
Kafka
Terraform
Ansible
Jenkins
GitHub Actions
GitLab CI
Azure DevOps

Job description

NTT DATA’s client is seeking an experienced Technology Consultant – Site Reliability Engineer (SRE) to enhance production reliability for enterprise applications. You will work with application engineering, DevOps, cloud, and infrastructure teams to boost availability, scalability, performance, and operational efficiency.

Responsibilities include troubleshooting Kubernetes deployments, implementing observability solutions, supporting Java/Spring Boot microservices, and driving automation to

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Technology Consultant - Site Reliability Engineer (SRE)
Technology Consultant - Site Reliability Engineer (SRE)

Creative Solutions Services, LLC • Atlanta (GA)

On-site
USD 120,000 - 160,000
Senior SRE: Cloud, Kubernetes & 24x7 Reliability Lead
Senior SRE: Cloud, Kubernetes & 24x7 Reliability Lead

NTT DATA, Inc. • Baltimore (MD)

On-site
USD 88,000 - 110,000
Senior SRE - Dynatrace & Observability Platform
Senior SRE - Dynatrace & Observability Platform

Tech Mirrors • Jersey City (NJ)

On-site
Senior SRE Engineer: Java Microservices & Observability
Senior SRE Engineer: Java Microservices & Observability

Tech Mirrors • Buffalo (NY)

On-site
USD 120,000 - 150,000
Senior SRE: Incident & Kubernetes Reliability Lead
Senior SRE: Incident & Kubernetes Reliability Lead

Unique System Skills • United States

Remote
USD 140,000 - 190,000
Senior SRE: Observability & Automation Lead
Senior SRE: Observability & Automation Lead

ISO New England Inc. • Holyoke (MA)

Hybrid
USD 134,000 - 170,000
Enhanced 401(k) and financial planning
Tuition reimbursement and professional
Onsite gym and wellness programs
+4
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

JPS Tech Solutions • Colorado

On-site
USD 160,000 - 230,000
Remote SRE Engineer — Scale, CI/CD & Cloud Ops
Remote SRE Engineer — Scale, CI/CD & Cloud Ops

NTT DATA, Inc. • Memphis (TN)

Remote
USD 87,000 - 151,000
Medical insurance
Dental insurance
Vision insurance
+3
Java & SRE Platform Reliability Engineer
Java & SRE Platform Reliability Engineer

TechDigital Group • Phoenix (AZ)

On-site
USD 120,000 - 170,000
Site Reliability Engineer -Jersey City, NJ & Dallas, TX
Site Reliability Engineer -Jersey City, NJ & Dallas, TX

StradIT • Dallas (TX)

Hybrid
USD 140,000 - 180,000