Senior Enterprise SRE: Reliability & Observability

Trigint Solutions LLC

Atlanta (GA)

Hybrid

USD 124,000 - 220,000

Full time

6 hours ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Trigint Solutions LLC in Atlanta seeks an experienced Enterprise Site Reliability Engineer to advance reliability, observability, and automation across the organization. This hands-on role spans SRE, cloud, platform, security, and IT domains, requiring strong engineering judgment and the ability to influence practices beyond direct authority.

You will lead incident investigations, design end-to-end observability, develop production-grade automation, and translate data into actionable roadmaps.

Qualifications

  • 8+ years of experience in Site Reliability Engineering, Production Engineering, Platform Engineering, or software engineering for large-scale production systems.
  • Deep knowledge of SRE principles, operational excellence, distributed systems, microservices, APIs, and cloud-native architecture.
  • Deep hands-on experience architecting, operating, and troubleshooting large-scale AWS environments across compute, containers, serverless, networking, databases, storage, identity, and cloud observability.
  • Strong hands-on experience with Kubernetes and Red Hat OpenShift Service on AWS (ROSA) architecture, operations, performance, and troubleshooting.
  • Strong experience with OpenTelemetry, distributed tracing, logs, metrics, events, and Dynatrace or a comparable enterprise observability platform.
  • Experience defining and operationalizing SLIs, SLOs, error budgets, production readiness criteria, and reliability scorecards.
  • Demonstrated ability to assess application architecture and operational maturity from observability, reliability, resilience, and operability perspectives.
  • Strong software development skills in Python, Java, Go, JavaScript/TypeScript, or similar languages.

Responsibilities

  • Define and advance enterprise SRE standards for SLIs, SLOs, error budgets, production readiness, incident management, and operational excellence.
  • Establish practical observability standards for OpenTelemetry, traces, logs, metrics, events, telemetry correlation, tagging, data quality, and service ownership.
  • Conduct thorough application maturity assessments across observability, reliability, resilience, operability, automation, and incident readiness.
  • Analyze application architecture and production operations to uncover dependencies, failure modes, capacity constraints, performance bottlenecks, and risks that may not be immediately visible.
  • Connect technical and operational findings to customer experience, business impact, service risk, and investment priorities.
  • Translate assessments and operational data into clear, prioritized, and measurable improvement roadmaps.
  • Influence architecture and engineering decisions by recommending reliability patterns such as fault isolation, graceful degradation, circuit breakers, retries, rate limiting, load shedding, high availability, and disaster recovery.
  • Design end-to-end observability across distributed services, APIs, business transactions, customer journeys, cloud platforms, and cross-domain dependencies.
  • Develop production-grade automation, applications, APIs, and integrations that reduce toil, improve consistency, and scale reliability practices across the enterprise.
  • Automate service onboarding, telemetry validation, SLO reporting, production readiness checks, incident enrichment, and remediation workflows.
  • Integrate observability, cloud, CI/CD, IT service management, incident management, and configuration platforms using APIs, SDKs, webhooks, and event-driven patterns.
  • Lead complex incident investigations and post-incident reviews, challenge assumptions, identify contributing factors, and drive corrective actions through completion.
  • Analyze operational and observability data to detect patterns, quantify risks, identify systemic gaps, and generate actionable insights for engineers and leaders.
  • Proactively identify opportunities to improve application operability, resilience, telemetry, support readiness, and operational processes before issues affect customers.
  • Define observability for AI agents and AI-enabled applications, including workflows, model and tool interactions, dependencies, latency, failures, quality, token consumption, cost, and reliability.
  • Use AI-assisted engineering tools such as Kiro, GitHub Copilot, and AI agents to accelerate development, incident analysis, correlation, pattern detection, and operational insights.
  • Develop reusable reference architectures, engineering patterns, assessment frameworks, maturity models, scorecards, and implementation guidance.
  • Work with SREs and engineering teams across the organization to resolve cross-domain reliability issues and promote consistent practices.
  • Mentor engineers, facilitate difficult technical decisions, constructively challenge existing approaches, and build alignment across teams.
  • Communicate complex technical risks, business impact, recommendations, and progress clearly to engineering teams and senior leadership.

Skills

SRE Principles
Observability
Incident Leadership
Automation
Cloud-Native

Tools

Kubernetes
ROSA
OpenTelemetry
Dynatrace
AWS
REST APIs
Git
CI/CD
IaC

Job description

Trigint Solutions LLC in Atlanta seeks an experienced Enterprise Site Reliability Engineer to advance reliability, observability, and automation across the organization. This hands-on role spans SRE, cloud, platform, security, and IT domains, requiring strong engineering judgment and the ability to influence practices beyond direct authority.

You will lead incident investigations, design end-to-end observability, develop production-grade automation, and translate data into actionable roadmaps.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior SRE: Reliability & Observability Lead
Senior SRE: Reliability & Observability Lead

Inspire • Atlanta (GA)

On-site
USD 140,000 - 200,000
Senior SRE Lead: Reliability, Automation & Observability
Senior SRE Lead: Reliability, Automation & Observability

Truist • Charlotte (NC)

On-site
USD 140,000 - 190,000
Medical, dental, vision
401k plan
Paid time off
Lead SRE - Build End-to-End Observability
Lead SRE - Build End-to-End Observability

TrulyHired • Atlanta (GA)

On-site
USD 140,000 - 190,000
Medical insurance
401k match
PTO
Senior SRE: Reliability, Automation & Incidents
Senior SRE: Reliability, Automation & Incidents

Truist • Charlotte (NC)

On-site
USD 140,000 - 180,000
Medical insurance
Dental insurance
Vision insurance
+2
Senior SRE Lead: Reliability, Automation & Incidents
Senior SRE Lead: Reliability, Automation & Incidents

Truist • Atlanta (GA)

On-site
USD 150,000 - 190,000
Senior SRE: Automation & Incidents Leader
Senior SRE: Automation & Incidents Leader

Truist • Raleigh (NC)

On-site
USD 120,000 - 180,000
Medical insurance
Dental insurance
Vision insurance
+7
Senior SRE Lead: Reliability & Automation
Senior SRE Lead: Reliability & Automation

Truist • Raleigh (NC)

On-site
USD 130,000 - 180,000
Senior Site Reliability Engineer: Build Resilient Systems
Senior Site Reliability Engineer: Build Resilient Systems

IRB USA Inspire Resources • Atlanta (GA)

On-site
USD 130,000 - 180,000
Sr. Site Reliability Engineer(Local to Atlanta GA Only)
Sr. Site Reliability Engineer(Local to Atlanta GA Only)

Trigint Solutions LLC • Atlanta (GA)

Hybrid
USD 124,000 - 220,000
Senior SRE - Hybrid, Observability & Reliability
Senior SRE - Hybrid, Observability & Reliability

Early Warning Services LLC • Chicago (IL)

Hybrid
USD 106,000 - 130,000
Healthcare Coverage
401(k) Plan with match
PTO and Holidays
+1