Senior SRE: Cloud Reliability, Observability Lead

CentralReach

Fort Lauderdale (FL)

Hybrid

USD 160,000 - 180,000

Full time

2 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Hybrid work model
Health benefits
PTO & 401(k) matching
Parental leave

Job summary

CentralReach is seeking a Senior Site Reliability Engineer to own production reliability across multi-environment platforms in a hybrid Ft. Lauderdale setting.

You will drive SLOs, incident response, and capacity planning while partnering with Software Engineering to ensure high availability. Key focus areas include building observability dashboards, automating runtime improvements, and implementing modern reliability practices across AWS and containerized environments using Kubernetes, Helm,

Qualifications

  • Experience with monitoring, APM, and observability tools such as Splunk, Prometheus, Datadog, and OpenTelemetry.
  • Experience implementing observability strategies for logs, metrics, and traces.
  • Strong understanding of CI/CD practices and tools like Jenkins, GitHub Actions, GitLab, Argo, and Kargo.
  • Strong understanding of major cloud providers, preferably AWS, and cloud-native infrastructure concepts.
  • Strong understanding of containerization technologies, including Kubernetes and Helm.
  • Experience with programming languages such as Java, Python, or Go, and familiarity with .NET.
  • Strong understanding of Linux, Windows, software development, systems, networking, and cloud concepts.
  • Experience using AI to improve productivity and amplify technical skills.

Responsibilities

  • Own production reliability, including availability, latency, performance, capacity planning, monitoring, emergency response, and uptime for production environments.
  • Define, maintain, and improve SLOs, SLIs, error budgets, dashboards, and observability practices.
  • Analyze, troubleshoot, and resolve operational issues that affect service reliability and SLO performance.
  • Build and automate multi-environment observability capabilities, including capacity forecasting based on usage patterns.
  • Reduce toil and increase development velocity through automation and continuous improvement.
  • Provide production support, including incident, change, and problem management; root cause analysis; service restoration; runbooks; and SOPs.
  • Identify data-driven opportunities to improve system architecture, availability, performance, and reliability.
  • Collaborate with software engineering teams on release management, roadmap planning, and operational readiness.
  • Implement and manage reliability and observability tools such as Datadog, Prometheus, and Grafana.

Skills

Monitoring
APM
Observability
SRE
CI/CD
Jenkins
GitHub Actions
GitLab
Argo
Kubernetes
Helm
AWS
Java
Python
Go
.NET
Linux
Windows
AI

Tools

Datadog
Prometheus
Grafana
OpenTelemetry

Job description

CentralReach is seeking a Senior Site Reliability Engineer to own production reliability across multi-environment platforms in a hybrid Ft. Lauderdale setting.

You will drive SLOs, incident response, and capacity planning while partnering with Software Engineering to ensure high availability. Key focus areas include building observability dashboards, automating runtime improvements, and implementing modern reliability practices across AWS and containerized environments using Kubernetes, Helm,

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE: Observability, Cloud & Reliability Leader
Senior SRE: Observability, Cloud & Reliability Leader

CentralReach, LLC • Holmdel Township (NJ), Northern (KY)

Hybrid
USD 160,000 - 180,000
Health benefits
PTO and holidays
401(k) matching
+2
Senior SRE - Scale & Reliability for Cloud Platforms
Senior SRE - Scale & Reliability for Cloud Platforms

CentralReach • Holmdel Township (NJ)

Hybrid
USD 160,000 - 180,000
Health benefits
PTO
401(k) matching
+2
Senior SRE Leader: Cloud, Reliability & Scale
Senior SRE Leader: Cloud, Reliability & Scale

AVG • Tempe (AZ), Northern (KY)

Hybrid
USD 140,000 - 190,000
Senior SRE: Observability, Automation & Hybrid Cloud
Senior SRE: Observability, Automation & Hybrid Cloud

Colorado-Public-Employees • Denver (CO)

Hybrid
USD 140,000 - 165,000
Hybrid work option
On-call rotation
Work from home eligibility
Senior Production SRE: Cloud & On-Prem Reliability
Senior Production SRE: Cloud & On-Prem Reliability

Weights & Biases • New York (NY)

On-site
USD 140,000 - 180,000
Medical Insurance
Dental Insurance
Vision Insurance
+15
Senior SRE Lead: Cloud, Observability & Automation
Senior SRE Lead: Cloud, Observability & Automation

Frontier Airlines • Denver (CO)

On-site
USD 110,000 - 146,000
Medical coverage
401(k) retirement savings options
Travel privileges
+4
Senior SRE: Cloud Reliability, IaC & DR Leader
Senior SRE: Cloud Reliability, IaC & DR Leader

Castleton Commodities International • Stamford (CT)

On-site
USD 150,000 - 190,000
Competitive compensation
Comprehensive benefits
Tuition assistance
Senior SRE: Cloud Reliability & Observability Leader
Senior SRE: Cloud Reliability & Observability Leader

MeridianLink, Inc. • Northern (KY)

Hybrid
USD 140,000 - 210,000
Senior SRE: Scale Reliability, Observability & Resilience
Senior SRE: Scale Reliability, Observability & Resilience

Early Warning Services LLC • Scottsdale (AZ)

Hybrid
USD 106,000 - 130,000
Healthcare Coverage
401(k) Retirement Plan
Paid Time Off
+2
Senior SRE Lead: Reliability, Observability & Cloud
Senior SRE Lead: Reliability, Observability & Cloud

Shieldai • San Mateo (CA)

On-site
USD 180,000 - 240,000