Senior Site Reliability Engineer – Observability & Cloud

Cosm Inc.

El Segundo, Northern (CA, KY)

Hybrid

USD 110,000 - 145,000

Full time

7 days ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Cosm Inc. in California seeks an experienced Site Reliability Engineer to design, automate, and maintain hybrid infrastructure for real-time monitoring and decision-making. You will work with product and engineering teams to ensure telemetry ingestion and actionable alerts across on-prem and cloud environments.

The role emphasizes mentoring and continuous learning in a dynamic setting. The candidate should have 6+ years in platform/SRE roles, strong Grafana LGTM expertise, IaC experience with

Qualifications

  • 6+ years of platform/SRE experience designing and monitoring hybrid systems.
  • Expert-level Grafana LGTM stack knowledge.
  • Scripting: PowerShell and Bash required; JavaScript/TypeScript a plus.
  • Experience with AWS, EKS, Kubernetes, and containerization.
  • IaC: Pulumi, Terraform, or similar tools.
  • Linux/Windows Server administration (2016–2022).
  • Strong networking fundamentals and monitoring practices.
  • Excellent communication and teamwork skills.

Responsibilities

  • Design, and automate robust monitoring and alerting to ensure health, performance, and availability of the operations center platform.
  • Collaborate with software engineering and product teams to monitor apps and microservices.
  • Deploy and configure servers, networks, databases, and monitoring tools.
  • Create documentation and provide training for operations staff.
  • Collaborate with cross-functional teams to align observability architecture with goals.
  • Participate in on-call rotation to resolve incidents.

Skills

Grafana LGTM
PowerShell
Bash
AWS
EKS
Kubernetes
Terraform
Pulumi
Ansible
Linux
Windows Server
Networking
Monitoring
PromQL
LogQL

Education

Bachelor's or Master's in Computer Science/IT

Tools

Pulumi
Terraform
Ansible
Docker
EC2
Hyper-V
VMware
Kubernetes

Job description

Cosm Inc. in California seeks an experienced Site Reliability Engineer to design, automate, and maintain hybrid infrastructure for real-time monitoring and decision-making. You will work with product and engineering teams to ensure telemetry ingestion and actionable alerts across on-prem and cloud environments.

The role emphasizes mentoring and continuous learning in a dynamic setting. The candidate should have 6+ years in platform/SRE roles, strong Grafana LGTM expertise, IaC experience with

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE: Observability & Cloud Automation Lead
Senior SRE: Observability & Cloud Automation Lead

Cosm • El Segundo (CA)

On-site
USD 110,000 - 145,000
Senior Cloud Observability & SRE Engineer
Senior Cloud Observability & SRE Engineer

Ontrac Solutions • Chicago (IL)

On-site
USD 120,000 - 180,000
Senior Site Reliability Engineer — Cloud Observability
Senior Site Reliability Engineer — Cloud Observability

Guidehouse • San Antonio (TX)

On-site
USD 106,000 - 176,000
Medical, Rx, Dental & Vision Insurance
401(k) Retirement Plan
Tuition Reimbursement
+2
Hybrid Site Reliability Engineer - Observability & Cloud
Hybrid Site Reliability Engineer - Observability & Cloud

Bartech Staffing • Dearborn (MI)

Hybrid
USD 110,000 - 170,000
Senior Site Reliability Engineer: Observability & Cloud
Senior Site Reliability Engineer: Observability & Cloud

VBeyond Corporation • Jersey City (NJ)

On-site
USD 100,000 - 260,000
Observability Engineer / Site Reliability Engineer
Observability Engineer / Site Reliability Engineer

Ontrac Solutions • New York (NY)

On-site
USD 120,000 - 190,000
Senior SRE - Cloud & Observability
Senior SRE - Cloud & Observability

Ridgeline • Reno (NV)

Hybrid
USD 153,000 - 210,000
Unlimited vacation
Education reimbursement
Wellness reimbursement
+1
Observability Engineer / Site Reliability Engineer
Observability Engineer / Site Reliability Engineer

Ontrac Solutions • Chicago (IL)

On-site
USD 120,000 - 180,000
Senior Site Reliability Engineer - Build SRE Ops (Hybrid)
Senior Site Reliability Engineer - Build SRE Ops (Hybrid)

Mission Staffing • New York (NY)

Hybrid
USD 140,000 - 200,000
Senior Site Reliability Engineer: Scalable Infra & Observability
Senior Site Reliability Engineer: Scalable Infra & Observability

Early Warning • Chicago (IL)

Hybrid
USD 106,000 - 130,000
Healthcare Coverage
401(k) Matching
Paid Time Off
+1