Site Reliability Engineer: HPC Automation & Monitoring

LTD GLOBAL, LLC

Berkeley (CA)

Hybrid

USD 91,000 - 129,000

Full time

6 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Great Organization! in Berkeley, CA is seeking an experienced Site Reliability Engineer to join the Operations Technology team.

This hybrid role supports a national-scale HPC facility, ensuring uptime, reliability, and security through proactive monitoring, automation, and cross-functional collaboration. The engineer will own monitoring and triage, build automation, and develop tooling across the monitoring pipeline, while supporting data center power, cooling, and environmental controls.

Qualifications

  • Experience with Linux environments and SSH access.
  • Proficient in scripting or programming languages (Python, C, C++, Java).
  • Familiarity with Kubernetes and monitoring tools like Prometheus.

Responsibilities

  • Monitor and triage alerts across computer, storage, network, and facility systems in real time.
  • Build automation that prevents issues before outages.
  • Develop new tools and integrations across the monitoring pipeline (APIs → alerts → action).
  • Walk the data center floor to keep power, cooling, and environmental systems humming.
  • Coordinate maintenance activities across teams and keep incidents accurately tracked.
  • Dig into complex, ambiguous problems and drive them to resolution.

Skills

Linux/SSH
Python scripting
C/C++
Java

Tools

Kubernetes
Prometheus
VictoriaMetrics
Alertmanager

Job description

Great Organization! in Berkeley, CA is seeking an experienced Site Reliability Engineer to join the Operations Technology team.

This hybrid role supports a national-scale HPC facility, ensuring uptime, reliability, and security through proactive monitoring, automation, and cross-functional collaboration. The engineer will own monitoring and triage, build automation, and develop tooling across the monitoring pipeline, while supporting data center power, cooling, and environmental controls.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer - 24/7 HPC Ops
Senior Site Reliability Engineer - 24/7 HPC Ops

Bay Systems • Berkeley (CA)

On-site
USD 120,000 - 150,000
Site Reliability Engineer Hybrid
Site Reliability Engineer Hybrid

LTD GLOBAL, LLC • Berkeley (CA)

Hybrid
USD 91,000 - 129,000
HPC Site Reliability Engineer — Onsite 24/7
HPC Site Reliability Engineer — Onsite 24/7

Bay Systems Consulting Inc. • Berkeley (CA)

On-site
USD 83,000 - 166,000
Site Reliability Engineer - HPC & 24/7 Monitoring
Site Reliability Engineer - HPC & 24/7 Monitoring

ADP, Inc. • Berkeley (CA)

On-site
USD 140,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Ltd Global • Berkeley (CA)

On-site
USD 94,000 - 127,000
Site Reliability Engineer
Site Reliability Engineer

ADP, Inc. • Berkeley (CA)

On-site
USD 140,000 - 180,000
Night-Shift SRE for High-Impact HPC & Automation
Night-Shift SRE for High-Impact HPC & Automation

Ltd Global • Berkeley (CA)

Hybrid
USD 94,000 - 127,000
Site Reliability Engineer
Site Reliability Engineer

Bay Systems • Berkeley (CA)

On-site
USD 120,000 - 150,000
Senior Site Reliability Engineer: Observability & Resiliency
Senior Site Reliability Engineer: Observability & Resiliency

Early Warning • San Francisco (CA)

Hybrid
USD 139,000 - 174,000
Discretionary incentive plan
Comprehensive benefits package
HPC Site Reliability Engineer — Automation & Infra
HPC Site Reliability Engineer — Automation & Infra

SPACE EXPLORATION TECHNOLOGIES CORP • Redmond (WA)

On-site
USD 125,000 - 150,000
Health insurance
401(k) retirement plan
Paid vacation and holidays
+1