Senior Site Reliability Engineering Manager – Scale & Resilience

Socket.dev

New York (NY)

On-site

USD 150,000 - 220,000

Full time

14 days+
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Forge is seeking a Manager, Site Reliability Engineering to lead a high‑performing SRE team ensuring Forge systems remain highly available for customers. You will guide incident response, design robust observability, and drive reliability improvements across platforms and products.

You will mentor engineers, influence across engineering and non‑engineering stakeholders, and partner with Security, Compliance, and Risk teams to meet regulatory needs.

Qualifications

  • 5+ years of experience leading a Site Reliability Engineering, DevOps, Cloud Operations, or similar reliability-focused function.
  • 10+ years of total software engineering, infrastructure, platform, cloud, or production operations experience.
  • Bachelor’s degree in Computer Science, Engineering, or a closely related field, or equivalent practical experience.
  • Experience building, operating, and maintaining large-scale cloud infrastructure and distributed systems.
  • Hands‑on experience with observability, monitoring, alerting, incident response, troubleshooting, and production support.
  • Experience with CI/CD, infrastructure automation, cloud platforms, and operational tooling.
  • Strong technical judgment, communication skills, and ability to influence across engineering and non-engineering stakeholders.

Responsibilities

  • Manage Forge’s Site Reliability Engineering team responsible for keeping Forge systems highly available for customers.
  • Drive strong incident management practices in partnership with engineering teams, including response, mitigation, follow‑up, and post‑incident learning.
  • Build, improve, and manage observability infrastructure in partnership with Platform Engineering, including monitoring, alerting, dashboards, and operational metrics.
  • Improve monitoring coverage and alert quality to reduce noise, shorten time to detect, and support faster response and mitigation.
  • Champion reliability best practices across engineering, including service ownership, operational readiness, disaster recovery, and production support standards.
  • Contribute to technical design, architecture, automation, infrastructure, and overall team delivery.
  • Collaborate with engineering teams to troubleshoot production issues, identify recurring problems, and improve system reliability.
  • Hire, coach, mentor, and manage performance for SRE team members while supporting career development and team health.
  • Partner with Security, Compliance, and Risk partners to ensure reliability and infrastructure practices meet the needs of a regulated business.

Skills

SRE leadership
Cloud infrastructure
Observability
CI/CD
Incident response

Education

Bachelor's degree or equivalent

Tools

Datadog
CloudWatch
Kubernetes
Terraform
Ansible

Job description

Forge is seeking a Manager, Site Reliability Engineering to lead a high‑performing SRE team ensuring Forge systems remain highly available for customers. You will guide incident response, design robust observability, and drive reliability improvements across platforms and products.

You will mentor engineers, influence across engineering and non‑engineering stakeholders, and partner with Security, Compliance, and Risk teams to meet regulatory needs.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Head of Site Reliability Engineering
Head of Site Reliability Engineering

Forge • San Francisco (CA)

On-site
USD 150,000 - 220,000
SRE Engineering Manager: Reliability & Scale
SRE Engineering Manager: Reliability & Scale

Socket.dev • San Francisco (CA)

On-site
USD 150,000 - 220,000
Manager, Site Reliability Engineer
Manager, Site Reliability Engineer

Socket.dev • San Francisco (CA)

On-site
USD 150,000 - 220,000
Manager, Site Reliability Engineer
Manager, Site Reliability Engineer

Socket.dev • New York (NY)

On-site
USD 150,000 - 220,000
Manager, Site Reliability Engineer
Manager, Site Reliability Engineer

Forge • San Francisco (CA)

On-site
USD 150,000 - 220,000
Senior SRE Engineering Manager – Reliability at Scale
Senior SRE Engineering Manager – Reliability at Scale

Upstart • United States

On-site
USD 180,000 - 260,000
Annual equity grants
401(k) retirement match
ESPP (US only)
+4
Site Reliability Engineering Manager
Site Reliability Engineering Manager

O.C. Tanner • Salt Lake City (UT)

On-site
USD 180,000 - 240,000
Senior Site Reliability Engineer: Build Resilient, Scalable Systems
Senior Site Reliability Engineer: Build Resilient, Scalable Systems

Inspire-Brands • Atlanta (GA)

On-site
USD 140,000 - 190,000
Remote SRE Manager: Reliability & Scale for Fintech Health
Remote SRE Manager: Reliability & Scale for Fintech Health

NationsBenefits • Plantation (FL)

On-site
USD 140,000 - 190,000
Unlimited PTO
Fully remote work (US-based)
SRE Engineering Manager — Lead Reliability, Remote Flexible
SRE Engineering Manager — Lead Reliability, Remote Flexible

DevOpsChat • California (MO)

Hybrid
USD 140,000 - 220,000
Health insurance
Professional development opportunities