Director, Site Reliability Engineering

Jobtailor

Minnesota

On-site

USD 170,000 - 210,000

Full time

4 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Jobtailor is seeking an executive-level SRE leader to drive 24x7 reliability and resilience for a global portfolio of mission-critical applications. You will partner with product engineering to bake reliability into design and releases, while defining observability and disaster recovery practices.

You will lead a global team, champion automation and AI-driven operations, and guide the SRE strategy and operating model across the portfolio.

Qualifications

  • 10+ years in SRE, software eng, or tech leadership roles.
  • Proven experience leading global teams with large-scale distributed systems.
  • Expertise in reliability engineering, observability, incident management, and disaster recovery.
  • Experience with Service Management functions (incidents, changes, availability, continuity).
  • Ability to influence product/tech roadmaps for reliability and scalability.
  • Demonstrated leadership in transformation toward automation and AI operations.
  • Strong people leadership, performance management, and cross-region resource allocation.
  • Strong financial acumen and budget management.
  • Excellent communication with senior stakeholders and cross-functional teams.

Responsibilities

  • Lead 24x7 reliability, scalability, and operational excellence for a global portfolio of mission-critical apps and services.
  • Serve as executive escalation point during major incidents, coordinating rapid resolution and communication with senior stakeholders.
  • Partner with product engineering to embed reliability into design, development, and releases.
  • Define and improve observability, incident management, disaster recovery, and resilience practices.
  • Champion automation and AI-driven operations to reduce service disruption.
  • Shape and evolve SRE strategy, operating model, and engineering behaviors across product portfolio.
  • Lead, mentor, and develop a global team of SRE managers and engineers.
  • Foster innovation, accountability, inclusion, and continuous improvement in service excellence.

Skills

Site Reliability
Reliability Practices
Observability Tools
Incident Management
Disaster Recovery
Cloud-Native
Automation
AI Operations
Service Management
Operational Readiness

Job description

  • Lead 24x7 reliability, scalability, and operational excellence for a global portfolio of mission-critical applications and services
  • Serve as executive escalation point during major incidents, coordinating rapid resolution and communication with senior stakeholders
  • Partner with product engineering teams to embed reliability into product design, development, and release processes
  • Define, implement, and improve observability, incident management, disaster recovery, and resilience engineering practices
  • Champion automation and AI-driven operations to improve efficiency and reduce service disruption
  • Shape and evolve the SRE strategy, operating model, and engineering behaviors across the Corporate Tax and Trade product portfolio
  • Lead, mentor, and develop a global team of SRE managers and engineers
  • Foster innovation, accountability, inclusion, continuous improvement, and service excellence
Requirements
  • 10+ years of experience in site reliability engineering, software engineering, infrastructure, platform engineering, enterprise technology, service management, or a related technology leadership role
  • Proven experience leading global teams supporting large-scale distributed systems, cloud-native architectures, and mission-critical enterprise applications
  • Strong expertise in reliability engineering practices, observability tools, automation frameworks, incident management, disaster recovery, and operational readiness
  • Experience operating within or closely partnering with Service Management functions, including incident, problem, change, availability, and continuity management
  • Experience influencing product and technology roadmaps to prioritize reliability, scalability, performance, resilience, and service quality improvements
  • Demonstrated ability to lead transformation in a complex enterprise technology environment, including adoption of automation, AI operations, and modern SRE practices
  • Strong people leadership skills, including talent development, succession planning, performance management, and resource allocation across regions and technology domains
  • Strong financial acumen, including experience managing large budgets and aligning investment decisions to business priorities
  • Exceptional communication and stakeholder management skills, with ability to influence senior leaders, engineering teams, and business partners at all levels

Demonstrates extensive expertise in Site Reliability Engineering, focusing on reliability engineering practices, observability, incident management, and disaster recovery. Proven ability to lead global teams, drive automation and AI-driven operations, and influence technology roadmaps to enhance service quality and operational excellence.

Highest-signal resume keywords
  • Site Reliability Engineering
  • Reliability Engineering Practices
  • Observability Tools
  • Incident Management
  • Automation Frameworks
ATS Optimization Keywords
Hard Skills
  • Site Reliability Engineering
  • Reliability Engineering Practices
  • Observability Tools
  • Incident Management
  • Disaster Recovery
  • Cloud-Native Architectures
  • Automation
  • AI Operations
  • Service Management
  • Operational Readiness
Soft Skills
  • People Leadership
  • Communication
  • Stakeholder Management
  • Talent DevelopmentPerformance Management
Industry Keywords
  • Global Teams
  • Large-Scale Distributed Systems
  • Enterprise Technology
  • Service Management Functions
  • Financial Acumen
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

Jobtailor • New Jersey

On-site
USD 120,000 - 180,000
AVP SRE, Cloud Solutions
AVP SRE, Cloud Solutions

Jobtailor • Arlington (TX)

On-site
USD 180,000 - 240,000
Principal Site Reliability Engineer
Principal Site Reliability Engineer

Jobtailor • Arizona

On-site
USD 180,000 - 240,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Jobtailor • Town of Florida (NY)

On-site
USD 150,000 - 190,000
Staff Site Reliability Engineer, SRE
Staff Site Reliability Engineer, SRE

Jobtailor • California (MO)

On-site
USD 120,000 - 210,000
Reliability Engineer 3, Observability Specialist
Reliability Engineer 3, Observability Specialist

Jobtailor • California (MO)

On-site
USD 140,000 - 190,000
Site Reliability Engineering Manager
Site Reliability Engineering Manager

O.C. Tanner • Salt Lake City (UT)

On-site
USD 180,000 - 240,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Senior Availability & Reliability Engineering Manager
Senior Availability & Reliability Engineering Manager

Jobtailor • Charlotte (NC)

On-site
USD 140,000 - 190,000
Senior Engineer – Reliability
Senior Engineer – Reliability

Jobtailor • South Carolina

On-site
USD 120,000 - 180,000