Senior Data Center Hardware Reliability Engineer

OpenAI, Inc.

San Francisco (CA)

On-site

USD 226,000 - 285,000

Full time

27 hours ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Relocation support
Daily meals in our offices
Learning and development stipend
Parental leave

Job summary

OpenAI is seeking a Data Center Hardware Quality & Reliability Engineer in San Francisco to own end-to-end hardware quality and reliability across 3P and 1P platforms. You will translate field failures into quantified risk, drive containment, root-cause verification, and upstream design improvements for MQE and NPI, at data-center scale.

The ideal candidate blends hardware/system expertise with reliability engineering, data fluency, and cross-functional leadership, shaping fleet-wide diagnostics

Qualifications

  • 8+ years in hardware quality/reliability, server/rack systems, or mission-critical infrastructure.
  • 3+ years owning field-failure, RMA, or CAPA outcomes.
  • Working proficiency with SQL and Python/R or equivalent analytics tools.

Responsibilities

  • Build and govern the field-quality data model across telemetry, tickets, RMA/repair, FA, firmware, configuration, supplier, and manufacturing genealogy.
  • Define AFR, ASR, DPPM, MTBF/MTTR, repeat-repair, NTF, repair-cycle-time, and forecast-versus-actual metrics with explicit denominators and uncertainty.
  • Provide fleet-level macro views and unit/FRU/cohort-level micro views; detect shifts and bound affected populations.
  • Lead systemic field-failure triage, containment, failure analysis, 8D/CAPA, risk assessment, corrective-action verification, and recurrence monitoring.
  • Develop cohort, life-data, reliability-growth, and spare-demand projections by product, FRU, supplier, configuration, geography, and age.
  • Partner with MQE and NPI to convert field mechanisms into manufacturing-test coverage, screening/stress profiles, diagnostics, control plans, DFR/DFS requirements, FMEA/FTA, mission profiles, FRU strategy, and qualification gates.
  • Close the loop by verifying whether upstream changes reduce field recurrence.
  • Define supplier/CM FA standards, field-data contracts, scorecards, escalation paths, and closure evidence.

Skills

Hardware reliability
Data-center systems
SQL
Python/R
Cross-functional leadership
FMEA/FTA

Education

BS in electrical engineering
MS preferred

Tools

Linux/BMC/IPMI/Redfish

Job description

OpenAI is seeking a Data Center Hardware Quality & Reliability Engineer in San Francisco to own end-to-end hardware quality and reliability across 3P and 1P platforms. You will translate field failures into quantified risk, drive containment, root-cause verification, and upstream design improvements for MQE and NPI, at data-center scale.

The ideal candidate blends hardware/system expertise with reliability engineering, data fluency, and cross-functional leadership, shaping fleet-wide diagnostics

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Data Center Hardware Reliability Engineer
Senior Data Center Hardware Reliability Engineer

Gohyred • San Francisco (CA)

On-site
USD 180,000 - 280,000
Lead Data Center Hardware Reliability Engineer
Lead Data Center Hardware Reliability Engineer

OpenAI • United States

Remote
USD 150,000 - 210,000
Data Center Hardware Quality & Reliability Engineer
Data Center Hardware Quality & Reliability Engineer

OpenAI • United States

Remote
USD 150,000 - 210,000
Data Center Hardware Quality & Reliability Engineer
Data Center Hardware Quality & Reliability Engineer

Gohyred • San Francisco (CA)

On-site
USD 180,000 - 280,000
Lead Datacenter Hardware Technician
Lead Datacenter Hardware Technician

OpenAI • San Francisco (CA)

On-site
USD 180,000 - 240,000
Senior Datacenter Hardware Operations Lead
Senior Datacenter Hardware Operations Lead

OpenAI • United States

On-site
USD 86,400 - 228,000
Senior Hardware Reliability Engineer — Data Center Systems
Senior Hardware Reliability Engineer — Data Center Systems

Meta • Fremont (CA)

On-site
USD 144,000 - 204,000
Senior Hardware Data Analytics Engineer – Quality & Reliability
Senior Hardware Data Analytics Engineer – Quality & Reliability

United States Digital Space LLC • San Francisco (CA)

Hybrid
USD 173,000 - 203,000
Competitive salary
Equity
Health, dental, vision
+4
Hardware Operations & Fleet Reliability Engineer
Hardware Operations & Fleet Reliability Engineer

OpenAI • Seattle (WA)

On-site
USD 150,000 - 200,000
Senior Data Center Reliability Engineer - AI/Compute
Senior Data Center Reliability Engineer - AI/Compute

Qualcomm • San Diego (CA)

On-site
USD 104,000 - 156,000