Senior Hardware Reliability Engineer — Data Center Systems

Meta

Fremont (CA)

On-site

USD 144,000 - 204,000

Full time

2 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Meta Infrastructure's Hardware Product Integrity team is seeking a skilled Hardware Reliability Engineer to help build next-generation data center hardware that underpins Meta's AI initiatives. You will drive reliability across server, storage, and networking hardware deployed in data centers, applying failure analysis, accelerated life testing, and lifetime reliability modeling to reduce field failures.

In this role you will lead DFMEA, work with ODMs, translate test results into life metrics,

Qualifications

  • 6+ years of hardware reliability engineering experience in infrastructure hardware.
  • Expertise in FMEA, HALT, ALT, Weibull analysis, MTBF modeling.
  • Experience analyzing field failure data and driving corrective actions.
  • Experience working with hardware suppliers/contract manufacturers to evaluate component reliability.
  • Ability to communicate complex reliability findings to engineering and operations teams.

Responsibilities

  • Lead DFMEA activities across AI, compute and storage platforms.
  • Develop reliability tests to reveal design weaknesses in compute, storage, server hardware, and networking modules.
  • Establish Design Verification tests to meet life-time reliability metrics.
  • Collaborate with ODMs to ensure tests run as planned and implement improvements.
  • Translate test results into product life metrics and highlight unmet targets.
  • Use reliability statistics to inform decisions and quantify risk.
  • Develop internal reliability test infrastructure to support designs and experiments.
  • Collaborate cross-functionally with Hardware Engineering, Release to Production, Thermal, and Failure Analysis teams to de-risk issues.

Skills

DFMEA & reliability testing
Weibull analysis
MTBF modeling
Failure analysis
Cross-functional collaboration
Data analysis
Root cause investigations

Education

MSc in Mechanical or Electrical Engineering

Job description

Meta Infrastructure's Hardware Product Integrity team is seeking a skilled Hardware Reliability Engineer to help build next-generation data center hardware that underpins Meta's AI initiatives. You will drive reliability across server, storage, and networking hardware deployed in data centers, applying failure analysis, accelerated life testing, and lifetime reliability modeling to reduce field failures.

In this role you will lead DFMEA, work with ODMs, translate test results into life metrics,

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Hardware Reliability Engineer
Hardware Reliability Engineer

Meta • Menlo Park (CA), Northern (KY)

Hybrid
USD 160,000 - 260,000
Hardware Reliability Engineer
Hardware Reliability Engineer

Meta • Fremont (CA)

On-site
USD 144,000 - 204,000
Reliability Engineer - AI Hardware & Data Center RAS
Reliability Engineer - AI Hardware & Data Center RAS

Intel • Boxborough (MA)

On-site
USD 122,000 - 232,000
Stock bonuses
Health benefits
Retirement plans
+1
Datacenter Hardware Lead — Reliability & Fleet Health
Datacenter Hardware Lead — Reliability & Fleet Health

OpenAI • California (MO)

On-site
USD 120,000 - 180,000
Reliability Engineer
Reliability Engineer

Meta • Sunnyvale (CA), Redmond (WA), Seattle (WA)

On-site
USD 130,000 - 165,000
Senior Reliability Engineer – Data Center & AI Compute
Senior Reliability Engineer – Data Center & AI Compute

Qualcomm • San Diego (CA)

Hybrid
USD 104,000 - 156,000
Senior Reliability Engineer, AI Server Hardware
Senior Reliability Engineer, AI Server Hardware

Amazon Web Services (AWS) • Austin (TX)

On-site
USD 140,000 - 170,000
Infrastructure Mechanical Engineer Data Center Systems
Infrastructure Mechanical Engineer Data Center Systems

Meta • Menlo Park (CA)

On-site
USD 118,000 - 170,000
Bonus
Equity
Benefits
Lead Datacenter Hardware Technician
Lead Datacenter Hardware Technician

OpenAI • San Francisco (CA)

On-site
USD 180,000 - 240,000
Hardware Reliability Engineer - Wearables & VR
Hardware Reliability Engineer - Wearables & VR

Meta • Sunnyvale (CA), Redmond (WA), Seattle (WA)

On-site
USD 130,000 - 165,000