Principal Reliability Scientist

Graphcore

Milpitas, Austin (CA, TX)

On-site

USD 120,000 - 160,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Graphcore is seeking a Senior Reliability Scientist in Milpitas, California, responsible for leading reliability activities across complex, high-performance systems. This role requires collaboration with reliability experts and aims to optimize design decisions based on reliability data.

Candidates should have a strong background in reliability engineering or science, experience with experimental data analysis, and the ability to influence design with data-driven insights.

Qualifications

  • Strong background in reliability engineering within hardware or complex systems.
  • Experience with reliability modelling and statistical data analysis.
  • Ability to work with experimental reliability data.

Responsibilities

  • Define reliability requirements across silicon, board and system levels.
  • Design experiments to generate reliability and performance data.
  • Analyse data to quantify reliability metrics such as MTBF, MTTR.

Skills

Reliability engineering
Experimental design
Statistical data analysis
Problem-solving
Communication

Education

Background in reliability engineering or reliability science

Tools

Reliability modelling tools

Job description

Job Summary

Reporting to the Quality leadership within Manufacturing Operations, the Senior Reliability Scientist is responsible for leading reliability activities across complex, high-performance systems. Working closely with established reliability experts and cross‑functional teams, this role uses experimental data and advanced modelling to inform design decisions, validate product reliability and optimise serviceability strategies, including spares provisioning.

Responsibilities and Duties
  • Define and refine reliability requirements across silicon, board and system levels, working in partnership with research and design teams
  • Apply advanced reliability methodologies to highly innovative systems, including challenges associated with liquid‑cooled architectures and fluid dynamics
  • Design and execute experiments to generate high‑quality reliability and performance data, ensuring statistical rigour and relevance
  • Analyse experimental, field and manufacturing data to quantify reliability metrics such as MTBF, MTTR, RAS characteristics and soft error rates (SER)
  • Use data‑driven insights to inform product design trade‑offs, reliability target and spares provisioning strategies
  • Collaborate with chip, board and system design teams to influence architecture and component selection based on reliability considerations
  • Support development of system‑level reliability models incorporating thermal, mechanical and fluid behaviour
  • Lead complex root‑cause investigations into reliability issues, driving corrective and preventative actions across teams
  • Contribute to the evolution of reliability tools, processes and best practices within the organisation
  • Communicate complex reliability concepts, risks and recommendations clearly to a wide range of stakeholders
Qualifications
  • Strong background in reliability engineering or reliability science within semiconductor, hardware or complex systems environments
  • Experience of physics‑of‑failure approaches in high‑performance computing, AI hardware or related domains
  • Experience with reliability modelling, experimental design and statistical data analysis
  • Proven ability to work with and interpret experimental reliability data to drive engineering decisions
  • Experience with key reliability metrics such as MTBF, MTTR, RAS and failure rate analysis
  • Ability to operate effectively in complex, cross‑functional environments with multiple stakeholders
  • Strong problem‑solving skills with the ability to lead technically challenging investigations independently
  • Excellent communication skills, with the ability to influence design and operations teams using data‑driven insights
Preferred Qualifications
  • Experience with liquid cooling systems, fluid dynamics or thermally complex hardware environments
  • Knowledge of soft error mechanisms and SER modeling
  • Experience contributing to reliability strategy, processes or tooling improvements
Equal Employment Opportunity

As set forth in Graphcore’s Equal Employment Opportunity policy, we do not discriminate on the basis of any protected group status under any applicable law.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Lead Reliability Scientist for High-Performance Systems
Lead Reliability Scientist for High-Performance Systems

Graphcore • Milpitas (CA), Austin (TX)

On-site
USD 120,000 - 160,000
Senior Reliability Engineer
Senior Reliability Engineer

Insight Global • Redmond (WA)

On-site
USD 110,000 - 170,000
Senior Director – Product Integrity
Senior Director – Product Integrity

Jobtailor • California (MO)

On-site
USD 180,000 - 280,000
Senior Reliability Engineer – Hardware, Electrical
Senior Reliability Engineer – Hardware, Electrical

Jobtailor • Massachusetts

On-site
USD 90,000 - 130,000
Hardware Reliability Engineer
Hardware Reliability Engineer

DensityAI • Mountain View (CA)

On-site
USD 220,000 - 350,000
Sr. Reliability Engineer
Sr. Reliability Engineer

Planet Pharma • Milpitas (CA)

On-site
USD 52,000 - 66,000
Senior Reliability Engineer
Senior Reliability Engineer

Stellar Consulting Solutions, LLC • Milpitas (CA)

On-site
USD 120,000 - 180,000
Senior Reliability Data Scientist
Senior Reliability Data Scientist

Jobtailor • Alabama

On-site
USD 90,000 - 140,000
Reliability Engineer
Reliability Engineer

Augustbioservices • Nashville (TN)

On-site
USD 90,000 - 130,000
Reliability Engineer
Reliability Engineer

August Bioservices • Nashville (TN)

On-site
USD 100,000 - 140,000