Sr Manager, AI Systems Quality & Reliability , Annapurna AI Servers and Systems

Amazon Web Services (AWS)

Seattle (WA)

On-site

USD 208,000 - 282,000

Full time

9 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Annapurna Labs, part of AWS, seeks a Senior Manager of Quality & Reliability Engineering to drive the QnR function for Trainium AI server products. You will own reliability outcomes from component qualification to fleet performance, leading an engineering team across multiple chip generations and supplier sites.

You will define reliability strategy for liquid-cooled and air-cooled platforms at scale, building quality systems across a global manufacturing base and guiding root-cause

Qualifications

  • Must have root cause analysis and long-term corrective actions.
  • Bachelor’s degree in a relevant engineering field.
  • 10+ years in reliability or quality engineering for server/semiconductor/high-volume electronics.
  • 5+ years managing reliability, quality, or hardware teams.
  • Experience establishing quality systems across multiple vendors/sites.

Responsibilities

  • Lead and grow a QnR engineering team across locations.
  • Set direction for component qualification, reliability testing, DFMEA, and vendor standards.
  • Own end-to-end quality and reliability from design input to fleet performance.
  • Drive quality improvements with supplier sites and manufact. engineering.
  • Build reliability prediction and monitoring infrastructure; track fleet performance.
  • Establish failure analysis linking field data to manufacturing history and root cause.

Skills

Root cause analysis
Leadership
Reliability engineering
Vendor quality management
Quality management systems

Education

Bachelor's degree in Reliability/Electrical/Mechanical/Materials Science/Physics

Tools

DFMEA
HALT/HTOL
Weibull analysis
SPC/8D/DOE

Job description

AWS Annapurna Labs is seeking a Senior Manager of Quality & Reliability Engineering to lead the QnR function within the Trainium Manufacturing, Quality and Reliability organization. You will own quality and reliability outcomes for all Trainium AI server products — from component qualification through fleet performance — leading an engineering team across multiple concurrent chip and system generations. This role defines reliability strategy for liquid-cooled and air-cooled platforms at rapidly scaling volumes, builds quality systems across a multi-supplier global manufacturing base, drives fleet failure investigations to root cause, and establishes the reliability characterization capabilities required for next-generation technologies.

Key job responsibilities
  • Lead and grow a QnR engineering team, hiring, developing, and retaining top reliability and quality engineering talent.
  • Set technical direction for component qualification, reliability testing (HALT, HTOL, thermal cycling, QRV), DFMEA, and vendor quality standards across all Trainium programs.
  • Own quality and reliability outcomes end-to-end — from DFM input during design through fleet reliability performance.
  • Drive component specific manufacturing process quality improvements in partnership with Manufacturing Engineering, establishing incoming quality requirements and process controls at all supplier sites.
  • Build and maintain the reliability prediction and monitoring infrastructure — ensuring fleet performance is tracked against predictions, degradation trends are identified early, and corrective actions are data-driven.
  • Establish systematic failure analysis processes that connect field failures back to manufacturing history, supplier data, and component-level root cause for rapid containment.
  • Scale qualification processes to keep pace with multi-supplier, multi-generation production — including automation of qualification workflows and standardization of test methodologies across vendors.
About The Team

Annapurna Labs is a wholly owned subsidiary of AWS, focused on developing custom silicon and servers including the Nitro, Graviton, and Trainium families of processors. Machine Learning Annapurna (MLA) functions as a vertically integrated team including software, firmware, hardware, and silicon design in a single organization. We are the Trainium Servers and Systems organization under MLA focused on Hardware Development, Software Development, Fleet Ops Systems, and Manufacturing, Quality, and Reliability. This position leads the Quality and Reliability Engineering function within the Manufacturing, Quality and Reliability team.

Basic Qualifications
  • Experience in root cause analysis and error correction, identifying changes to procedures and systems to implement long-term fixes and avoid repeating issues
  • - Bachelor's degree in Reliability Engineering, Electrical Engineering, Mechanical Engineering, Materials Science, Physics, or related field
  • - 10+ years of reliability or quality engineering experience with server compute platforms, semiconductor packaging, or high-volume electronics manufacturing
  • - 5+ years of people management experience leading reliability, quality, or hardware engineering teams
  • - Experience establishing quality management systems and reliability programs across multiple manufacturing vendors or sites
Preferred Qualifications
  • Experience leading teams across multiple locations in complex manufacturing/production environments
  • Experience working in a fast-paced, rapidly changing operations environment
  • - Master's Degree or PhD in Reliability Engineering, Materials Science, or related field
  • - Experience with liquid cooling reliability (cold plate, TIM, coolant loop failure modes)
  • - Experience with advanced semiconductor packaging reliability (large-die BGA, warpage, solder joint fatigue)
  • - Demonstrated ability to establish vendor quality standards and drive compliance across ODM/CM partners
  • - Experience with reliability prediction methodologies (Weibull analysis, acceleration models, DFMEA)
  • - Working knowledge of manufacturing quality tools (SPC, FMEA, 8D, DOE)
  • - Strong executive communication skills — ability to translate technical reliability risk into business impact for senior leadership
  • - Meets/exceeds Amazon's leadership principles requirements for this role
  • - Meets/exceeds Amazon's functional/technical depth and complexity for this role

Amazon is an equal opportunity employer and does not discriminate on the basis of protected veteran status, disability, or other legally protected status.

Los Angeles County applicants: Job duties for this position include: work safely and cooperatively with other employees, supervisors, and staff; adhere to standards of excellence despite stressful conditions; communicate effectively and respectfully with employees, supervisors, and staff to ensure exceptional customer service; and follow all federal, state, and local laws and Company policies. Criminal history may have a direct, adverse, and negative relationship with some of the material job duties of this position. These include the duties and responsibilities listed above, as well as the abilities to adhere to company policies, exercise sound judgment, effectively manage stress and work safely and respectfully with others, exhibit trustworthiness and professionalism, and safeguard business operations and the Company’s reputation. Pursuant to the Los Angeles County Fair Chance Ordinance, we will consider for employment qualified applicants with arrest and conviction records.

Our inclusive culture empowers Amazonians to deliver the best results for our customers. If you have a disability and need a workplace accommodation or adjustment during the application and hiring process, including support for the interview or onboarding process, please visit https://amazon.jobs/content/en/how-we-hire/accommodations for more information. If the country/region you’re applying in isn’t listed, please contact your Recruiting Partner.

The base salary range for this position is listed below. Your Amazon package will include sign-on payments and restricted stock units (RSUs). Final compensation will be determined based on factors including experience, qualifications, and location. Amazon also offers comprehensive benefits including health insurance (medical, dental, vision, prescription, Basic Life & AD&D insurance and option for Supplemental life plans, EAP, Mental Health Support, Medical Advice Line, Flexible Spending Accounts, Adoption and Surrogacy Reimbursement coverage), 401(k) matching, paid time off, and parental leave. Learn more about our benefits at https://amazon.jobs/en/benefits.

USA, CA, Cupertino - 239,600.00 - 324,100.00 USD annually

USA, TX, Austin - 208,300.00 - 281,800.00 USD annually

USA, WA, Seattle - 208,300.00 - 281,800.00 USD annually

Company - Amazon Development Center U.S., Inc.

Job ID: A10464148

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Sr Manager, AI Systems Quality & Reliability , Annapurna AI Servers and Systems
Sr Manager, AI Systems Quality & Reliability , Annapurna AI Servers and Systems

Amazon Web Services (AWS) • Cupertino (CA)

On-site
USD 240,000 - 324,000
Health insurance
RSUs
Sr Manager, AI Systems Quality & Reliability , Annapurna AI Servers and Systems (AWS)
Sr Manager, AI Systems Quality & Reliability , Annapurna AI Servers and Systems (AWS)

Amazon • Austin (TX)

On-site
USD 208,000 - 282,000
Quality & Reliability Engineer, Trainium Manufacturing, Quality & Reliability
Quality & Reliability Engineer, Trainium Manufacturing, Quality & Reliability

Amazon Web Services (AWS) • Austin (TX)

On-site
USD 136,000 - 184,000
Quality & Reliability Engineer, Trainium Manufacturing, Quality & Reliability
Quality & Reliability Engineer, Trainium Manufacturing, Quality & Reliability

Amazon Web Services (AWS) • Cupertino (CA)

On-site
USD 157,000 - 213,000
Sr. Quality & Reliability Engineer, Annapurna AI Servers and Systems
Sr. Quality & Reliability Engineer, Annapurna AI Servers and Systems

Amazon Web Services (AWS) • Seattle (WA)

On-site
USD 159,000 - 215,000
Sr. Quality & Reliability Engineer, Annapurna AI Servers and Systems
Sr. Quality & Reliability Engineer, Annapurna AI Servers and Systems

Amazon Web Services (AWS) • Cupertino (CA)

On-site
USD 183,000 - 248,000
Sr. Quality & Reliability Engineer, Annapurna AI Servers and Systems
Sr. Quality & Reliability Engineer, Annapurna AI Servers and Systems

Amazon Web Services (AWS) • Austin (TX)

On-site
USD 140,000 - 170,000
Sr PCBA Manufacturing Engineer, Trainium Manufacturing, Quality and Reliability (AWS)
Sr PCBA Manufacturing Engineer, Trainium Manufacturing, Quality and Reliability (AWS)

Amazon • Austin (TX)

On-site
USD 159,000 - 215,000
Senior AI Systems Quality & Reliability Leader
Senior AI Systems Quality & Reliability Leader

Amazon Web Services (AWS) • Cupertino (CA)

On-site
USD 240,000 - 324,000
Health insurance
RSUs
AI Systems Quality & Reliability Leader
AI Systems Quality & Reliability Leader

Amazon • Austin (TX)

On-site
USD 208,000 - 282,000