Lead AI/HPC Cluster Reliability Architect

Advanced Micro Devices

Austin (TX)

On-site

USD 180,000 - 240,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

AMD benefits at a glance

Job summary

AMD is looking for a Principal Cluster Reliability Architect to define and drive reliability strategy for AI and HPC cluster platforms, spanning compute, networking, storage, and control plane architectures. You will influence design decisions and ensure end-to-end resilience across reference designs and large-scale deployments.

You will lead cross-functional alignment, establish reliability KPIs and validation strategies, and mentor engineers while shaping roadmaps for scalable, resilient

Qualifications

  • Experience as a systems architect with distributed, large-scale infrastructure.
  • Strong understanding of AI/HPC environments and production-scale platforms.
  • Ability to influence across multiple engineering teams and translate learnings into architecture.

Responsibilities

  • Define a cluster reliability architecture framework spanning the full infrastructure lifecycle.
  • Establish reliability requirements for AMD reference architectures and deployments.
  • Drive decisions to improve fault tolerance, redundancy, and recoverability.
  • Partner with SRE and Platform Operations to define sustainable operational models.
  • Establish standards for observability, health monitoring, and patching.
  • Create closed-loop feedback to translate insights into architectural improvements.
  • Define reliability KPIs, SLAs, SLOs, and deployment criteria.
  • Develop validation strategies for production-scale reliability.
  • Establish methodologies for failure injection, chaos engineering, recovery validation, and resiliency benchmarking.
  • Drive data-driven reliability improvements through testing and analysis.
  • Ensure reliability consistency across architecture, deployment, bring-up, validation, and operations.
  • Identify and close gaps in ownership, governance, and handoff processes.
  • Promote repeatable engineering practices to improve scalability and quality.
  • Mentor senior engineers and architects; represent reliability in customer engagements.

Skills

Large-scale cluster architecture
Distributed systems
Linux infrastructure
Production-scale AI/HPC

Education

Bachelor's degree in Computer Engineering, Computer Science, Electrical Engineering, or related technical discipline

Tools

Kubernetes
Slurm
ROCm
RDMA networking

Job description

AMD is looking for a Principal Cluster Reliability Architect to define and drive reliability strategy for AI and HPC cluster platforms, spanning compute, networking, storage, and control plane architectures. You will influence design decisions and ensure end-to-end resilience across reference designs and large-scale deployments.

You will lead cross-functional alignment, establish reliability KPIs and validation strategies, and mentor engineers while shaping roadmaps for scalable, resilient

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Lead Architect, AI/HPC Cluster Reliability
Lead Architect, AI/HPC Cluster Reliability

AMD • Austin (TX)

On-site
USD 180,000 - 260,000
Senior Cluster Reliability Architect - AI/HPC Platforms
Senior Cluster Reliability Architect - AI/HPC Platforms

Socket.dev • Austin (TX)

On-site
USD 180,000 - 260,000
AMD Benefits
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

Socket.dev • Austin (TX)

On-site
USD 180,000 - 260,000
AMD Benefits
AI/HPC Cluster Architect
AI/HPC Cluster Architect

AMD • Austin (TX)

On-site
USD 140,000 - 200,000
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

Advanced Micro Devices • Austin (TX)

On-site
USD 180,000 - 240,000
AMD benefits at a glance
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

AMD • Austin (TX)

On-site
USD 180,000 - 260,000
AI/HPC Cluster Architect
AI/HPC Cluster Architect

Socket.dev • Austin (TX)

On-site
USD 140,000 - 230,000
AI/HPC Cluster Architect — Data Center Power & Network
AI/HPC Cluster Architect — Data Center Power & Network

AMD • Austin (TX)

On-site
USD 120,000 - 180,000
AMD benefits at a glance
AI/HPC Cluster Architect
AI/HPC Cluster Architect

Advanced Micro Devices • Austin (TX)

On-site
USD 120,000 - 180,000
AMD benefits
AI/HPC Cluster Architect - Scalable Data Center Design
AI/HPC Cluster Architect - Scalable Data Center Design

Advanced Micro Devices, Inc. • Austin (TX)

On-site
USD 140,000 - 190,000
AMD benefits
Equal opportunity employer
Visa sponsorship not available