Lead Architect, AI/HPC Cluster Reliability

AMD

Austin (TX)

On-site

USD 180,000 - 260,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

AMD is seeking a Principal Cluster Reliability Architect to define and drive the reliability strategy for next‑generation AI and HPC cluster platforms. You will influence architecture, deployment, validation, and operational readiness across AMD reference designs and customer deployments.

You will lead cross‑functional teams, mentor engineers, and shape reliability roadmaps to deliver resilient, scalable infrastructure in production environments.

Qualifications

  • Bachelor’s degree in Computer Engineering, Computer Science, Electrical Engineering, or a related technical discipline.
  • Extensive experience with large-scale cluster reliability architectures and platform design.
  • Strong background in distributed systems, Linux infrastructure, and production-grade infrastructure.

Responsibilities

  • Define and implement a reliability architecture framework for cluster platforms across compute, networking, storage, and control plane.
  • Drive reliability requirements and KPIs for AMD reference architectures and customer deployments.
  • Lead cross-functional alignment and mentor engineers in reliability engineering and operations.

Skills

Large-scale cluster architecture
Distributed systems
Linux infrastructure
Production-scale cloud/HPC
SRE methodologies
Observability & telemetry
Chaos engineering
Leadership & influence

Education

Bachelor's degree in Computer Engineering, Computer Science, or Electrical Engineering

Tools

Kubernetes
Slurm
ROCm
InfiniBand
RoCE
GPU cluster architectures

Job description

AMD is seeking a Principal Cluster Reliability Architect to define and drive the reliability strategy for next‑generation AI and HPC cluster platforms. You will influence architecture, deployment, validation, and operational readiness across AMD reference designs and customer deployments.

You will lead cross‑functional teams, mentor engineers, and shape reliability roadmaps to deliver resilient, scalable infrastructure in production environments.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Lead AI/HPC Cluster Reliability Architect
Lead AI/HPC Cluster Reliability Architect

Advanced Micro Devices • Austin (TX)

On-site
USD 180,000 - 240,000
AMD benefits at a glance
Senior Cluster Reliability Architect - AI/HPC Platforms
Senior Cluster Reliability Architect - AI/HPC Platforms

Socket.dev • Austin (TX)

On-site
USD 180,000 - 260,000
AMD Benefits
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

AMD • Austin (TX)

On-site
USD 180,000 - 260,000
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

Advanced Micro Devices • Austin (TX)

On-site
USD 180,000 - 240,000
AMD benefits at a glance
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

Socket.dev • Austin (TX)

On-site
USD 180,000 - 260,000
AMD Benefits
AI/HPC Cluster Architect
AI/HPC Cluster Architect

AMD • Austin (TX)

On-site
USD 140,000 - 200,000
AI/HPC Cluster Architect
AI/HPC Cluster Architect

Socket.dev • Austin (TX)

On-site
USD 140,000 - 230,000
AI/HPC Cluster Architect — Data Center Power & Network
AI/HPC Cluster Architect — Data Center Power & Network

AMD • Austin (TX)

On-site
USD 120,000 - 180,000
AMD benefits at a glance
Rack-Level Reliability Engineer for HPC & AI Systems
Rack-Level Reliability Engineer for HPC & AI Systems

Advanced Micro Devices • Secaucus (NJ)

On-site
USD 120,000 - 160,000
AI Platform Architect for Hyperscale Datacenters
AI Platform Architect for Hyperscale Datacenters

Socket.dev • Santa Clara (CA)

On-site
USD 180,000 - 240,000