Senior Cluster Reliability Architect - AI/HPC Platforms

Socket.dev

Austin (TX)

On-site

USD 180,000 - 260,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

AMD Benefits

Job summary

AMD is seeking a Principal Cluster Reliability Architect to define and drive the reliability strategy for next-generation AI and HPC cluster platforms. This role serves as the technical authority for end-to-end cluster reliability, spanning compute, networking, storage, and control plane architectures.

The successful candidate will influence architecture, deployment, validation, and operational readiness across AMD reference designs and large-scale customer deployments.

Qualifications

  • Bachelor's degree in Computer Engineering, Computer Science, Electrical Engineering, or a related technical discipline.

Responsibilities

  • Define and implement a comprehensive cluster reliability architecture framework across the full infrastructure lifecycle.
  • Establish reliability requirements for reference architectures and customer deployments.
  • Drive architecture decisions to improve fault tolerance, redundancy, and recoverability.
  • Partner with SRE and Platform Operations to define sustainable operational models.
  • Define standards for observability, health monitoring, and lifecycle management.

Skills

Cluster architecture
Distributed systems
Linux systems
Production-scale infra
Kubernetes
Slurm
ROCm
GPU clusters
AI training
Inference infra

Education

Bachelor's degree in Computer Engineering, Computer Science, Electrical Engineering

Tools

InfiniBand
RoCE

Job description

AMD is seeking a Principal Cluster Reliability Architect to define and drive the reliability strategy for next-generation AI and HPC cluster platforms. This role serves as the technical authority for end-to-end cluster reliability, spanning compute, networking, storage, and control plane architectures.

The successful candidate will influence architecture, deployment, validation, and operational readiness across AMD reference designs and large-scale customer deployments.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Lead Architect, AI/HPC Cluster Reliability
Lead Architect, AI/HPC Cluster Reliability

AMD • Austin (TX)

On-site
USD 180,000 - 260,000
Lead AI/HPC Cluster Reliability Architect
Lead AI/HPC Cluster Reliability Architect

Advanced Micro Devices • Austin (TX)

On-site
USD 180,000 - 240,000
AMD benefits at a glance
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

Socket.dev • Austin (TX)

On-site
USD 180,000 - 260,000
AMD Benefits
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

Advanced Micro Devices • Austin (TX)

On-site
USD 180,000 - 240,000
AMD benefits at a glance
Principal Cluster Reliability Architect
Principal Cluster Reliability Architect

AMD • Austin (TX)

On-site
USD 180,000 - 260,000
AI/HPC Cluster Architect
AI/HPC Cluster Architect

AMD • Austin (TX)

On-site
USD 140,000 - 200,000
Rack-Level Reliability Engineer for HPC & AI Systems
Rack-Level Reliability Engineer for HPC & AI Systems

Advanced Micro Devices • Secaucus (NJ)

On-site
USD 120,000 - 160,000
AI Platform Architect for Hyperscale Datacenters
AI Platform Architect for Hyperscale Datacenters

Socket.dev • Santa Clara (CA)

On-site
USD 180,000 - 240,000
Senior AI Cluster Delivery Lead
Senior AI Cluster Delivery Lead

Advanced Micro Devices • Seattle (WA)

On-site
USD 150,000 - 210,000
AMD Benefits
AI/HPC Cluster Architect
AI/HPC Cluster Architect

Socket.dev • Austin (TX)

On-site
USD 140,000 - 230,000