Senior Cloud Fabric Architect for GPU Networking

Nvidia

Sassari

On-site

EUR 120,000 - 180,000

Full time

5 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

NVIDIA is seeking a Senior Cloud Infrastructure and Network Operations Architect to own Day 2 fabric operations for Cloud Partner estates, guiding InfiniBand, RoCE/Ethernet, and NVLink/NVSwitch across multi-tenant AI/HPC systems.

You will lead hardware bring-up validation, fleet reliability, and runbooks for partner teams, with hands-on tuning of NICs/DPUs, switch OS, and Kubernetes networking in a fast, open-source–first fabric ecosystem.

Qualifications

  • 5+ years in data center networking and large-scale operations.
  • Deep knowledge of InfiniBand, RoCE/Ethernet, and NVLink/NVSwitch.
  • Experience with NVL72-class platforms and NICs/DPUs.
  • Strong Linux (RedHat/Ubuntu) and switch OS skills.
  • Automation skills: Python, Bash, Ansible, Terraform.
  • Kubernetes networking in GPU clusters and multi-tenant isolation.

Responsibilities

  • Own Day 2 fabric operations across NVIDIA Cloud Partner fleets (NVLink/NVSwitch partition management, maintenance-partition isolation, safe partition-change workflows)
  • Manage switch software and firmware lifecycle including upgrades and rollout campaigns with minimal production disruption
  • Support Day 1 fabric validation and acceptance (InfiniBand/UFM bring-up, Spectrum-X/RoCE config, burn-in against MTBI/goodput targets)
  • Minimise handover time to production by reducing duplicated validation across hardware bring-up and partner operations
  • Drive fleet-wide fabric reliability through telemetry, fault detection, remediation, and root-cause analysis of network-induced job failures
  • Provide consultative guidance and hands-on troubleshooting across fabric stack (NICs/DPUs, switch OS, routing, Kubernetes networking) and lead knowledge transfer with runbooks for partner teams
  • Serve as technical leader for assigned accounts and present to executive stakeholders
  • Deep understanding of data center architectures and RDMA fabrics
  • Hands-on experience with InfiniBand/UFM, Spectrum-X Ethernet, Cumulus Linux and/or SONiC
  • Strong Linux knowledge and HPC/AI traffic patterns
  • Automation and Observability skills: Python/Bash, IaC tools (Ansible, Terraform), GitOps, Grafana/Loki/Prometheus
  • Proven ability to measure and improve MTBI and job goodput, and lead architectural reviews with executives
  • Experience with Kubernetes networking in GPU clusters and multi-tenant network isolation concepts
  • Strong consultative mindset with knowledge transfer and runbook creation
  • Strong communication and presentation skills
  • Cross-functional collaboration
  • InfiniBand and UFM
  • Spectrum-X Ethernet

Skills

Data center networking
Fabric engineering
NVLink/NVSwitch
InfiniBand
RoCE/Ethernet
RDMA fabrics
Linux
Automation
Python
Ansible
Terraform
Grafana
Prometheus
Kubernetes networking
Multi-tenant isolation
UFM
Spectrum-X
Cumulus Linux
SONiC
NICs/DPUs
ConnectX/BlueField
NVL72

Tools

Cumulus Linux
SONiC
ConnectX/BlueField
NICs/DPUs
Kubernetes

Job description

NVIDIA is seeking a Senior Cloud Infrastructure and Network Operations Architect to own Day 2 fabric operations for Cloud Partner estates, guiding InfiniBand, RoCE/Ethernet, and NVLink/NVSwitch across multi-tenant AI/HPC systems.

You will lead hardware bring-up validation, fleet reliability, and runbooks for partner teams, with hands-on tuning of NICs/DPUs, switch OS, and Kubernetes networking in a fast, open-source–first fabric ecosystem.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Cloud Fabric Architect for GPU AI/HPC Networking
Senior Cloud Fabric Architect for GPU AI/HPC Networking

Nvidia • Udine

On-site
EUR 90,000 - 150,000
Senior Cloud Fabric & GPU Networking Architect
Senior Cloud Fabric & GPU Networking Architect

Nvidia • Rovigo

On-site
EUR 110,000 - 150,000
Senior Cloud Networking & Infra Architect: Day 2 Fabric Ops
Senior Cloud Networking & Infra Architect: Day 2 Fabric Ops

Nvidia • Macerata

On-site
EUR 90,000 - 130,000
Senior Cloud Fabric Operations Architect for GPU AI
Senior Cloud Fabric Operations Architect for GPU AI

Nvidia • Rimini

On-site
EUR 140,000 - 200,000
Senior GPU Cloud Networking & Reliability Architect
Senior GPU Cloud Networking & Reliability Architect

Nvidia • Teramo

On-site
EUR 120,000 - 180,000
Senior GPU Cloud Network Fabric & Day-2 Ops Architect
Senior GPU Cloud Network Fabric & Day-2 Ops Architect

Nvidia • Perugia

On-site
EUR 90,000 - 130,000
Senior Cloud Fabric Architect for GPU Networks
Senior Cloud Fabric Architect for GPU Networks

Nvidia • Piemonte

On-site
EUR 120,000 - 160,000
Lead GPU Cloud Fabric & Network Architect
Lead GPU Cloud Fabric & Network Architect

Nvidia • Caserta

On-site
EUR 120,000 - 180,000
Senior GPU Cloud Networking & Fabric Operations Architect
Senior GPU Cloud Networking & Fabric Operations Architect

Nvidia • Firenze

On-site
EUR 120,000 - 180,000
Senior AI/Data Center Network Fabric Architect
Senior AI/Data Center Network Fabric Architect

NVIDIA Corporation • Italy

Remote
EUR 120,000 - 180,000