Senior Cloud Networking & Infra Architect: Day 2 Fabric Ops

Nvidia

Macerata

On-site

EUR 90,000 - 130,000

Full time

4 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

NVIDIA is seeking a Senior Cloud Infrastructure Architect to own Day 2 fabric operations for Cloud Partner estates. You will guide reliability and performance of InfiniBand, RoCE/Ethernet, and NVLink/NVSwitch fabrics at scale, working cross-functionally to architect, validate, and operate complex GPU-centric networks across multi-tenant environments.

This hands-on leadership role focuses on operational excellence, incident response, and knowledge transfer to partner teams, shaping how large

Qualifications

  • 5+ years in data center networking, fabric engineering, or large-scale network operations.
  • Deep understanding of data center architectures and RDMA fabrics (InfiniBand, RoCE/Ethernet) including topology, routing, congestion control, and QoS.
  • Hands-on experience with InfiniBand/UFM, Spectrum-X Ethernet, Cumulus Linux and/or SONiC, ConnectX/BlueField NICs/DPUs, NVLink/NVSwitch on NVL72-class platforms.
  • Strong Linux knowledge (RedHat/Ubuntu), switch OS internals, security, and HPC/AI traffic patterns.
  • Automation and Observability skills: Python/Bash, IaC tools (Ansible, Terraform), GitOps, Grafana/Loki/Prometheus.
  • Proven ability to measure and improve MTBI and job goodput, and to lead architectural reviews with executive stakeholders.
  • Experience with Kubernetes networking in GPU clusters and multi-tenant network isolation concepts.

Responsibilities

  • Own Day 2 fabric operations across NVIDIA Cloud Partner fleets (NVLink/NVSwitch partition management, maintenance-part isolation, safe partition-change workflows).
  • Manage switch software and firmware lifecycle including upgrades and rollout campaigns with minimal production disruption.
  • Support Day 1 fabric validation and acceptance (InfiniBand/UFM bring-up, Spectrum-X/RoCE config, burn-in against MTBI/goodput targets).
  • Minimise handover time to production by reducing duplicated validation across hardware bring-up and partner operations.
  • Drive fleet-wide fabric reliability through telemetry, fault detection, remediation, and root-cause analysis of network-induced job failures.
  • Provide consultative guidance and hands-on troubleshooting across fabric stack (NICs/DPUs, switch OS, routing, Kubernetes networking) and lead knowledge transfer with runbooks for partner teams.
  • Serve as technical leader for assigned accounts and present to executive stakeholders.
  • 5+ years in data center networking, fabric engineering, or large-scale network operations.
  • Deep understanding of data center architectures and RDMA fabrics (InfiniBand, RoCE/Ethernet) including topology, routing, congestion control, and QoS.
  • Strong Linux knowledge (RedHat/Ubuntu), switch OS internals, security, and HPC/AI traffic patterns.

Skills

Data center networking
InfiniBand
RoCE/Ethernet
RDMA fabrics
Kubernetes networking
Python
IaC (Ansible/Terraform)
Linux
Network automation
Troubleshooting

Tools

Cumulus Linux
SONiC
ConnectX/BlueField NICs/DPUs
NVLink/NVSwitch
UFM
Spectrum-X Ethernet
Kubernetes
Grafana/Prometheus
Ansible
Terraform

Job description

NVIDIA is seeking a Senior Cloud Infrastructure Architect to own Day 2 fabric operations for Cloud Partner estates. You will guide reliability and performance of InfiniBand, RoCE/Ethernet, and NVLink/NVSwitch fabrics at scale, working cross-functionally to architect, validate, and operate complex GPU-centric networks across multi-tenant environments.

This hands-on leadership role focuses on operational excellence, incident response, and knowledge transfer to partner teams, shaping how large

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Cloud Fabric & GPU Networking Architect
Senior Cloud Fabric & GPU Networking Architect

Nvidia • Rovigo

On-site
EUR 110,000 - 150,000
Senior Cloud Fabric Architect for GPU AI/HPC Networking
Senior Cloud Fabric Architect for GPU AI/HPC Networking

Nvidia • Udine

On-site
EUR 90,000 - 150,000
Senior GPU Cloud Networking & Reliability Architect
Senior GPU Cloud Networking & Reliability Architect

Nvidia • Teramo

On-site
EUR 120,000 - 180,000
Senior GPU Cloud Network Fabric & Day-2 Ops Architect
Senior GPU Cloud Network Fabric & Day-2 Ops Architect

Nvidia • Perugia

On-site
EUR 90,000 - 130,000
Senior Cloud Fabric Architect for GPU Networking
Senior Cloud Fabric Architect for GPU Networking

Nvidia • Sassari

On-site
EUR 120,000 - 180,000
Senior Cloud Fabric Operations Architect for GPU AI
Senior Cloud Fabric Operations Architect for GPU AI

Nvidia • Rimini

On-site
EUR 140,000 - 200,000
Senior GPU Cloud Networking & Fabric Operations Architect
Senior GPU Cloud Networking & Fabric Operations Architect

Nvidia • Firenze

On-site
EUR 120,000 - 180,000
Senior Cloud Fabric Architect for GPU Networks
Senior Cloud Fabric Architect for GPU Networks

Nvidia • Piemonte

On-site
EUR 120,000 - 160,000
Lead GPU Cloud Fabric & Network Architect
Lead GPU Cloud Fabric & Network Architect

Nvidia • Caserta

On-site
EUR 120,000 - 180,000
Senior Cloud Infrastructure And Network Operations Solutions Architect
Senior Cloud Infrastructure And Network Operations Solutions Architect

Nvidia • Caserta

On-site
EUR 120,000 - 180,000