Senior AI Infra Architect for GPU Clusters

Yotta

Hinoba-an

On-site

PHP 9,404,000 - 13,166,000

Full time

5 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Yotta Data Services is seeking a senior AI infrastructure architect to design, deploy, and operate large-scale GPU clusters for distributed training and inference. You will lead multi-node GPU systems, optimize OS/kernel configurations, and craft compute blueprints for diverse AI workloads.

The role requires deep hands-on experience with NVIDIA GPUs, InfiniBand/RDMA, and high-performance storage, with a strong focus on security, reliability, and observability across multi-tenant environments.

Qualifications

  • Deep hands-on experience with GPU systems (NVIDIA).
  • Strong background in InfiniBand/RDMA/RoCEv2 and high‑performance storage.
  • Experience designing large-scale AI infrastructure with 100+ GPUs is a plus.

Responsibilities

  • Design and deploy large-scale GPU clusters for distributed training and inference.
  • Architect multi-node GPU systems with NVLink/NVSwitch and PCIe Gen5.
  • Define OS/kernel/driver/runtime configs for AI workloads (CUDA/ROCm, NCCL, UCX, OFED).
  • Develop compute blueprints for training, fine-tuning, retrieval, and batch inference.
  • Ensure secure, scalable, high-availability AI compute clusters.
  • Implement monitoring and performance optimization (Prometheus, Grafana, DCGM).
  • Architect secure multi-tenant GPU environments with IAM/RBAC and encryption in transit.

Skills

GPU systems
InfiniBand/RDMA/RoCEv2
High-performance storage
Multi-node GPU architectures
AI frameworks familiarity
Kubernetes GPU environments
Terraform
Ansible

Education

B.E./B.Tech or equivalent

Tools

MAAS/iPXE/Metal³
NVMe/NPF fabrics

Job description

Yotta Data Services is seeking a senior AI infrastructure architect to design, deploy, and operate large-scale GPU clusters for distributed training and inference. You will lead multi-node GPU systems, optimize OS/kernel configurations, and craft compute blueprints for diverse AI workloads.

The role requires deep hands-on experience with NVIDIA GPUs, InfiniBand/RDMA, and high-performance storage, with a strong focus on security, reliability, and observability across multi-tenant environments.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Lead Solution Architect
Lead Solution Architect

Yotta • Hinoba-an

On-site
PHP 9,404,000 - 13,166,000
Senior GPU Systems Architect: Multi-GPU AI Data Center
Senior GPU Systems Architect: Multi-GPU AI Data Center

NVIDIA Corporation • Hinoba-an

Hybrid
PHP 7,524,000 - 11,912,000
Hybrid work model
GPU System Architect for Scalable AI Data Centers
GPU System Architect for Scalable AI Data Centers

NVIDIA Corporation • Hinoba-an

Hybrid
PHP 1,200,000 - 1,800,000
Senior GPU System/Fabrics Architect
Senior GPU System/Fabrics Architect

NVIDIA Corporation • Hinoba-an

On-site
PHP 7,524,000 - 11,912,000
Hybrid work model
GPU Architect
GPU Architect

NVIDIA Corporation • Hinoba-an

Hybrid
PHP 1,200,000 - 1,800,000
Senior Cloud Platform Engineer - GPU Inference Orchestration
Senior Cloud Platform Engineer - GPU Inference Orchestration

Neura Market • Hinoba-an

On-site
PHP 2,322,000 - 3,980,000
Senior Staff Site Reliability Engineer
Senior Staff Site Reliability Engineer

NVIDIA Corporation • Hinoba-an

Hybrid
PHP 2,000,000 - 4,500,000
Hybrid work model
Senior AI Compute & GPU Infrastructure Engineer
Senior AI Compute & GPU Infrastructure Engineer

Kraken • Mexico

On-site
PHP 4,923,000 - 6,770,000
Senior Software Engineer — Infra Agent Systems Remote India Together AI India
Senior Software Engineer — Infra Agent Systems Remote India Together AI India

Neura Market • Hinoba-an

Remote
INR 3,000,000 - 5,400,000
Senior Solutions Architect, Generative AI
Senior Solutions Architect, Generative AI

NVIDIA Corporation • Hinoba-an

On-site
PHP 2,400,000 - 3,600,000