AI Training Systems Architect (Distributed)

Unconventional AI

Palo Alto (CA)

On-site

USD 210,000 - 320,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Health benefits
401k matching
Unlimited PTO
Complimentary meals in Palo Alto

Job summary

Unconventional AI in Palo Alto seeks a senior ML systems engineer to design and build the next-generation training platform. You will co-design and implement training ecosystems alongside novel AI models and hardware platforms that push the boundaries of physics-based compute.

You will optimize multi-node distributed training, implement elastic sharding, and develop robust data streaming and checkpointing, with a focus on CUDA/Triton kernels and MFU benchmarking.

Qualifications

  • MS/PhD or equivalent in AI/ML, CS, Physics, Electrical Engineering, or Applied Math.
  • Experience mapping state-of-the-art AI model architectures to system performance with distributed training and parallelism.
  • Proven track record implementing production-grade training frameworks (Megatron-LM, DeepSpeed, Ray, PyTorch Lightning).

Responsibilities

  • Build and maintain highly optimized, model-specific training stacks for Gen Vision, language, and world models.
  • Design and scale multi-node distributed training with elastic sharding and robust data streaming pipelines.
  • Develop and optimize kernels using CUDA and Triton; design benchmarking for MFU, memory bandwidth, and convergence.
  • Translate model requirements into concrete infrastructure and hardware specs for cross-functional teams.

Job description

Unconventional AI in Palo Alto seeks a senior ML systems engineer to design and build the next-generation training platform. You will co-design and implement training ecosystems alongside novel AI models and hardware platforms that push the boundaries of physics-based compute.

You will optimize multi-node distributed training, implement elastic sharding, and develop robust data streaming and checkpointing, with a focus on CUDA/Triton kernels and MFU benchmarking.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior ML Training Systems Engineer - Distributed CUDA
Senior ML Training Systems Engineer - Distributed CUDA

Genesis AI • San Francisco (CA)

On-site
USD 180,000 - 260,000
Distributed AI Training Architect
Distributed AI Training Architect

cerence • United States

On-site
USD 180,000 - 250,000
Senior AI Systems Architect: Scalable Distributed Training
Senior AI Systems Architect: Scalable Distributed Training

Cerence AI • United States

On-site
USD 180,000 - 240,000
AI Systems, Training
AI Systems, Training

Unconventional AI • Palo Alto (CA)

On-site
USD 210,000 - 320,000
Health benefits
401k matching
Unlimited PTO
+1
Senior ML Architect: AI Systems & Novel Compute
Senior ML Architect: AI Systems & Novel Compute

Unconventional AI • Palo Alto (CA)

On-site
USD 180,000 - 280,000
Health benefits
401k matching
Unlimited PTO
+1
Distributed ML Research Scientist — Frontier-Scale Training
Distributed ML Research Scientist — Frontier-Scale Training

Ifm Us • Sunnyvale (CA)

On-site
USD 180,000 - 240,000
Health benefits
401K Plan
Paid time off
+2
Senior AI/ML Distributed Training Engineer
Senior AI/ML Distributed Training Engineer

Amazon • Cupertino (CA)

On-site
USD 193,300 - 261,500
AI Infrastructure Kernel Engineer for Large-Scale Training
AI Infrastructure Kernel Engineer for Large-Scale Training

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 350,000 - 475,000
Health, dental, and vision benefits
Unlimited PTO
Parental leave
+1
GPU Systems Engineer — Distributed Training & Inference
GPU Systems Engineer — Distributed Training & Inference

TensorScale AI • San Francisco (CA)

On-site
USD 180,000 - 240,000
Distributed AI Training Infrastructure Engineer
Distributed AI Training Infrastructure Engineer

Fireworks AI • United States

Remote
USD 130,000 - 210,000