Senior AI Runtime Engineer: Scale GPU Training

Cacheflow

San Francisco (CA)

On-site

USD 160,000 - 225,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Equity
Annual performance bonus
Comprehensive benefits package

Job summary

Cacheflow is seeking a Senior Software Engineer for AI Runtime at Databricks, located in San Francisco. You will be instrumental in building and scaling systems for large-scale GPU training, ensuring high throughput and resilience in training across expansive fleets of accelerators.

The role demands 5+ years of experience in distributed systems, proficiency with GPU training infrastructure, and a commitment to driving engineering excellence. The pay range is between $160,000 and $225,000 USD.

Qualifications

  • 5+ years of experience building and operating large-scale distributed systems.
  • Strong understanding of training resilience patterns.
  • Proven ability to deliver technically complex projects.

Responsibilities

  • Drive the architecture and evolution of AIR's managed GPU training platform.
  • Solve large-scale training challenges, including orchestration and performance.
  • Champion engineering excellence and mentor engineers.

Skills

Large-scale distributed systems
GPU training infrastructure
High-performance computing
ML systems
Distributed training frameworks
Algorithms and data structures
System design

Education

BS in Computer Science or related field
MS or PhD preferred

Job description

Cacheflow is seeking a Senior Software Engineer for AI Runtime at Databricks, located in San Francisco. You will be instrumental in building and scaling systems for large-scale GPU training, ensuring high throughput and resilience in training across expansive fleets of accelerators.

The role demands 5+ years of experience in distributed systems, proficiency with GPU training infrastructure, and a commitment to driving engineering excellence. The pay range is between $160,000 and $225,000 USD.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior AI Runtime Engineer — GPU Training Platform
Senior AI Runtime Engineer — GPU Training Platform

Databricks • Mountain View (CA)

On-site
USD 160,000 - 225,000
Comprehensive benefits
Annual performance bonus
Equity options
Staff AI Runtime Architect - Scale GPU Training
Staff AI Runtime Architect - Scale GPU Training

Databricks • Mountain View (CA)

On-site
USD 190,000 - 265,000
Annual performance bonus
Equity options
Comprehensive benefits package
Senior AI Runtime & GPU Training Systems Engineer
Senior AI Runtime & GPU Training Systems Engineer

Cacheflow • San Francisco (CA)

On-site
USD 190,000 - 265,000
Equity
Annual performance bonus
Comprehensive benefits
Staff Software Engineer, AI Runtime - Scalable GPU Training
Staff Software Engineer, AI Runtime - Scalable GPU Training

Databricks Inc. • Mountain View (CA)

On-site
USD 190,000 - 265,000
Senior AI Runtime Engineering Manager: Scale GPU Training
Senior AI Runtime Engineering Manager: Scale GPU Training

Menlo Ventures • San Francisco (CA)

On-site
USD 228,000 - 298,000
Senior GenAI Kernel & GPU Optimization Engineer
Senior GenAI Kernel & GPU Optimization Engineer

Databricks • Mountain View (CA)

On-site
USD 166,000 - 225,000
Comprehensive benefits
Annual performance bonus
Equity options
Senior Engineering Manager, AI Runtime & GPU Training
Senior Engineering Manager, AI Runtime & GPU Training

Databricks • Mountain View (CA)

On-site
USD 228,000 - 298,000
Senior Engineering Manager, AI Runtime & GPU Training
Senior Engineering Manager, AI Runtime & GPU Training

Databricks • Mountain View (WY)

On-site
USD 229,000 - 297,000
Senior AI Infrastructure Engineer — Scale GPU Clusters
Senior AI Infrastructure Engineer — Scale GPU Clusters

AI Breaking Wire • San Francisco (CA)

On-site
USD 280,000 - 400,000
Equity
Medical, dental, and vision benefits
Unlimited PTO
+2
Senior AI Training Infra Engineer - Scale GPU Clusters
Senior AI Training Infra Engineer - Scale GPU Clusters

Designworks Talent • Bellevue (WA)

Hybrid
USD 180,000 - 240,000
Medical insurance
401(k) with company match
Paid holidays