AI Cloud GPU ML Infra Engineer — Performance & Scale

HireHi

United States

Remote

USD 120,000 - 210,000

Full time

3 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Конкурентная оплата
Карьерный рост и обучение
Гибкость и ответственность
Коллаборативная культура
Работа над значимыми AI-проектаами
Международная команда

Job summary

Nebius ищет специалиста по производительности GPU для анализа на уровне систем, драйверов и ядер. Ваша задача — улучшать скорость и стабильность современных моделей на кластерах, работать с CUDA и ROCm стеками, участвовать в разработке инструментов мониторинга.

Опыт в PyTorch, JAX и других фреймворках, а также знание Docker и Kubernetes обязательно. Готовность работать в международной среде и в динамичном командах приветствуется.

Qualifications

  • Глубокие знания теории машинного обучения и архитектур вычислений.
  • Понимание параллелизма при обучении и инференсе больших нейронных сетей.
  • Опыт работы с современными фреймворками ML: PyTorch, JAX, Megatron-LM, Tensort-LLM.

Responsibilities

  • Профилирование и анализ производительности GPU на уровне системы и ядра.
  • Сравнение производительности across платформами и стеками CUDA/ROCm.
  • Отладка и оптимизация ML- workload для GPU-оборудования и выявление узких мест.
  • Проведение приемочного тестирования новых GPU-кластеров на совместимость и стабильность.
  • Эксперименты с конфигурациями GPU-систем и влияние межсоединений на производительность.
  • Разработка инструментов и панелей для визуализации метрик производительности.
  • Участие в разработке внутренних инструментов и практик.

Skills

ML theory
GPU performance
Model training
Performance profiling
Python

Tools

Docker
Kubernetes
CUDA
NCCL
Nsight/NVProf

Job description

Nebius ищет специалиста по производительности GPU для анализа на уровне систем, драйверов и ядер. Ваша задача — улучшать скорость и стабильность современных моделей на кластерах, работать с CUDA и ROCm стеками, участвовать в разработке инструментов мониторинга.

Опыт в PyTorch, JAX и других фреймворках, а также знание Docker и Kubernetes обязательно. Готовность работать в международной среде и в динамичном командах приветствуется.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

GPU Benchmark Engineer for AI Cloud Infra
GPU Benchmark Engineer for AI Cloud Infra

Nebius • United States

Remote
USD 150,000 - 190,000
GPU ML Benchmarking Engineer for Next-Gen AI Infra
GPU ML Benchmarking Engineer for Next-Gen AI Infra

Nebius • Amsterdam (VA)

On-site
USD 130,000 - 190,000
Competitive compensation
Career growth and learning
Flexibility and ownership
+2
GPU Systems Engineer for AI Inference & Performance
GPU Systems Engineer for AI Inference & Performance

Nebius • United States

Remote
USD 180,000 - 260,000
Competitive compensation
Career growth
Flexible ownership & autonomy
+3
Senior HPC Systems Engineer: GPU Clusters & AI Infra
Senior HPC Systems Engineer: GPU Clusters & AI Infra

Nebius • United States

Remote
USD 180,000 - 240,000
Competitive pay
Career growth
Flexibility and ownership
+3
ML Infrastructure Engineer
ML Infrastructure Engineer

Nebius • Amsterdam (VA)

On-site
USD 130,000 - 190,000
Competitive compensation
Career growth and learning
Flexibility and ownership
+2
Senior AI Systems Engineer — GPU/HPC Troubleshooter
Senior AI Systems Engineer — GPU/HPC Troubleshooter

Nebius • United States

On-site
USD 180,000 - 224,000
Health insurance
401(k) match
Parental leave
+2
Senior ML Engineer - GPU Inference & Large-Scale AI Cloud
Senior ML Engineer - GPU Inference & Large-Scale AI Cloud

Nebius • United States

Remote
USD 180,000 - 250,000
AI Cloud Infra Deployment Lead
AI Cloud Infra Deployment Lead

HireHi • United States

Remote
USD 140,000 - 180,000
AI Infra Engineer — GPU Cloud, Kubernetes/Slurm
AI Infra Engineer — GPU Cloud, Kubernetes/Slurm

Blue Signal Search • San Francisco (CA)

On-site
USD 180,000 - 240,000
Annual bonus
Equity participation
Comprehensive benefits
+1
AI Infra Engineer: Kubernetes on Bare Metal GPUs (Remote)
AI Infra Engineer: Kubernetes on Bare Metal GPUs (Remote)

vCluster • New York (NY)

Hybrid
USD 150,000 - 200,000
Competitive Salary
Platinum-Level Insurance
Flexible Working Schedule
+1