ML engineer LLM inference & architecture

NDA

United States

In loco

USD 180.000 - 240.000

Tempo pieno

4 giorni fa
Candidati tra i primi
Generatore di candidature

Una candidatura fatta su misura per questo lavoro — un curriculum e una lettera di presentazione personalizzati, perfettamente in linea con l'annuncio.

Supera i filtri ATS

Vantaggi offerti da questo lavoro

Fully remote
Home office stipend
Education support
Medical reimbursements
Equity program
Wellness days
Paid vacations

Descrizione del lavoro

HireHi — американский стартап, создающий персонализированных AI-компаньонов с эмоциональной гибкостью, памятью и самоизменением. Мы развиваем архитектуры на основе открытых моделей и обслуживаем миллионы диалогов.

Ваша роль: ускорять и масштабировать LLM в продакшене, оптимизировать инференс до 1T+ параметров и разворачивать распределённый инференс на многосерверных кластерах. Вы будете обучать и дообучать модели, улучшать чат-алгоритмы и руководить техническими работами команды.

Competenze

  • Глубокий опыт оптимизации LLM в продакшене с SGLang, vLLM или TensorRT-LLM.
  • Опыт распределённого инференса или обучения крупных моделей с MoE и многосерверными кластерами.
  • Понимание профилирования GPU, работы ядер attention и KV-кэша.
  • Практический опыт дообучения моделей с RLHF, DPO или аналогами.
  • Сильный опыт работы с PyTorch и Transformers.
  • Профессиональное владение английским или русским языком.

Mansioni

  • Ускорять и масштабировать большие языковые модели в продакшене.
  • Оптимизировать инференс моделей до 1T+ параметров с помощью SGLang, KV- и prefix-кэширования, speculative decoding и квантования.
  • Разворачивать распределённый инференс на многосерверных кластерах и GPU.
  • Обучать и дообучать модели-компаньоны с RLHF, DPO и прочими методами.
  • Улучшать агентные каркасы и алгоритмы чата.
  • Проводить техническое руководство: проверять эксперименты команды из семи инженеров NLP/CV, выбирать направления и оценивать гипотезы.

Conoscenze

LLM оптимизация
distributed inference
GPU профилирование
RLHF/DPO
PyTorch
Transformers
Английский/Русский
CUDA/Triton

Strumenti

CUDA/Triton
TensorRT

Descrizione del lavoro

Описание

Компания разрабатывает персонализированных AI-компаньонов с эмоциональной гибкостью, памятью и самоизменением. Она развивает собственные агентные архитектуры на основе открытых моделей и данных и обслуживает десятки миллионов диалогов.

Задачи
  • Ускорять и масштабировать большие языковые модели в продакшене
  • Оптимизировать инференс моделей до 1T+ параметров с помощью SGLang, KV- и prefix-кэширования, speculative decoding и квантизации
  • Разворачивать распределённый инференс с использованием MoE, tensor, expert и pipeline parallelism на многосерверных и много-GPU-кластерах
  • Обучать и дообучать модели-компаньоны с помощью SFT, DPO и RLHF
  • Улучшать агентные каркасы и алгоритмы чата
  • Проводить техническое руководство: проверять эксперименты команды из семи инженеров NLP/CV, выбирать направления и оценивать гипотезы
Требования
  • Глубокий опыт оптимизации LLM в продакшене с SGLang, vLLM или TensorRT-LLM
  • Опыт распределённого инференса или обучения крупных моделей с MoE и многосерверными кластерами
  • Понимание профилирования GPU, работы ядер attention и KV-кэша
  • Практический опыт дообучения моделей с RLHF, DPO или аналогами
  • Сильный опыт работы с PyTorch и Transformers
  • Профессиональное владение английским или русским языком
  • Будет плюсом: опыт разработки ядер CUDA/Triton, опыт в CV с ускорением инференса крупных генеративных моделей, работа в AI-стартапах или BigTech, профильное математическое или компьютерно-научное образование
Условия
  • Полностью удалённая работа
  • 28 Дней отпуска и 7 wellness-дней в год без больничных листов
  • $1,000 На обустройство домашнего офиса раз в 3 года
  • Софинансирование обучения и конференций в размере 50%
  • Компенсация медицинских расходов до $1,000 в год
  • Доступ к опциональной программе с опционами или долей от выручки после года работы
Ottieni la revisione del curriculum gratis e riservata.

o trascina qui il file.

Similar jobs

Offerte di lavoro simili che vale la pena confrontare

ml engineer for llm performance optimization
ml engineer for llm performance optimization

NDA • Stati Uniti

In loco
USD 150.000 - 230.000
Leave + wellness days
Training coverage
Health stipend
+1
nlp engineer for llm inference
nlp engineer for llm inference

NDA • Stati Uniti

In loco
USD 120.000 - 180.000
Высокое вознаграждение
Возможность роста до Head of ML
ml engineer агентных решений
ml engineer агентных решений

NDA • Stati Uniti

In loco
USD 22.000 - 43.000
ДМС
Страхование
Компенсация жилья
+3
ml engineer for AI companions
ml engineer for AI companions

Joi AI • Stati Uniti

Remoto
USD 150.000 - 210.000
Ежегодный отпуск 28 дней
Ежегодные wellness-дни
Referral бонус до $5000
+3
LLM Engineer
LLM Engineer

Золотое Яблоко • Stati Uniti

In loco
USD 90.000 - 130.000
Гибридная работа
Официальное трудоустройство
ДМС
ml engineer для инференса LLM
ml engineer для инференса LLM

NDA • Stati Uniti

In loco
USD 140.000 - 240.000
ml инженер nlp llm в startups platform
ml инженер nlp llm в startups platform

Wildberries • Stati Uniti

In loco
USD 180.000 - 230.000
Языковые клубы
Корпоративный университет и развитие
ДМС со стоматологией
+3
руководитель ML/AI-платформы
руководитель ML/AI-платформы

Циан • Stati Uniti

In loco
USD 180.000 - 260.000
ДМС с первого рабочего дня (стоматолог
Госпитализация и страхование путешеств
5 дополнительных дней отдыха в год
+4
ml engineer for LLM inference
ml engineer for LLM inference

Cast AI • Stati Uniti

In loco
USD 180.000 - 270.000
Equity 10%
Annual hackathon
Learning budget
ml разработчик для мультимодальных моделей
ml разработчик для мультимодальных моделей

Яндекс • Stati Uniti

In loco
USD 180.000 - 260.000
Доступ к передовым моделям
Расширенная медицинская страховка
Болничный 30 дней
+1