LLM Inference Engineer — Distributed, High-Performance NLP

HireHi

United States

Remote

USD 120,000 - 180,000

Full time

29 hours ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Высокое вознаграждение
Возможность роста до Head of ML

Job summary

HireHi ищет инженера ML для оптимизации инференса больших языковых моделей и развития распределённой инфраструктуры с несколькими GPU. Требуется опыт работы с SGLang, vLLM или TensorRT-LLM и владение PyTorch/Transformers. Работа предполагает обучение, дообучение и развитие агентных архитектур в команде NLP/CV.

Ожидается знание распределённого обучения, QoS-инфа, KV кэш и квантование. Условия — высокий уровень вознаграждения и перспектива роста до Head of ML в США.

Qualifications

  • Иметь производственный опыт оптимизации инференса LLM (SGLang, vLLM или TensorRT-LLM)
  • Опыт распределённого инференса и обучения больших моделей: MoE, параллелизм по тензорам, экспертам или конвейерам, многоузловые GPU
  • Разбираться в KV cache, ядрах attention, пакетной обработке, квантовании и профилировании GPU
  • Опыт обучения, дообучения и последующего обучения моделей: RLHF, DPO или аналоги
  • Уверенно работать с PyTorch и Transformers
  • Английский B2+

Responsibilities

  • Оптимизировать скорость, стоимость и стабильность инференса больших LLM
  • Развивать распределённый инференс на многоузловой инфраструктуре с несколькими GPU
  • Обучать и дообучать LLM, развивать агентные архитектуры
  • Обеспечивать техническое лидерство NLP/CV-команды

Skills

inference optimization
Distributed inference
RLHF/DPO training
PyTorch
Transformers

Tools

PyTorch
Transformers
AWS

Job description

HireHi ищет инженера ML для оптимизации инференса больших языковых моделей и развития распределённой инфраструктуры с несколькими GPU. Требуется опыт работы с SGLang, vLLM или TensorRT-LLM и владение PyTorch/Transformers. Работа предполагает обучение, дообучение и развитие агентных архитектур в команде NLP/CV.

Ожидается знание распределённого обучения, QoS-инфа, KV кэш и квантование. Условия — высокий уровень вознаграждения и перспектива роста до Head of ML в США.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

nlp engineer for llm inference
nlp engineer for llm inference

HireHi • United States

Remote
USD 120,000 - 180,000
Высокое вознаграждение
Возможность роста до Head of ML
ML Engineer по инференсу LLM — удалённо
ML Engineer по инференсу LLM — удалённо

HireHi • United States

Remote
USD 140,000 - 240,000
ml engineer для инференса LLM
ml engineer для инференса LLM

HireHi • United States

Remote
USD 140,000 - 240,000
LLM Engineer - Train & Deploy Large NLP Models
LLM Engineer - Train & Deploy Large NLP Models

HireHi • United States

Remote
USD 120,000 - 210,000
ML-инженер для прикладных AI-решений: NLP/LLM, CV
ML-инженер для прикладных AI-решений: NLP/LLM, CV

Enfint • United States

Remote
USD 140,000 - 200,000
Курсы и конференции
Корпоративная техника
ДМС
ML Engineer for AI Companions & Open Research
ML Engineer for AI Companions & Open Research

HireHi • United States

Remote
USD 150,000 - 210,000
Ежегодный отпуск 28 дней
Ежегодные wellness-дни
Referral бонус до $5000
+3
LLM AI Inference Performance Engineer
LLM AI Inference Performance Engineer

Intel • California (MO)

Hybrid
USD 171,000 - 315,000
LLM Inference Optimization Engineer — Frontier Performance
LLM Inference Optimization Engineer — Frontier Performance

NLP PEOPLE • Sonoma (CA)

On-site
USD 120,000 - 160,000
LLM Inference Engineer (Mid, Senior, Staff)
LLM Inference Engineer (Mid, Senior, Staff)

Hippocratic AI Inc. • Menlo Park (CA)

On-site
USD 180,000 - 280,000
ML Engineer — Production LLMs & Agent Systems (Remote)
ML Engineer — Production LLMs & Agent Systems (Remote)

HireHi • United States

Hybrid
USD 102,000 - 170,000
Equity
Remote-friendly