rl engineer для VLM

HireHi

United States

Remote

USD 29,000 - 43,000

Full time

2 days ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Ежегодный пересмотр зарплаты
Годовая премия
Корпоративный спортзал
Расширенная ДМС
Льготное страхование для семьи
Пенсионная программа
Ипотека на выгодных условиях
Образовательные программы СберУниверсс
Бесплатная подписка СберПрайм+
Рекомендации друзей в команду

Job summary

Сбербанк ищет специалиста по RL для обучения VLM/LLM моделей, с опытом RLHF и GRPO. Работа предполагает проектирование пайплайнов, сбор и подготовку датасетов, а также создание метрик качества для reasoning. Взаимодействие с Pretrain, SFT и Infra обязательно, улучшение экспериментов и перенос в продакшн.

Требуется глубокое понимание распределенного обучения и опыт проведения RL-экспериментов. Конкретные процессы включают разработку и анализ аномалий, совместная работа с командами и менторинг при

Qualifications

  • Глубокое понимание RL для LLM/VLM и практический опыт с RLHF, GRPO и PPO
  • Понимание полного цикла обучения VLM/LLM: pretrain, SFT и RL
  • Опыт распределённого обучения с DeepSpeed и FSDP, а также с фреймворками inference
  • Практический опыт постановки, проведения и анализа RL-экспериментов
  • Умение самостоятельно решать сложные технические задачи в условиях неопределённости
  • Умение выстраивать процессы в условиях неопределённости
  • Опыт взаимодействия со смежными командами и заинтересованными сторонами
  • Системное мышление: видеть весь цикл от данных и проектирования reward до оценки и производственных метрик
  • Будет плюсом: менторинг/лидерство, публикации по RL/LLM/VLM, вывод моделей RL в продакшн

Responsibilities

  • Разрабатывать и улучшать RL-подходы для обучения VLM/LLM-моделей
  • Проектировать reward-функции и пайплайны обучения, настраивать масштабирование
  • Определять требования к данным для RL и участвовать в пайплайнах сбора и подготовки датасетов
  • Развивать систему оценки качества reasoning и метрики eval-фреймворка
  • Работать на стыке с Pretrain, SFT и Infra, обеспечивать перенос экспериментов в прод
  • Переводить идеи из статей в эксперименты и инженерные решения
  • Разбирать задачи, отлаживать эксперименты и находить узкие места
  • Делиться экспертизой с командой и помогать улучшать качество решений
  • Развивать инфраструктуру для RL

Skills

RL для LLM/VLM
RLHF/GRPO/PPO
распределённое обучение
постановка и анализ RL-экспериментов
согласованность решений между этапами

Tools

DeepSpeed
FSDP
inference frameworks

Job description

Описание: GigaChat Vision - команда, которая занимается полным циклом обучения VLM-моделей.

Задачи:
  • Разрабатывать и улучшать RL-подходы для обучения VLM/LLM-моделей: выбирать алгоритмы, ставить эксперименты и анализировать результаты
  • Проектировать reward-функции и пайплайны обучения, выстраивать стратегии масштабирования под разные домены и сценарии, влиять на метрики качества
  • Определять требования к данным для RL, участвовать в создании пайплайнов сбора, фильтрации и подготовки датасетов
  • Развивать систему оценки качества reasoning: внедрять и улучшать метрики в существующем eval-фреймворке, предлагать новые способы измерения качества
  • Работать на стыке с Pretrain, SFT и Infra, обеспечивать согласованность решений и перенос экспериментов в производственный пайплайн
  • Следить за развитием области и переводить идеи из статей в проверяемые эксперименты и инженерные решения
  • Разбирать технические задачи, отлаживать эксперименты и аномалии в обучении, находить узкие места и доводить решения до результата
  • Делиться экспертизой с командой, участвовать в проверке кода и помогать улучшать качество решений и подходы к экспериментам
  • Развивать инфраструктуру для RL
Требования:
  • Глубокое понимание RL для LLM/VLM и практический опыт с RLHF, GRPO и PPO
  • Понимание полного цикла обучения VLM/LLM: pretrain, SFT и RL, а также влияния решений на каждом этапе на итоговые метрики
  • Опыт распределённого обучения с DeepSpeed и FSDP, а также с фреймворками inference
  • Практический опыт постановки, проведения и анализа RL-экспериментов
  • Умение самостоятельно решать сложные технические задачи в условиях неопределённости
  • Умение выстраивать процессы в условиях неопределённости
  • Опыт взаимодействия со смежными командами и заинтересованными сторонами
  • Системное мышление: способность видеть весь цикл от данных и проектирования reward до оценки и производственных метрик
  • Будет плюсом: опыт менторинга или технического лидерства в отдельных проектах, публикации или вклад в открытые проекты по RL/LLM/VLM, опыт вывода моделей, обученных с RL, в производство и поддержки их качества
Условия:
  • Доступ к сообществу DS&AI, объединяющему более 600 специалистов банка
  • Дайджест последних разработок в DS&AI и отчёты с крупнейших конференций мира
  • Возможность быть соавтором научно-исследовательских работ и статей для международных конференций
  • Ежегодный пересмотр зарплаты и годовая премия
  • Корпоративный спортзал и зоны отдыха
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • Расширенная ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • Ипотека на более выгодных условиях - до 7%
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнёров
  • Вознаграждение за рекомендацию друзей в команду Сбера
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

cv engineer для обучения VLM
cv engineer для обучения VLM

HireHi • United States

Hybrid
USD 120,000 - 190,000
Годовая премия
Спортзал и зоны отдыха
Образовательные программы СберУниверси
Senior Data Scientist безопасного ИИ
Senior Data Scientist безопасного ИИ

HireHi • United States

On-site
USD 28,000 - 43,000
Корпоративный спортзал и зоны отдыха
Образовательные программы СберУниверси
ДМС и льготное страхование для семьи
+4
Senior AI Security Scientist — Hybrid/Remote
Senior AI Security Scientist — Hybrid/Remote

HireHi • United States

Hybrid
USD 28,000 - 43,000
Корпоративный спортзал и зоны отдыха
Образовательные программы СберУниверси
ДМС и льготное страхование для семьи
+4
ml инженер для строительных процессов
ml инженер для строительных процессов

HireHi • United States

Remote
USD 120,000 - 210,000
Спортивный зал
Зоны отдыха и сна в офисе
Образовательные программы СберУниверсി
+3
ml инженер LLM
ml инженер LLM

HireHi • United States

Remote
USD 1,800 - 2,500
Расширенная ДМС
Семейное страхование
Корпоративная пенсионная программа
+1
системный аналитик брокерских продуктов
системный аналитик брокерских продуктов

HireHi • United States

Remote
USD 90,000 - 150,000
Годовая премия
ДМС и пенсионная программа
Образовательные программы СберУниверс爆
Deep Learning/CUDA Engineer
Deep Learning/CUDA Engineer

HireHi • United States

On-site
USD 18,000 - 25,000
Годовая премия
Корпоративный спортзал и зоны отдыха
Расширенный ДМС
+2
ml инженер для LLM-платформы
ml инженер для LLM-платформы

HireHi • United States

Remote
USD 140,000 - 210,000
ДМС с стоматологией
Страховка от несчастных случаев
Курсы по софт- и хард-скиллам
+1
qa тестировщик (auto) платформы Platform V HighLoad
qa тестировщик (auto) платформы Platform V HighLoad

HireHi • United States

Remote
USD 11,000 - 16,000
Расширенный ДМС
Страхование семьи
Корпоративная пенсионная программа
+5
data scientist в Trust & Safety
data scientist в Trust & Safety

HireHi • United States

Remote
USD 150,000 - 210,000
Обучение и развитие
ДМС со стоматологией
Корпоративный спорт
+3