An application made for this job — a tailored resume and cover letter that speak straight to the posting.
Сбербанк ищет специалиста по RL для обучения VLM/LLM моделей, с опытом RLHF и GRPO. Работа предполагает проектирование пайплайнов, сбор и подготовку датасетов, а также создание метрик качества для reasoning. Взаимодействие с Pretrain, SFT и Infra обязательно, улучшение экспериментов и перенос в продакшн.
Требуется глубокое понимание распределенного обучения и опыт проведения RL-экспериментов. Конкретные процессы включают разработку и анализ аномалий, совместная работа с командами и менторинг при
Описание: GigaChat Vision - команда, которая занимается полным циклом обучения VLM-моделей.