backend разработчик LLM-сервисов

YADRO

United States

Remote

USD 140,000 - 200,000

Full time

42 hours ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

YADRO ищет опытного инженера по ИИ для разработки и поддержки GPU-кластеров инференса, обслуживающих десятки тысяч пользователей. Ваша задача — масштабирование, балансировка запросов, настройка лимитов и обеспечение SLA, а также внедрение новых LLM и интеграций с API/БД.

Кандидату потребуется глубокое знание Python (5+ лет), FastAPI, очереди и фоновые задачи, а также опыт работы с инференсом и инструментами vLLM, SGLang и OpenAI API.

Qualifications

  • Опыт разработки на Python от 5 лет.
  • Знание стандартов Python, включая типизацию, асинхронность и шаблоны проектирования.
  • Опыт создания высоконагруженных API на FastAPI.
  • Опыт работы с очередями, исполнителями и фоновыми задачами.
  • Опыт настройки инференса под высокую нагрузку: задержки, пропускная способность.
  • Глубокое знание инструментов инференса: vLLM, SGLang и OpenAI API.
  • Опыт интеграции ИИ-сервисов в корпоративную среду через API и базы данных.

Responsibilities

  • Проектировать и поддерживать GPU-кластер инференса для десятков тысяч пользователей.
  • Масштабировать, балансировать и приоритизировать запросы.
  • Настраивать пользовательские лимиты.
  • Оптимизировать производительность с кэшированием и пакетной обработкой.
  • Обеспечивать SLA и предотвращать регрессии.
  • Оценивать и внедрять новые LLM.
  • Разрабатывать ИИ-сервисы: AI Code Assistant, AI Chat и AI Code Review.
  • Проектировать пайплайны автоматизации вызовов инструментов и функций.
  • Интегрировать ИИ-сервисы с API и базами данных корпоративной среды.

Skills

Python
Type hints
Async programming
FastAPI
Background tasks
API design
Queue systems
GPU inference
vLLM
SGLang
OpenAI API

Tools

MCP

Job description

Описание

Описания нет

Задачи
  • Проектировать и поддерживать GPU-кластер инференса для десятков тысяч пользователей: масштабировать его, балансировать и приоритизировать запросы, настраивать пользовательские лимиты
  • Оптимизировать производительность с помощью кэширования и пакетной обработки
  • Обеспечивать SLA и предотвращать регрессии
  • Оценивать и внедрять новые LLM
  • Разрабатывать ИИ-сервисы: AI Code Assistant, AI Chat и AI Code Review
  • Проектировать пайплайны автоматизации: вызов инструментов и функций, обработку ошибок, управление контекстом и состоянием
  • Встраивать ИИ-сервисы в корпоративную среду, интегрируя их с API, базами данных и устаревшими системами
  • Проводить эксперименты, создавать MVP и выстраивать путь доработки решений до промышленной эксплуатации
  • Исследовать новые технологии и подходы для улучшения продуктов
Требования
  • Опыт разработки на Python от 5 лет
  • Знание стандартов Python, включая типизацию, асинхронность и шаблоны проектирования
  • Опыт создания высоконагруженных API на FastAPI или аналогах
  • Опыт работы с очередями, исполнителями и фоновыми задачами
  • Опыт построения шлюзов и маршрутизаторов, управления ключами, маршрутизацией и пользовательскими лимитами
  • Опыт поддержки высоконагруженных сервисов в промышленной эксплуатации, обеспечения стабильности контрактов и обработки ошибок
  • Глубокое знание инструментов инференса, включая vLLM, SGLang и OpenAI API, и понимание их внутренней работы
  • Опыт настройки инференса под высокую нагрузку: задержки, пропускная способность и управление ресурсами GPU
  • Опыт построения решений с вызовом инструментов и функций, включая MCP и защитные механизмы, и борьбы с галлюцинациями
Условия

График 5/2

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

LLM-инженер
LLM-инженер

Lexica • United States

Remote
USD 140,000 - 180,000
python разработчик для автоматизации контакт-центра
python разработчик для автоматизации контакт-центра

Туту • United States

On-site
USD 120,000 - 180,000
График 5/2
ДМС
Реферальная программа
+3
Backend-разработчик LLM-сервисов с GPU-инференсом
Backend-разработчик LLM-сервисов с GPU-инференсом

YADRO • United States

Remote
USD 140,000 - 200,000
AI-архитектор
AI-архитектор

Selectel • United States

On-site
USD 90,000 - 130,000
LLM Engineer: RAG Pipelines & Multi-Agent Systems
LLM Engineer: RAG Pipelines & Multi-Agent Systems

Lexica • United States

Remote
USD 140,000 - 180,000
nlp engineer for llm inference
nlp engineer for llm inference

NDA • United States

On-site
USD 120,000 - 180,000
Высокое вознаграждение
Возможность роста до Head of ML
mlops engineer для ML-инфраструктуры
mlops engineer для ML-инфраструктуры

NDA • United States

On-site
USD 120,000 - 190,000
Flexible schedule
Health insurance from month 1
Discounts on services
+4
ml engineer для инференса LLM
ml engineer для инференса LLM

NDA • United States

On-site
USD 140,000 - 240,000
prompt-инженер
prompt-инженер

SimbirSoft • United States

Remote
USD 120,000 - 170,000
Гибкий график
Наставничество и сертификация за счет”
Участие в конференциях
ai agent engineer NLP/LLM
ai agent engineer NLP/LLM

IEK GROUP • United States

On-site
USD 120,000 - 180,000