Staff Scientist: RL & Reward Modeling for Diffusion LLMs

Inception

San Francisco (CA)

On-site

USD 180,000 - 260,000

Full time

14 days+
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Inception seeks experienced scientists and engineers with deep expertise in post-training large language models through reinforcement learning. You will design and implement RL training pipelines for diffusion LLMs, develop reward modeling strategies, and build the algorithms that align model behavior with human intent at scale.

The role focuses on designing RL training pipelines, building reward models, and advancing alignment techniques for enterprise-grade LLMs, with emphasis on stability,

Qualifications

  • PhD or equivalent research/engineering experience in ML.
  • Proficient with PyTorch and distributed training.
  • Strong knowledge of transformers, LLMs, and RLHF workflows.

Responsibilities

  • Design, develop, and optimize RL training pipelines (PPO, DPO, RLHF) for diffusion-based LLMs.
  • Build and iterate reward models and evaluation of reward quality.
  • Implement approaches for fine-tuning and scaling generative AI models.
  • Work on data preprocessing, model evaluation, and enterprise alignment.
  • Research techniques for controlled text generation and constraint satisfaction.
  • Improve training stability, efficiency, and reproducibility of RL workloads.

Skills

RLHF experience
PPO/DPO familiarity
Transformer models
Distributed training
PyTorch experience

Education

BS/MS/PhD in CS

Tools

vLLM
TensorRT
SGLang

Job description

Inception seeks experienced scientists and engineers with deep expertise in post-training large language models through reinforcement learning. You will design and implement RL training pipelines for diffusion LLMs, develop reward modeling strategies, and build the algorithms that align model behavior with human intent at scale.

The role focuses on designing RL training pipelines, building reward models, and advancing alignment techniques for enterprise-grade LLMs, with emphasis on stability,

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Member of Technical Staff, Reinforcement Learning
Member of Technical Staff, Reinforcement Learning

Inception • San Francisco (CA)

On-site
USD 180,000 - 260,000
Staff Scientist — Diffusion LLM Architect
Staff Scientist — Diffusion LLM Architect

Inception • San Francisco (CA)

On-site
USD 180,000 - 230,000
ML Researcher: Diffusion & RL for Creative AI
ML Researcher: Diffusion & RL for Creative AI

Krea • San Francisco (CA), Northern (KY)

Hybrid
USD 180,000 - 260,000
Health & dental insurance
Flexible PTO
401k with company match
+3
Member of Technical Staff, Training
Member of Technical Staff, Training

Inception • San Francisco (CA)

On-site
USD 180,000 - 230,000
Production ML Engineer: Diffusion LLMs
Production ML Engineer: Diffusion LLMs

Inception • San Francisco (CA)

On-site
USD 200,000 - 350,000
Equity
Health insurance
Dental insurance
+4
Research Engineer - The Diffusion LLM Team
Research Engineer - The Diffusion LLM Team

Institute of Foundation Models • Sunnyvale (CA)

On-site
USD 120,000 - 160,000
Diffusion LLM Research Engineer: Scale & Release
Diffusion LLM Research Engineer: Scale & Release

Institute of Foundation Models • Sunnyvale (CA)

On-site
USD 120,000 - 160,000
RL Research Scientist - Post-Training on LLMs & Code Models
RL Research Scientist - Post-Training on LLMs & Code Models

AMD • Santa Clara (CA)

On-site
USD 150,000 - 230,000
Benefits at a glance
LLM Post-Training Scientist - SFT & RLHF
LLM Post-Training Scientist - SFT & RLHF

Scale AI, Inc. • San Francisco (CA)

On-site
USD 181,000 - 226,000
Health benefits
Retirement plan
Learning stipend
+2
Member of Technical Staff, Reinforcement Learning Infra
Member of Technical Staff, Reinforcement Learning Infra

Inception • San Francisco (CA)

On-site
USD 200,000 - 350,000
Health, dental, and vision insurance
Catered meals (breakfast, lunch, &
Equity
+1