Lead RL Research Scientist – Post-Training for LLMs & Code

AMD

Santa Clara (CA)

On-site

USD 180,000 - 300,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

AMD, a leading semiconductor innovator in Santa Clara, seeks a Lead AI Research Scientist to advance reinforcement learning for post-training LLMs and code models. You will design reward models, curricula, and training recipes, addressing sparse or expensive labels from experts and simulators, while pushing robust, production-ready RL methods.

You will publish results at premier conferences and collaborate with infra to scale training, contributing to a practical RL roadmap that balances

Qualifications

  • PhD preferred with strong publication record.
  • Experience training RL or preference-based models at scale.
  • Experience with LLM post-training, RLHF/RLAIF, or policy optimization.

Responsibilities

  • Research and develop RL methods for post-training LLMs and code models on structured engineering tasks with verifiable or preference-based feedback.
  • Design reward models, curricula, and off-policy or on-policy training recipes suited to sparse, noisy, or expensive labels from experts and simulators.
  • Characterize failure modes (reward hacking, degenerate policies, instability) and propose mitigations grounded in experiments.
  • Collaborate with RL infra engineers to scale training; define interfaces for rollout generation, logging, and reproducibility.
  • Publish at top venues (e.g. NeurIPS, ICML, ICLR) and contribute internal technical leadership on the RL roadmap.

Skills

RL theory
RL algorithms
Academic publishing
GPUs
Distributed training
Code models
LLMs
RLHF/RLAIF
Policy optimization
Large-scale codebases

Education

PhD in Computer Science or ML

Tools

PyTorch
TensorFlow
JAX
MPI
Ray

Job description

AMD, a leading semiconductor innovator in Santa Clara, seeks a Lead AI Research Scientist to advance reinforcement learning for post-training LLMs and code models. You will design reward models, curricula, and training recipes, addressing sparse or expensive labels from experts and simulators, while pushing robust, production-ready RL methods.

You will publish results at premier conferences and collaborate with infra to scale training, contributing to a practical RL roadmap that balances

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Lead RL Scientist for LLM Post-Training & Code Models
Lead RL Scientist for LLM Post-Training & Code Models

AMD • Santa Clara (CA)

On-site
USD 130,000 - 160,000
Comprehensive benefits package
RL Research Scientist: Post-Training for LLMs & Code Models
RL Research Scientist: Post-Training for LLMs & Code Models

Advanced Micro Devices • Santa Clara (CA), Northern (KY)

Hybrid
USD 150,000 - 190,000
Lead AI Research Scientist, Reinforcement Learning (LLM) and Post-Training
Lead AI Research Scientist, Reinforcement Learning (LLM) and Post-Training

AMD • Santa Clara (CA)

On-site
USD 180,000 - 300,000
Research Scientist, Reinforcement Learning (LLM) and Post-training
Research Scientist, Reinforcement Learning (LLM) and Post-training

AMD • Santa Clara (CA)

On-site
USD 130,000 - 160,000
Comprehensive benefits package
AI Research Scientist, Reinforcement Learning (LLM) and Post-Training
AI Research Scientist, Reinforcement Learning (LLM) and Post-Training

Advanced Micro Devices • Santa Clara (CA), Northern (KY)

Hybrid
USD 150,000 - 190,000
Lead RL Infrastructure Engineer — Scalable GPU Training
Lead RL Infrastructure Engineer — Scalable GPU Training

AMD • Santa Clara (CA)

On-site
USD 130,000 - 180,000
Competitive benefits package
Research Engineer: RL & Post-Training LLM Systems
Research Engineer: RL & Post-Training LLM Systems

Preference Model • San Francisco (CA)

On-site
USD 120,000 - 150,000
Competitive cash and equity compensation (>90th percentile)
Health, vision, dental benefits
401K match
+2
ML Engineer — LLM Post-Training & RL Specialist
ML Engineer — LLM Post-Training & RL Specialist

NewsBreak • Mountain View (CA)

On-site
USD 130,000 - 160,000
Health, dental, and vision care
401(k) plan with company matching
Paid time off and holidays
RL Post-Training Scientist for LLMs
RL Post-Training Scientist for LLMs

Amazon Web Services (AWS) • Seattle (WA)

On-site
USD 167,000 - 227,000
Health insurance
401(k) matching
Paid time off
+1
Lead RL Infra Engineer - Scalable GPU Training Platforms
Lead RL Infra Engineer - Scalable GPU Training Platforms

Advanced Micro Devices • Santa Clara (CA)

On-site
USD 120,000 - 170,000