RL Research Scientist, Foundation Models & Self-Play

Lever, Inc.

Sunnyvale (CA)

On-site

USD 150,000 - 450,000

Full time

14 days+
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

MBZUAI seeks a Research Scientist to advance reinforcement learning for foundation models. You will prototype novel RL methods, contribute to training infrastructure, and publish results through collaborations with researchers, data scientists, and engineers.

Based in Sunnyvale, the role emphasizes cross-disciplinary work to push emergent capabilities and robust deployment in real-world settings.

Qualifications

  • MSc/MEng or PhD in ML, CS or related field.
  • Minimum 3+ years hands‑on reinforcement learning experience.
  • Strong Python development for research-grade code and scalable data pipelines.
  • Experience applying novel RL algorithms to practical applications.
  • Strong publication record or open-source contributions.

Responsibilities

  • Develop novel research toward scalable self-play for foundation-model training.
  • Initiate RL algorithmic approaches to drive emergent capabilities in Foundation Models.
  • Full-stack engineering from data curation to production of models with well-documented code.
  • Contribute to technical reports and research publications.
  • Represent MBZUAI at conferences and engage with the open-source community.
  • Contribute to large-scale RL training and inference frameworks.

Skills

Reinforcement learning
Python
Open-source
Publications

Education

MSc/MEng or PhD in ML/CS

Tools

PyTorch
Jax
Diffusion models

Job description

MBZUAI seeks a Research Scientist to advance reinforcement learning for foundation models. You will prototype novel RL methods, contribute to training infrastructure, and publish results through collaborations with researchers, data scientists, and engineers.

Based in Sunnyvale, the role emphasizes cross-disciplinary work to push emergent capabilities and robust deployment in real-world settings.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Research Scientist - Reinforcement Learning
Research Scientist - Reinforcement Learning

Lever, Inc. • Sunnyvale (CA)

On-site
USD 150,000 - 450,000
ML Research Intern: Foundation Models & RL
ML Research Intern: Foundation Models & RL

Mixpeek • San Francisco (CA)

On-site
USD 60,000 - 90,000
Mentorship by senior researchers
Research publication opportunities
PhD internship stipend
RL Research Scientist: Reasoning & Autoformalization
RL Research Scientist: Reasoning & Autoformalization

Pramaana Labs • Palo Alto (CA)

On-site
USD 150,000 - 230,000
PhD ML Research Intern — RL & Foundation Models
PhD ML Research Intern — RL & Foundation Models

Modal Labs • New York (NY)

On-site
USD 34,440 - 82,656
Research Engineer/Scientist, Reinforcement Learning Research · San Francisco · Full-time →
Research Engineer/Scientist, Reinforcement Learning Research · San Francisco · Full-time →

Tau Robotics, Inc. • San Francisco (CA)

On-site
USD 150,000 - 210,000
AI Research Scientist - RL & Environment Generation
AI Research Scientist - RL & Environment Generation

Cerebro • San Francisco (CA)

On-site
USD 180,000 - 240,000
Research Scientist, Reinforcement Learning
Research Scientist, Reinforcement Learning

Pramaana Labs • Palo Alto (CA)

On-site
USD 150,000 - 230,000
research scientist - RL
research scientist - RL

Cerebro • San Francisco (CA)

On-site
USD 180,000 - 240,000
RL Research Scientist - Post-Training on LLMs & Code Models
RL Research Scientist - Post-Training on LLMs & Code Models

AMD • Santa Clara (CA)

On-site
USD 150,000 - 230,000
Benefits at a glance
RL Scaling Research Scientist for Frontier Models
RL Scaling Research Scientist for Frontier Models

Periodic Labs • San Francisco (CA)

On-site
USD 225,000 - 350,000