Research Scientist — Reinforcement Learning (Foundation Models)

Sigma Nova

Paris

On-site

EUR 75,000 - 110,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Sigma Nova is seeking a Research Scientist (Reinforcement Learning) to bring RL into the core of how foundation models are adapted for industrial use. You’ll design learning signals from expert feedback and build robust evaluation protocols.

You’ll work with engineers to deploy RL methods on production-ready models, address safety and uncertainty, and publish open research artifacts as appropriate.

Qualifications

  • PhD or equivalent research experience in Reinforcement Learning / Machine Learning.
  • Strong foundations in RL: policy optimization, off-policy learning, exploration, credit assignment.
  • Ability to design rigorous experiments, debug failure modes, and iterate with scientific discipline.

Responsibilities

  • Turn expert validation/correction into reliable learning signals for RL.
  • Design practical feedback interfaces and signals for real operational settings.
  • Develop RL methods that sit on top of foundation models used in production.
  • Build evaluation protocols addressing robustness, uncertainty, safety, auditability and cost of error.
  • Collaborate with scientists/engineers to ship demonstrators linking benchmarks to field outcomes.

Skills

Reinforcement Learning
Python
PyTorch
Experiment design
Debugging

Education

PhD or equivalent research experience in RL/ML

Tools

Python
PyTorch

Job description

The role

We’re hiring a Research Scientist (Reinforcement Learning) to help bring RL into the core of how foundation models are adapted and improved for industrial use.

In industry, models don’t live in isolation: domain experts validate, correct, and act on model outputs. We want RL to leverage that expert feedback not only as a post‑training patch, but increasingly earlier in the pipeline, shaping objectives, training signals, and adaptation strategies.

What you’ll work on
Human‑in‑the‑loop reinforcement learning
  • Turn expert validation/correction into a reliable learning signal.

  • Design feedback interfaces/signals that are practical in real operational settings.

RL for industrial foundation models
  • Develop RL methods that sit on top of (or integrate with) foundation models used in production.

  • Explore ways for RL to intervene earlier in the chain (not just after deployment).

From research to deployment
  • Build evaluation protocols aligned with real constraints: robustness, uncertainty reduction, safety, auditability, and cost of error.

  • Work closely with scientists/engineers to ship demonstrators that connect benchmarks to field outcomes.

What we’re looking for

PhD (preferred) or equivalent research experience in Reinforcement Learning / Machine Learning.Strong foundations in RL (e.g., policy optimization, off‑policy learning, offline RL, exploration, credit assignment).Ability to design rigorous experiments, debug failure modes, and iterate fast with scientific discipline.Strong programming skills (Python; deep learning stack such as PyTorch).Nice to haveExperience with real‑world RL constraints (noisy/limited feedback, safety requirements, deployment considerations).Comfort with complex data modalities (time series, scientific/industrial signals, multimodal setups).Publications or open research artifacts in RL / sequential decision‑making.

Why join

Work on RL problems that matter in the real world: expert feedback loops, uncertainty reduction, and mission‑critical constraints.A research culture that values clarity, rigor, and humility and that connects fundamental ideas to deployable systems.High ownership in a small team: you’ll shape direction, not just execute tasks.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

RL Scientist — Industrial Foundation Models
RL Scientist — Industrial Foundation Models

Sigma Nova • Paris

On-site
EUR 75,000 - 110,000
Research Engineer
Research Engineer

Built Different • Paris

Hybrid
EUR 119,000 - 161,000
Founding equity
Hybrid work model
AI Research Scientist
AI Research Scientist

Meta • Paris

On-site
EUR 120,000 - 180,000
Founding RL Research Engineer — Hybrid EU, Equity
Founding RL Research Engineer — Hybrid EU, Equity

Built Different • Paris

Hybrid
EUR 119,000 - 161,000
Founding equity
Hybrid work model
Research Engineer
Research Engineer

Sigma Nova • Paris

Hybrid
EUR 70,000 - 120,000
Research Engineer — Robot Learning
Research Engineer — Robot Learning

Bleu Robotics • Paris

On-site
EUR 65,000 - 90,000
Equity
English-speaking environment
Research Engineer — Robot Learning
Research Engineer — Robot Learning

Bleu Robotics • Paris

On-site
EUR 70,000 - 110,000
Equity
Competitive compensation
Research Engineer - Robot Learning
Research Engineer - Robot Learning

Bleu Robotics • Paris

On-site
EUR 65,000 - 100,000
Equity
English-speaking environment
Fair compensation
+1
Research Engineer, Machine Learning
Research Engineer, Machine Learning

Mistral AI • Paris

On-site
EUR 90,000 - 130,000
Healthcare coverage
Parental leave
Relocation support
+1
Machine Learning Engineer - Reinforcement Learning
Machine Learning Engineer - Reinforcement Learning

jda • Paris

On-site
EUR 75,000 - 115,000