AI Evaluation Researcher: Post-Training Signals & Metrics

Mosaic.tech

San Francisco (CA)

On-site

USD 140,000 - 190,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Thinking Machines in San Francisco seeks a researcher to advance internal evaluations and signals for post-training models. You will collaborate with researchers and engineers across the research organization, shaping evaluation creation, usability, and auditing.

Your work will span agentic evaluations, score systems, and scalable signals that improve data and training signals, with emphasis on robustness, truth-grounding, and generalization across environments.

Qualifications

  • Bachelor’s degree or equivalent in CS/ML/Physics/Math with strong grounding.
  • Experience designing, building, or analyzing evaluations, benchmarks, datasets, graders, or similar systems.
  • Strong written and verbal communication across research and engineering teams.

Responsibilities

  • Create internal evaluations and research signals for model capabilities and behaviors.
  • Develop usability evaluations for real research and product workflows.
  • Improve evaluation correctness and reliability across ground truth, graders, and disagreements.
  • Build onboarding and auditing methodologies for internal signals.
  • Develop agentic evaluations and cross-environment generalization.
  • Support scalable signal-bearing core sets for RL research.

Skills

Evaluations design
Benchmarks
Python
Deep learning frameworks
Communication
Research writing
Agentic evaluation
Harneses & cross-env
Open-ended task evaluation

Education

Bachelor’s degree in CS/ML/Physics/Math
PhD in CS/ML/Math/Physics

Tools

Python
PyTorch
TensorFlow
JAX

Job description

Thinking Machines in San Francisco seeks a researcher to advance internal evaluations and signals for post-training models. You will collaborate with researchers and engineers across the research organization, shaping evaluation creation, usability, and auditing.

Your work will span agentic evaluations, score systems, and scalable signals that improve data and training signals, with emphasis on robustness, truth-grounding, and generalization across environments.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Research, Post-Training Evals
Research, Post-Training Evals

Mosaic.tech • San Francisco (CA)

On-site
USD 140,000 - 190,000
Research, Post-Training Evals
Research, Post-Training Evals

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 140,000 - 200,000
Post-Training AI Research Engineer
Post-Training AI Research Engineer

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 350,000 - 475,000
Health benefits
Dental benefits
Vision benefits
+3
ML Research Engineer: Fine-Tuning & Evaluation Systems
ML Research Engineer: Fine-Tuning & Evaluation Systems

HonestAI • San Francisco (CA)

On-site
USD 140,000 - 190,000
Research Engineer, AI Evaluation & Metrics
Research Engineer, AI Evaluation & Metrics

Menlo Ventures • New York (NY)

On-site
USD 500,000 - 850,000
Evaluation Platform Engineer: Build Scalable ML Benchmarks
Evaluation Platform Engineer: Build Scalable ML Benchmarks

Thinking Machines Lab • San Francisco (CA)

On-site
USD 300,000 - 475,000
Health, dental, and vision benefits
Unlimited PTO
Paid parental leave
+1
Research Engineer: AI Evaluation & Metrics
Research Engineer: AI Evaluation & Metrics

Anthropic • San Francisco (CA)

Hybrid
USD 350,000 - 850,000
Equity donation matching
Generous vacation and parental leave
Flexible working hours
+1
AI Evaluation Scientist (Math PhD) & Trainer
AI Evaluation Scientist (Math PhD) & Trainer

Mercor • Los Angeles (CA)

On-site
USD 110,000 - 165,000
Staff Engineer - AI Evaluation & Research Execution
Staff Engineer - AI Evaluation & Research Execution

METR • Berkeley (CA)

Hybrid
USD 285,548 - 503,116
Catered lunch and dinner daily
In-office gym and shower
Unlimited PTO
+6
Research Engineer — AGI Evaluation & On-Device Perf
Research Engineer — AGI Evaluation & On-Device Perf

AGI, Inc. • San Francisco (CA)

On-site
USD 120,000 - 160,000
Competitive cash and equity
Top-tier relocation support
In-person work environment