Benchmarking Research Engineer: Frontier Model Evaluations

Refresh AI

San Francisco (CA)

On-site

USD 120,000 - 150,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Refresh AI is seeking a Research Engineer in San Francisco to push the boundaries of benchmarking technology. You will build benchmarks that labs use for evaluating coding abilities and computer-use capability. Your role will require expertise in reinforcement learning and supervised fine-tuning, as well as a willingness to engage in full-stack development on our core tech stack (Vercel, Supabase, Render). This position offers a full-time role in a dynamic environment.

Qualifications

  • Experience with reinforcement learning and supervised fine-tuning.
  • Ability to ship full-stack work on core technologies when required.

Responsibilities

  • Build benchmarks for coding and computer-use capability.
  • Translate expert workflows into rigorous evaluations.
  • Run evaluations against frontier models and publish verifiable numbers.

Skills

Reinforcement learning
Supervised fine-tuning
Full-stack development

Tools

Vercel
Supabase
Render

Job description

Refresh AI is seeking a Research Engineer in San Francisco to push the boundaries of benchmarking technology. You will build benchmarks that labs use for evaluating coding abilities and computer-use capability. Your role will require expertise in reinforcement learning and supervised fine-tuning, as well as a willingness to engage in full-stack development on our core tech stack (Vercel, Supabase, Render). This position offers a full-time role in a dynamic environment.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Research Engineer, Benchmarking
Research Engineer, Benchmarking

Refresh AI • San Francisco (CA)

On-site
USD 120,000 - 150,000
Research Engineer, Benchmarking
Research Engineer, Benchmarking

Refresh • San Francisco (CA)

On-site
USD 120,000 - 190,000
Frontier Benchmarking Research Engineer
Frontier Benchmarking Research Engineer

Refresh • San Francisco (CA)

On-site
USD 120,000 - 190,000
Benchmark Research Engineer for Frontier AI
Benchmark Research Engineer for Frontier AI

HUD • San Francisco (CA)

On-site
USD 140,000 - 190,000
Competitive compensation
Top-tier medical, dental, and vision (
Lunch and dinner in office
+5
AI Evaluations Engineer — Benchmarking Frontiers
AI Evaluations Engineer — Benchmarking Frontiers

Meta • Menlo Park (CA)

On-site
USD 180,000 - 240,000
Staff AI Research Engineer — Frontier Model Evaluations
Staff AI Research Engineer — Frontier Model Evaluations

Intelligence • San Francisco (CA)

On-site
USD 180,000 - 280,000
Meaningful equity
Biotech AI Research Engineer: Frontier Model Evaluation
Biotech AI Research Engineer: Frontier Model Evaluation

Benchling, Inc. • San Francisco (CA)

On-site
USD 150,000 - 230,000
Frontier AI Benchmark Researcher — Remote
Frontier AI Benchmark Researcher — Remote

Synthires • United States

Remote
USD 193,000 - 207,000
Fully remote opportunity
Flexible workload (5–40 hours/week)
Fully asynchronous work environment
AI Benchmarks & Evaluations Program Manager
AI Benchmarks & Evaluations Program Manager

Mercor • San Francisco (CA)

On-site
USD 120,000 - 200,000
Performance bonus structure
Equity grant
$15K relocation bonus
+7
Frontier AI Evaluation Engineer: RL Environments
Frontier AI Evaluation Engineer: RL Environments

OpenAI • San Francisco (CA)

On-site
USD 120,000 - 160,000