Frontier Benchmarking Research Engineer

Refresh

San Francisco (CA)

On-site

USD 120,000 - 190,000

Full time

14 days+
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Refresh is seeking a Research Engineer focused on benchmarking, to build rigorous evaluations of real-world coding and computer-use capabilities. You will translate expert workflows into verifiable tests and run benchmarks against frontier models.

In this role you’ll work across our core stack (Vercel, Supabase, Render) and engage with reinforcement learning and supervised fine-tuning at a high level to publish robust numbers.

Job description

Refresh is seeking a Research Engineer focused on benchmarking, to build rigorous evaluations of real-world coding and computer-use capabilities. You will translate expert workflows into verifiable tests and run benchmarks against frontier models.

In this role you’ll work across our core stack (Vercel, Supabase, Render) and engage with reinforcement learning and supervised fine-tuning at a high level to publish robust numbers.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Research Engineer, Benchmarking
Research Engineer, Benchmarking

Refresh • San Francisco (CA)

On-site
USD 120,000 - 190,000
Research Engineer, Benchmarking
Research Engineer, Benchmarking

Refresh AI • San Francisco (CA)

On-site
USD 120,000 - 150,000
Benchmarking Research Engineer: Frontier Model Evaluations
Benchmarking Research Engineer: Frontier Model Evaluations

Refresh AI • San Francisco (CA)

On-site
USD 120,000 - 150,000
Benchmark Research Engineer for Frontier AI
Benchmark Research Engineer for Frontier AI

HUD • San Francisco (CA)

On-site
USD 140,000 - 190,000
Competitive compensation
Top-tier medical, dental, and vision (
Lunch and dinner in office
+5
Frontier AI Benchmark Researcher — Remote
Frontier AI Benchmark Researcher — Remote

Synthires • United States

Remote
USD 193,000 - 207,000
Fully remote opportunity
Flexible workload (5–40 hours/week)
Fully asynchronous work environment
Frontier AI Benchmarks Engineer — Field‑Facing Data & Eval
Frontier AI Benchmarks Engineer — Field‑Facing Data & Eval

Alexander Chapman • United States

On-site
USD 140,000 - 190,000
Evaluation Engineer: AI Coding Benchmarks & Tests
Evaluation Engineer: AI Coding Benchmarks & Tests

Mercor • United States

Remote
USD 120,000 - 180,000
Research Engineer
Research Engineer

Datacurve • San Francisco (CA)

On-site
USD 180,000 - 240,000
Frontier AI Benchmark Task Auditor
Frontier AI Benchmark Task Auditor

Mercor • United States

Remote
USD 110,000 - 170,000
AI Evaluations Engineer — Benchmarking Frontiers
AI Evaluations Engineer — Benchmarking Frontiers

Meta • Menlo Park (CA)

On-site
USD 180,000 - 240,000