Research Engineer, Benchmarking

Refresh AI

San Francisco (CA)

On-site

USD 120,000 - 150,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Refresh AI is seeking a Research Engineer in San Francisco to push the boundaries of benchmarking technology. You will build benchmarks that labs use for evaluating coding abilities and computer-use capability. Your role will require expertise in reinforcement learning and supervised fine-tuning, as well as a willingness to engage in full-stack development on our core tech stack (Vercel, Supabase, Render). This position offers a full-time role in a dynamic environment.

Qualifications

  • Experience with reinforcement learning and supervised fine-tuning.
  • Ability to ship full-stack work on core technologies when required.

Responsibilities

  • Build benchmarks for coding and computer-use capability.
  • Translate expert workflows into rigorous evaluations.
  • Run evaluations against frontier models and publish verifiable numbers.

Skills

Reinforcement learning
Supervised fine-tuning
Full-stack development

Tools

Vercel
Supabase
Render

Job description

# Research Engineer, BenchmarkingEngineeringSan FranciscoFull-timeBuild the benchmarks frontier labs use to measure real-world coding and computer-use capability. Translate expert workflows into rigorous, verifiable evaluations, run them against frontier models, and publish numbers that hold up under adversarial scrutiny.Across every role at Refresh: you're willing to ship full-stack work on our core stack (Vercel, Supabase, Render) when it's needed, and you're comfortable with reinforcement learning and supervised fine-tuning at a high level.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Research Engineer, Benchmarking
Research Engineer, Benchmarking

Refresh • San Francisco (CA)

On-site
USD 120,000 - 190,000
Frontier Benchmarking Research Engineer
Frontier Benchmarking Research Engineer

Refresh • San Francisco (CA)

On-site
USD 120,000 - 190,000
Benchmarking Research Engineer: Frontier Model Evaluations
Benchmarking Research Engineer: Frontier Model Evaluations

Refresh AI • San Francisco (CA)

On-site
USD 120,000 - 150,000
Benchmark Research Engineer for Frontier AI
Benchmark Research Engineer for Frontier AI

HUD • San Francisco (CA)

On-site
USD 140,000 - 190,000
Competitive compensation
Top-tier medical, dental, and vision (
Lunch and dinner in office
+5
Research Engineer
Research Engineer

Datacurve • San Francisco (CA)

On-site
USD 180,000 - 240,000
Senior Research Engineer, Public Data Benchmarks
Senior Research Engineer, Public Data Benchmarks

Firecrawl • San Francisco (CA)

Hybrid
USD 250,000 - 290,000
Competitive salary
Equity
PTO
+5
Benchmarking Software Engineer — Remote
Benchmarking Software Engineer — Remote

Office Hours • United States

On-site
USD 160,000 - 210,000
Equity
Medical/dental/vision
401(k)
+4
Evaluation Engineer: AI Coding Benchmarks & Tests
Evaluation Engineer: AI Coding Benchmarks & Tests

Mercor • United States

Remote
USD 120,000 - 180,000
Senior Technical Researcher & Benchmark Writer — Remote, Equity
Senior Technical Researcher & Benchmark Writer — Remote, Equity

SearchApi • United States

Remote
USD 80,000 - 120,000
Fully Remote
Equity share
Profit sharing
+2
Benchmark Engineer — Public Data Provider Leaderboard
Benchmark Engineer — Public Data Provider Leaderboard

Showcify, Inc. • United States

Hybrid
USD 250,000 - 290,000
Salary that makes sense: $250,000–$290
Generous equity
Generous PTO: 15 days +
+5