Benchmarking Research Engineer: Frontier Model Evaluations

Refresh AI

San Francisco (CA)

On-site

USD 120,000 - 150,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Refresh AI is seeking a Research Engineer in San Francisco to push the boundaries of benchmarking technology. You will build benchmarks that labs use for evaluating coding abilities and computer-use capability. Your role will require expertise in reinforcement learning and supervised fine-tuning, as well as a willingness to engage in full-stack development on our core tech stack (Vercel, Supabase, Render). This position offers a full-time role in a dynamic environment.

Qualifications

  • Experience with reinforcement learning and supervised fine-tuning.
  • Ability to ship full-stack work on core technologies when required.

Responsibilities

  • Build benchmarks for coding and computer-use capability.
  • Translate expert workflows into rigorous evaluations.
  • Run evaluations against frontier models and publish verifiable numbers.

Skills

Reinforcement learning
Supervised fine-tuning
Full-stack development

Tools

Vercel
Supabase
Render

Job description

Refresh AI is seeking a Research Engineer in San Francisco to push the boundaries of benchmarking technology. You will build benchmarks that labs use for evaluating coding abilities and computer-use capability. Your role will require expertise in reinforcement learning and supervised fine-tuning, as well as a willingness to engage in full-stack development on our core tech stack (Vercel, Supabase, Render). This position offers a full-time role in a dynamic environment.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Research Engineer, Benchmarking
Research Engineer, Benchmarking

Refresh AI • San Francisco (CA)

On-site
USD 120,000 - 150,000
Remote AI Benchmark Engineer & Researcher
Remote AI Benchmark Engineer & Researcher

Pathway • Palo Alto (CA)

Remote
USD 120,000 - 180,000
AI Benchmarking Engineer — Evaluation & Failure Analysis
AI Benchmarking Engineer — Evaluation & Failure Analysis

Doist • San Francisco (CA)

On-site
USD 150,000 - 210,000
Bi-annual bonus
Equity grant
Relocation bonus
+6
Staff AI Research Engineer — Frontier Model Evaluations
Staff AI Research Engineer — Frontier Model Evaluations

Intelligence • San Francisco (CA)

On-site
USD 180,000 - 280,000
Meaningful equity
AI Benchmarking & Evaluation Engineer
AI Benchmarking & Evaluation Engineer

Apply • San Francisco (CA), Northern (KY)

Hybrid
USD 150,000 - 210,000
Bi-annual bonus
Equity grant
Relocation bonus
+8
AI Benchmarks & Evaluations Program Manager
AI Benchmarks & Evaluations Program Manager

Mercor • San Francisco (CA)

On-site
USD 120,000 - 200,000
Performance bonus structure
Equity grant
$15K relocation bonus
+7
ML Safety & Benchmarking Research Engineer
ML Safety & Benchmarking Research Engineer

Apple Inc. • San Francisco (CA)

On-site
USD 181,000 - 273,000
Comprehensive medical and dental coverage
Retirement benefits
Employee stock purchase plan
+1
Frontier AI Evaluation Engineer: RL Environments
Frontier AI Evaluation Engineer: RL Environments

OpenAI • San Francisco (CA)

On-site
USD 120,000 - 160,000
Research Engineer - Frontier AI Training & Evals
Research Engineer - Frontier AI Training & Evals

Visa Hunt • San Francisco (CA), Northern (KY)

Hybrid
USD 140,000 - 200,000
Competitive compensation
Medical, dental, vision coverage
Lunch and dinner in office
+5
Remote Software Engineer, AI Benchmarking & Evaluation
Remote Software Engineer, AI Benchmarking & Evaluation

Epoch AI • United States

Remote
USD 125,000 - 200,000
Comprehensive health insurance
Flexible work environment
Generous paid time off
+1