Staff AI Evals Engineer for Frontier Benchmarks

Cacheflow

United States

On-site

USD 180,000 - 240,000

Full time

2 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Equity
401(k) match
Parental leave
Fertility benefits
Mental health support
Wellness stipend
Learning stipend
Free lunch
SF office gym
Commuting support
Flexible PTO
Holidays + flex days
Team outings
Referral bonuses

Job summary

Handshake is hiring a Member of Technical Staff, Evals to shape how frontier AI systems are measured and improved. You will work with AI researchers, domain experts, and customers to build benchmarks, reward/verifier systems, and data-quality techniques.

Early members will influence technical direction, open-source software, and research products. Location: San Francisco preferred; exceptional candidates in other locations are welcome.

Qualifications

  • PhD in ML/AI, computer science, data science, or related field (or equivalent research experience).
  • Publications at top AI/ML venues (NeurIPS, ICML, ICLR, COLM).
  • Builders who enjoy tinkering with agents and shipping high-quality software, benchmarks, or datasets.
  • Strong Python skills and experience building scalable software with agents.
  • Knowledge of frontier AI: benchmarks, evaluation techniques, agent harnesses, data shapes.
  • Comfort operating in an ambiguous, fast-moving environment with substantial ownership.

Responsibilities

  • Design and build evaluation frameworks and benchmarks for frontier LLMs and agents.
  • Develop reward models, programmatic verifiers, graders, and feedback systems.
  • Research what makes evaluations reliable and resistant to shortcutting or reward hacking.
  • Build systems for high-quality human data, including task design and data-quality signals.
  • Run fast iteration loops: prototype, evaluate, interpret results, diagnose failures.
  • Publicly contribute to the field through benchmarks, open-source tools, and research papers.

Skills

Python
Research
Software development
AI/ML knowledge

Education

PhD in ML/AI or related field

Tools

GitHub / OSS contributions
Python tooling

Job description

Handshake is hiring a Member of Technical Staff, Evals to shape how frontier AI systems are measured and improved. You will work with AI researchers, domain experts, and customers to build benchmarks, reward/verifier systems, and data-quality techniques.

Early members will influence technical direction, open-source software, and research products. Location: San Francisco preferred; exceptional candidates in other locations are welcome.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Staff AI Research Engineer: Frontier Systems & Benchmarks
Staff AI Research Engineer: Frontier Systems & Benchmarks

Hidden Jobs • United States

Remote
USD 250,000 - 400,000
Equity
Conference opportunities
Staff AI Research Engineer — Frontier Model Evaluations
Staff AI Research Engineer — Frontier Model Evaluations

Intelligence • San Francisco (CA)

On-site
USD 180,000 - 280,000
Meaningful equity
Staff Data AI Engineer for Frontier Model Training
Staff Data AI Engineer for Frontier Model Training

Apply • San Francisco (CA), Northern (KY)

Hybrid
USD 180,000 - 240,000
Equity ownership
401(k) match
Parental benefits and family support
+1
Senior Member of Technical Staff, AI Benchmarking
Senior Member of Technical Staff, AI Benchmarking

Artificial Analysis, Inc. • San Francisco (CA)

On-site
USD 100,000 - 150,000
Competitive compensation including equity
Opportunity to shape AI development
Staff Research Engineer, Frontier AI Evaluation Benchmarks
Staff Research Engineer, Frontier AI Evaluation Benchmarks

OpenTrain AI, Inc. • United States

Remote
USD 103,000 - 193,000
Frontier AI Benchmarks Engineer — Field‑Facing Data & Eval
Frontier AI Benchmarks Engineer — Field‑Facing Data & Eval

Alexander Chapman • United States

On-site
USD 140,000 - 190,000
Data AI Systems Engineer – Frontier Model Training
Data AI Systems Engineer – Frontier Model Training

Handshake • San Francisco (CA)

On-site
USD 180,000 - 240,000
Equity
401(k) match
Medical, dental, vision
+3
Frontier AI Strategy Consultant (Commercial)
Frontier AI Strategy Consultant (Commercial)

Artificial Analysis • San Francisco (CA)

On-site
USD 150,000 - 190,000
Frontier AI Research Scientist: Benchmarks & Data
Frontier AI Research Scientist: Benchmarks & Data

Hidden Jobs • United States

Remote
USD 150,000 - 300,000
Member of Technical Staff, Evals
Member of Technical Staff, Evals

Cacheflow • United States

On-site
USD 180,000 - 240,000
Equity
401(k) match
Parental leave
+11