Frontier AI Benchmark Architect

AfterQuery

San Francisco, Northern (CA, KY)

Hybrid

USD 150,000 - 230,000

Full time

9 days ago
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Benefits offered by this job

Health Insurance: Medical, Vision, and
401(k) with Employer Match
Daily Meals: UberEats stipend
Monthly Wellness Stipend
Commute Covered

Job summary

AfterQuery is hiring Research Scientists to design and publish rigorous evaluations for frontier AI systems. The role spans agentic, coding, and safety evaluations, as well as expert-domain evaluations involving healthcare, STEM, finance, and related fields.

You will own evaluation development end to end and collaborate across disciplines to turn important capability gaps into rigorous public research. Join a fast-growing AI research lab based in San Francisco, backed by top investors, and help

Qualifications

  • Publish benchmarks or research papers.
  • Strong scientific writing skills.
  • Commitment to experimental rigor with baselines and statistics.
  • Ability to scoping and release reproducible evaluations.
  • Depth in agentic, coding, and safety evaluations or applied ML in an expert domain.

Responsibilities

  • Lead end-to-end design, validation, launch, and improvement of frontier AI benchmarks.
  • Collaborate with researchers to develop evaluations around model failures and high-priority domains.
  • Analyze model capabilities and failure modes using rigorous experimental design and statistics.
  • Build reproducible evaluation systems, including harnesses, graders, and infrastructure.
  • Collaborate to post-train models and measure performance gains.
  • Communicate results through benchmark reports, technical articles, and research papers.

Skills

Benchmarks publications
Technical writing
Experimental design
Statistical methods

Education

PhD preferred

Tools

Benchmark tooling

Job description

AfterQuery is hiring Research Scientists to design and publish rigorous evaluations for frontier AI systems. The role spans agentic, coding, and safety evaluations, as well as expert-domain evaluations involving healthcare, STEM, finance, and related fields.

You will own evaluation development end to end and collaborate across disciplines to turn important capability gaps into rigorous public research. Join a fast-growing AI research lab based in San Francisco, backed by top investors, and help

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Frontier AI Evaluation Scientist
Frontier AI Evaluation Scientist

Neura Market • San Francisco (CA)

On-site
USD 200,000 - 250,000
Research Scientist – Frontier Evaluations
Research Scientist – Frontier Evaluations

AfterQuery • San Francisco (CA), Northern (KY)

Hybrid
USD 150,000 - 230,000
Health Insurance: Medical, Vision, and
401(k) with Employer Match
Daily Meals: UberEats stipend
+2
Frontier AI Evaluation Engineer: RL Environments
Frontier AI Evaluation Engineer: RL Environments

OpenAI • San Francisco (CA)

On-site
USD 120,000 - 160,000
Frontier AI Safety Researcher
Frontier AI Safety Researcher

Triwill Group • San Francisco (CA), Northern (KY)

Hybrid
USD 190,000 - 230,000
Relocation assistance
Staff AI Research Engineer — Frontier Model Evaluations
Staff AI Research Engineer — Frontier Model Evaluations

Intelligence • San Francisco (CA)

On-site
USD 180,000 - 280,000
Meaningful equity
Frontier AI Risk Evaluation Scientist
Frontier AI Risk Evaluation Scientist

Scale • San Francisco (CA), New York (NY)

On-site
USD 216,000 - 270,000
Health coverage
Retirement benefits
Learning stipend
+2
Biotech AI Scientist: Frontier Model Evaluation
Biotech AI Scientist: Frontier Model Evaluation

Benchling • San Francisco (CA)

On-site
USD 136,000 - 265,000
Research Engineer - Frontier AI Training & Evals
Research Engineer - Frontier AI Training & Evals

Visa Hunt • San Francisco (CA), Northern (KY)

Hybrid
USD 140,000 - 200,000
Competitive compensation
Medical, dental, vision coverage
Lunch and dinner in office
+5
Frontier Agent Evals & Environments Research Scientist
Frontier Agent Evals & Environments Research Scientist

OpenAI • San Francisco (CA)

On-site
USD 380,000 - 500,000
Frontier AI Behavior Research Scientist
Frontier AI Behavior Research Scientist

Transluce • San Francisco (CA), Northern (KY)

Hybrid
USD 250,000 - 450,000