Frontier AI Research Scientist: Benchmarks & Data

Hidden Jobs

United States

Remote

USD 150,000 - 300,000

Full time

2 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Hidden Jobs is seeking a researcher to advance frontier AI evaluation within a STEM-focused organization. The role focuses on identifying gaps, designing benchmarks, and creating synthetic data to address open problems in evaluation, reliability, and agentic science.

You will contribute to long-horizon scientific agents that combine literature search, coding, simulation, tool use, and iterative reasoning, with opportunities to publish at leading conferences and influence deployment.

Qualifications

  • PhD or equivalent research experience in a highly technical field such as ML, CS, physics, chemistry, biology, engineering, or statistics.
  • Demonstrated ability to formulate and execute original research.
  • Strong understanding of modern large language models and the frontier AI research landscape.
  • Excellent experimental design, analysis, and technical communication skills.

Responsibilities

  • Identify high-impact gaps in benchmark and evaluation literature and design novel benchmarks within and across STEM fields.
  • Develop evaluation methodologies that handle task generation, grading, contamination control, difficulty calibration, and validation.
  • Build methods for generating high-quality synthetic STEM training data and study how task selection, difficulty, diversity, and filtering affect downstream performance.
  • Investigate hallucination, uncertainty, calibration, and epistemic failure in technical domains, and develop methods for factual reliability, self-correction, and verification.
  • Research long-horizon scientific agents that combine literature search, coding, simulation, tool use, and iterative reasoning.
  • Explore new research directions in reasoning, AI-for-science, model evaluation, data generation, and emerging capabilities.

Skills

Original research
Experimental design
Technical communication

Education

PhD or equivalent in a technical field

Job description

Hidden Jobs is seeking a researcher to advance frontier AI evaluation within a STEM-focused organization. The role focuses on identifying gaps, designing benchmarks, and creating synthetic data to address open problems in evaluation, reliability, and agentic science.

You will contribute to long-horizon scientific agents that combine literature search, coding, simulation, tool use, and iterative reasoning, with opportunities to publish at leading conferences and influence deployment.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Frontier AI Evaluation Scientist: Research & Benchmarks
Frontier AI Evaluation Scientist: Research & Benchmarks

Hidden Jobs • United States

Remote
USD 250,000 - 350,000
Equity
Publish at top conferences
High autonomy
Frontier AI Research Scientist: Benchmark & Evaluation
Frontier AI Research Scientist: Benchmark & Evaluation

Hidden Jobs • United States

Remote
USD 250,000 - 400,000
Equity
Collaboration with leading tech labs
Conference publication support
Staff AI Research Engineer: Frontier Systems & Benchmarks
Staff AI Research Engineer: Frontier Systems & Benchmarks

Hidden Jobs • United States

Remote
USD 250,000 - 400,000
Equity
Conference opportunities
Frontier AI Research Scientist - Benchmarks & Data
Frontier AI Research Scientist - Benchmarks & Data

Cerebras • United States

On-site
USD 250,000 - 400,000
Staff Research Scientist, Frontier STEM AI Benchmarks
Staff Research Scientist, Frontier STEM AI Benchmarks

Turing • Palo Alto (CA)

On-site
USD 250,000 - 400,000
Equity
AI Research Scientist: Frontier STEM Benchmarks
AI Research Scientist: Frontier STEM Benchmarks

Turing • Palo Alto (CA), San Francisco (CA), Seattle (WA)

On-site
USD 150,000 - 300,000
Equity
Frontier AI Research & Benchmark Scientist
Frontier AI Research & Benchmark Scientist

Synthires • California (MO)

On-site
USD 193,000 - 207,000
Flexible hours
Asynchronous work
Remote-friendly
Senior Research Scientist – Frontier AI Benchmarking
Senior Research Scientist – Frontier AI Benchmarking

Cerebras • United States

On-site
USD 250,000 - 350,000
Senior AI Research Scientist — Frontier Benchmarks & Data
Senior AI Research Scientist — Frontier Benchmarks & Data

Turing • Palo Alto (CA)

On-site
USD 250,000 - 350,000
Equity
Benchmark Research Engineer for Frontier AI
Benchmark Research Engineer for Frontier AI

HUD • San Francisco (CA)

On-site
USD 140,000 - 190,000
Competitive compensation
Top-tier medical, dental, and vision (
Lunch and dinner in office
+5