Frontier AI Research Scientist - Benchmarks & Data

Cerebras

United States

On-site

USD 250,000 - 400,000

Full time

3 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Turing seeks exceptional AI Research Scientists to advance frontier AI evaluation and data generation. You will identify gaps, design benchmarks across STEM, and develop evaluation pipelines to improve model reliability and scientific capability.

This role emphasizes research leadership, rigorous experimentation, and collaboration across teams in a fast-moving environment. Office presence is required five days a week at SF, Palo Alto, or Seattle.

Qualifications

  • PhD or equivalent research experience in machine learning, computer science, mathematics, physics, chemistry, biology, engineering, statistics, or another highly technical field.
  • Demonstrated ability to formulate and execute original research.
  • Strong understanding of modern LLMs and the frontier AI research landscape.
  • Excellent experimental design, quantitative reasoning, and scientific judgment.
  • Ability to rapidly understand unfamiliar technical literature and develop expertise in new areas.
  • Strong Python skills and the ability to independently build research prototypes and evaluation pipelines.
  • Excellent technical writing and communication.
  • Comfort working in a fast-moving environment where the research agenda evolves with the frontier.

Responsibilities

  • Identify high-impact gaps in existing benchmark and evaluation literature.
  • Design novel benchmarks in and across STEM fields and on general model functionality.
  • Develop evaluations for emerging model capabilities that are poorly captured by traditional static benchmarks.
  • Design rigorous task-generation, grading, contamination-control, difficulty-calibration, and validation methodologies.
  • Build benchmarks that can become both valuable research contributions and meaningful standards for evaluating frontier models.
  • Develop methods for generating high-quality synthetic STEM training data.
  • Study how task selection, difficulty, diversity, verification, filtering, and data quality affect downstream performance.
  • Explore methods for generating useful training signal in domains where expert human data is scarce or expensive.
  • Design experiments that determine when synthetic data genuinely improves capabilities rather than simply increasing training volume.
  • Study hallucination, uncertainty, calibration, and epistemic failure in technical domains.
  • Develop evaluations and methods for improving factual reliability, self-correction, verification, citation, and appropriate abstention.
  • Investigate when models should reason internally, invoke tools, seek external evidence, or recognize that they do not know.
  • Research AI systems capable of performing extended scientific and technical work.
  • Develop workflows involving literature search, coding, simulation, tool use, experimentation, verification, and iterative reasoning.
  • Evaluate long-horizon scientific agents and identify bottlenecks preventing them from reliably performing real research.
  • Explore new approaches to human-AI and multi-agent scientific collaboration.

Skills

Python
LLMs
Research prototyping

Education

PhD or equivalent research experience

Job description

Turing seeks exceptional AI Research Scientists to advance frontier AI evaluation and data generation. You will identify gaps, design benchmarks across STEM, and develop evaluation pipelines to improve model reliability and scientific capability.

This role emphasizes research leadership, rigorous experimentation, and collaboration across teams in a fast-moving environment. Office presence is required five days a week at SF, Palo Alto, or Seattle.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior AI Research Scientist — Frontier Benchmarks & Data
Senior AI Research Scientist — Frontier Benchmarks & Data

Turing • Palo Alto (CA)

On-site
USD 250,000 - 350,000
Equity
Senior Research Scientist – Frontier AI Benchmarking
Senior Research Scientist – Frontier AI Benchmarking

Cerebras • United States

On-site
USD 250,000 - 350,000
AI Research Scientist: Frontier STEM Benchmarks
AI Research Scientist: Frontier STEM Benchmarks

Turing • Palo Alto (CA), San Francisco (CA), Seattle (WA)

On-site
USD 150,000 - 300,000
Equity
Staff Research Scientist, Frontier STEM AI Benchmarks
Staff Research Scientist, Frontier STEM AI Benchmarks

Turing • Palo Alto (CA)

On-site
USD 250,000 - 400,000
Equity
Frontier AI Research Scientist: Benchmark & Evaluation
Frontier AI Research Scientist: Benchmark & Evaluation

Hidden Jobs • United States

Remote
USD 250,000 - 400,000
Equity
Collaboration with leading tech labs
Conference publication support
Frontier AI Research Scientist: Benchmarks & Data
Frontier AI Research Scientist: Benchmarks & Data

Hidden Jobs • United States

Remote
USD 150,000 - 300,000
Frontier AI Research Engineer: Systems & Evaluation
Frontier AI Research Engineer: Systems & Evaluation

Turing • United States

On-site
USD 250,000 - 350,000
Equity
Frontier AI Research Engineer
Frontier AI Research Engineer

Turing • Palo Alto (CA), San Francisco (CA), Seattle (WA)

On-site
USD 250,000 - 400,000
Work at frontier of AI
Conferences publications opportunities
Equity
Senior Research Engineer — Frontier AI & Data Systems
Senior Research Engineer — Frontier AI & Data Systems

Turing • Palo Alto (CA)

On-site
USD 250,000 - 350,000
Senior Frontier AI Research Engineer
Senior Frontier AI Research Engineer

Turing • Palo Alto (CA), San Francisco (CA), Seattle (WA)

On-site
USD 250,000 - 350,000
Equity