Frontier LLM Evaluation Engineer - IC, Impact-Driven

Enclosure

San Francisco (CA)

On-site

USD 150,000 - 230,000

Full time

5 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Enclosure in San Francisco is seeking an exceptional LLM evals researcher or engineer to own a significant portion of our LLM evals research as an IC. The role emphasizes exploration, curiosity, and practical impact in frontier AI security and model evaluation.

You will contribute to building robust evaluation environments and methods, collaborating with security and infrastructure teams to advance state-of-the-art AI safety and reliability.

Qualifications

  • Hands-on experience designing and running evaluations for frontier AI systems.
  • Experience building realistic evaluation environments, tasks, benchmarks, graders, or harnesses.
  • Strong experimental judgment in designing rigorous evaluations.
  • Experience evaluating tool-using agents, coding systems, and long-horizon tasks.
  • Strong ML and software fundamentals; RL or model training a strong plus.

Skills

Evaluation design
Experimentation
RL / model training
Software engineering fundamentals
Agent evals

Job description

Enclosure in San Francisco is seeking an exceptional LLM evals researcher or engineer to own a significant portion of our LLM evals research as an IC. The role emphasizes exploration, curiosity, and practical impact in frontier AI security and model evaluation.

You will contribute to building robust evaluation environments and methods, collaborating with security and infrastructure teams to advance state-of-the-art AI safety and reliability.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Member of Technical Staff - LLM Evals
Member of Technical Staff - LLM Evals

Enclosure • San Francisco (CA)

On-site
USD 150,000 - 230,000
LLM Evaluation Engineering Lead
LLM Evaluation Engineering Lead

DeepRec.ai • Redwood City (CA)

On-site
USD 180,000 - 240,000
High autonomy
Strong technical peers
Meaningful equity
LLM Evaluation & Verification Lead
LLM Evaluation & Verification Lead

DeepRec.ai • Redwood City (CA)

On-site
USD 180,000 - 240,000
High autonomy
Strong technical peers
Meaningful equity
ML Evaluation Scientist - LLM Benchmarks
ML Evaluation Scientist - LLM Benchmarks

Scale AI • Seattle (WA)

On-site
USD 181,000 - 226,000
Health coverage
Retirement benefits
L&D stipend
+2
GenAI Evaluation Scientist - LLM Benchmarks & Failures
GenAI Evaluation Scientist - LLM Benchmarks & Failures

Scale • San Francisco (CA), Seattle (WA), New York (NY)

On-site
USD 166,000 - 207,000
Health insurance
Dental coverage
Vision coverage
+2
Research Scientist
Research Scientist

Anyone AI Inc. • Northern (KY)

On-site
USD 110,000 - 160,000
Frontier AI Security Researcher
Frontier AI Security Researcher

Enclosure • San Francisco (CA)

On-site
USD 180,000 - 240,000
Ownership over research direction
Close collaboration with frontier AI安全
LLM Evaluation Engineer
LLM Evaluation Engineer

ThirdLaw | Runtime AI Safety • United States

On-site
USD 120,000 - 160,000
Market cash compensation
Above-market equity
Generous benefits
Research Engineer, Privacy Evals — Frontier AI Safety
Research Engineer, Privacy Evals — Frontier AI Safety

Meta Careers • Menlo Park (CA)

On-site
USD 154,000 - 217,000
Frontier AI Behavior Research Scientist
Frontier AI Behavior Research Scientist

Transluce • San Francisco (CA), Northern (KY)

Hybrid
USD 250,000 - 450,000