Senior AI Evaluation Scientist - Model Behavior & Metrics

techire ai

San Francisco (CA)

Hybrid

USD 200,000 - 350,000

Full time

10 days ago
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Techire AI is seeking a Senior Research, Evals to rethink how model performance is measured across real-world interactions. You will develop evaluation frameworks that go beyond static benchmarks and build systems that integrate evaluations into model development.

The role is hands-on, bridging model development and evaluation, with responsibilities to design studies, pipelines and metrics for reasoning, memory, and interaction quality.

Qualifications

  • Experience building evaluation frameworks for generative models across text, audio or multimodal AI.
  • Strong technical and analytical skills.
  • Experience turning open-ended research questions into working evaluation systems.
  • A good understanding of metrics, experimentation and statistical analysis.
  • An interest in measuring subjective qualities such as naturalness, adaptability and interaction quality.

Responsibilities

  • Develop new evaluations for reasoning, memory, interaction and model behaviour.
  • Build evaluation pipelines with robust statistical analysis.
  • Create quantitative metrics for qualities that can be difficult to measure objectively.
  • Integrate evals directly into model training and research workflows.
  • Design user studies and behavioural experiments to understand real-world model performance.

Job description

Techire AI is seeking a Senior Research, Evals to rethink how model performance is measured across real-world interactions. You will develop evaluation frameworks that go beyond static benchmarks and build systems that integrate evaluations into model development.

The role is hands-on, bridging model development and evaluation, with responsibilities to design studies, pipelines and metrics for reasoning, memory, and interaction quality.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Researcher, Evals
Senior Researcher, Evals

techire ai • San Francisco (CA)

Hybrid
USD 200,000 - 350,000
Senior Researcher, Evals
Senior Researcher, Evals

techire ai • San Francisco (CA)

Hybrid
USD 200,000 - 350,000
Senior AI Evaluation Engineer — Metrics & Data Pipelines
Senior AI Evaluation Engineer — Metrics & Data Pipelines

Sentry • San Francisco (CA)

Hybrid
USD 240,000 - 280,000
Equity grants
Paid time off
Group health insurance coverage
Remote Senior AI/ML Benchmarking & Evaluation Engineer
Remote Senior AI/ML Benchmarking & Evaluation Engineer

OpenTeams • Northern (KY)

Hybrid
USD 145,000 - 250,000
AI Evaluation Lead: Real-World Systems Benchmarking
AI Evaluation Lead: Real-World Systems Benchmarking

SupportFinity™ • San Francisco (CA)

On-site
USD 150,000 - 230,000
Research Engineer – AI Evaluation & Metrics
Research Engineer – AI Evaluation & Metrics

EngineersOfAI • San Francisco (CA), Northern (KY)

Hybrid
USD 180,000 - 250,000
AI Model Evaluation Lead: Metrics, Bias & Fairness
AI Model Evaluation Lead: Metrics, Bias & Fairness

MERIT Beauty • New York (NY)

On-site
Confidential
AI Evaluation Scientist — Real-World ML Research
AI Evaluation Scientist — Real-World ML Research

Arena Intelligence, Inc. • San Francisco (CA)

On-site
USD 170,000 - 210,000
Competitive compensation
Equity
Health benefits
+2
AI Evaluations Engineer — Benchmarking Frontiers
AI Evaluations Engineer — Benchmarking Frontiers

Meta • Menlo Park (CA)

On-site
USD 180,000 - 240,000
Staff Engineer - AI Evaluation & Metrics Platform
Staff Engineer - AI Evaluation & Metrics Platform

Kindredventures • San Francisco (CA)

On-site
USD 140,000 - 200,000