AI Agent Quality & Evaluation Scientist

Clera

Palo Alto (CA)

On-site

USD 150,000 - 210,000

Full time

3 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Clera in Palo Alto, CA seeks a data-science leader to own end-to-end evaluation for autonomous AI agents across email, calendar, and business software tasks. You will transform ambiguous product behavior into rigorous, actionable evaluation criteria guiding engineering and product decisions.

The role requires 5+ years in data science/ML, strong Python/SQL, and expertise in evaluation frameworks, experimental design, and ground-truth data development.

Qualifications

  • 5+ years in data science, machine learning, or analytics roles focusing on evaluation systems for production
  • Experience designing evaluation frameworks, grading systems, and success criteria for ML/AI in production
  • Strong Python and SQL proficiency with automated data pipelines and production-quality analysis code
  • Statistical design knowledge: sampling, variance, uncertainty quantification, bias detection
  • Ground-truth data development: labeling guidelines, annotation quality control, ambiguity resolution
  • Knowledge of LLM behavior, tool use, retrieval systems, multi-step execution, and practical failure modes of language model systems
  • Ability to connect quantitative patterns to traces and identify failure origins across model, prompt, data, and logic
  • Experience communicating evaluation results and trade-offs to technical and non-technical stakeholders
  • Comfort operating with high ownership in ambiguous, fast-moving environments
  • Experience with LLM-as-a-judge or benchmarking platforms is a strong plus

Responsibilities

  • Architect and maintain automated evaluation pipelines measuring agent quality across capabilities and product surfaces
  • Translate agent capabilities into explicit success criteria, including pass, partial-pass, and failure definitions
  • Build representative gold datasets and regression suites covering workflows, edge cases, ambiguous requests, and adversarial scenarios
  • Define and track metrics such as task success, tool-selection accuracy, instruction adherence, factual consistency, latency, cost, and reliability
  • Design deterministic and model-based graders, calibrate LLM-as-a-judge systems, and measure grader agreement, false positives, and false negatives
  • Analyze traces, tool calls, model outputs, and production outcomes to identify root causes and build a taxonomy
  • Compare models, prompts, tools, and capability implementations using offline experiments and production evidence
  • Build dashboards and release-quality signals that make evaluation results understandable and actionable
  • Partner with capability engineers to recommend improvements and verify fixes raise quality without regressions

Skills

Evaluation systems
Metrics frameworks
Quality measurement
Production ML
Statistical design
Experiment design
Ground-truth data
LLM behavior understanding
Stakeholder communication
Ownership in ambiguity
LLM-as-a-judge knowledge

Tools

Python
SQL

Job description

Clera in Palo Alto, CA seeks a data-science leader to own end-to-end evaluation for autonomous AI agents across email, calendar, and business software tasks. You will transform ambiguous product behavior into rigorous, actionable evaluation criteria guiding engineering and product decisions.

The role requires 5+ years in data science/ML, strong Python/SQL, and expertise in evaluation frameworks, experimental design, and ground-truth data development.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Data Scientist, Agent Evaluations & Quality
Data Scientist, Agent Evaluations & Quality

Clera • Palo Alto (CA)

On-site
USD 150,000 - 210,000
AI Engineer, Evals & Agent Quality
AI Engineer, Evals & Agent Quality

Town.com, Inc. • San Francisco (CA)

On-site
USD 250,000 - 300,000
AI Evaluation Engineer – Reinforcement Learning & Agents
AI Evaluation Engineer – Reinforcement Learning & Agents

MaxIT Consulting - Max Corporate Group • San Francisco (CA)

On-site
USD 140,000 - 210,000
Remote AI Agent Evaluation Engineer
Remote AI Agent Evaluation Engineer

EPAM Systems Inc • United States

Remote
USD 140,000 - 190,000
Senior AI Engineer - Agent Quality & Evaluations (Remote)
Senior AI Engineer - Agent Quality & Evaluations (Remote)

vibehackers • Northern (KY)

Hybrid
USD 150,000 - 250,000
Health insurance
Parental leave
Unlimited flexible time off
+2
AI Evaluation Engineer: RL Environments & Agents
AI Evaluation Engineer: RL Environments & Agents

MaxIT Consulting - Max Corporate Group • San Francisco (CA)

On-site
USD 140,000 - 210,000
Applied AI Engineer
Applied AI Engineer

Judgment Labs • San Francisco (CA), Northern (KY)

Hybrid
USD 180,000 - 280,000
Senior AI Evaluation Architect & Model Routing Engineer
Senior AI Evaluation Architect & Model Routing Engineer

Town.com, Inc. • San Francisco (CA)

On-site
USD 250,000 - 300,000
Remote Senior Software Engineer: AI Agent Evaluation
Remote Senior Software Engineer: AI Agent Evaluation

YO AI Labs • Washington

Remote
USD 60,000 - 90,000
Staff Software Engineer - AI Agent Evaluation & DataQuality
Staff Software Engineer - AI Agent Evaluation & DataQuality

engineeringjobs.net, Inc. • Town of Montana (WI)

On-site
USD 207,000 - 300,000