Data Scientist, AI Agent Quality & Evaluation

Clera

United States

Remote

USD 120,000 - 190,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Clera is building an AI executive assistant operating across email, calendars, meetings, and business software. We seek a Data Scientist — Agent Evaluations & Quality to own the measurement system that determines real-world improvements in ambiguous environments.

You will partner with AI Agent Capabilities engineers to generate evidence shaping product decisions and release quality. This high-ownership role sits at the intersection of applied data science, LLM evaluation, and product quality,

Qualifications

  • 4+ years in Applied Data Science or Machine Learning roles, with a track record of building and delivering evaluation systems, automated data pipelines, or production ML infrastructure.
  • Experience designing automated evaluation frameworks, success criteria, and regression suites for complex AI/ML or agentic systems.
  • Production-grade proficiency in Python and SQL, with experience building and maintaining automated analytical pipelines on large datasets.
  • Applied statistical and experimental skills: significance testing, variance analysis, and sampling to evaluate non-deterministic AI/ML systems.
  • Experience developing labeled datasets, annotation guidelines, and quality-control processes for ground-truth data in dynamic product environments.
  • Solid understanding of LLM agent behaviors: tool use, multi-step execution, retrieval, and practical failure modes.
  • Demonstrated ability to analyze model traces, tool calls, and outputs to identify root causes across model, prompt, tool, and data layers.
  • Experience using production telemetry and observability data to monitor system quality, build dashboards, and analyze real-world user outcomes.

Responsibilities

  • Architect and maintain automated evaluation pipelines that measure agent quality across product surfaces.
  • Translate agent capabilities into explicit pass, partial-pass, and failure criteria for complex multi-step tasks.
  • Build representative gold datasets and regression suites covering real workflows, edge cases, and adversarial scenarios.
  • Define meaningful metrics — task success, tool-selection accuracy, instruction adherence, factual consistency, latency, cost, and reliability.
  • Design deterministic and model-based graders, calibrate LLM-as-a-judge systems, and track grader agreement.
  • Compare models, prompts, and implementations using rigorous offline experiments and production evidence.
  • Analyze traces and production outcomes to identify root causes and build a practical failure taxonomy.
  • Turn production failures into regression cases and continuously close gaps in evaluation coverage.
  • Build dashboards and release-quality signals that make results actionable for engineering, product, and leadership.
  • Recommend improvements to capability engineers and verify that fixes raise quality without unacceptable regressions.

Skills

Python
SQL
Evaluation pipelines
Experiment design
Statistical analysis
LLM evaluation

Job description

Clera is building an AI executive assistant operating across email, calendars, meetings, and business software. We seek a Data Scientist — Agent Evaluations & Quality to own the measurement system that determines real-world improvements in ambiguous environments.

You will partner with AI Agent Capabilities engineers to generate evidence shaping product decisions and release quality. This high-ownership role sits at the intersection of applied data science, LLM evaluation, and product quality,

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Data Scientist — Agent Evaluations & Quality
Data Scientist — Agent Evaluations & Quality

Clera • United States

Remote
USD 120,000 - 190,000
Senior AI Engineer - Agent Quality & Evaluations (Remote)
Senior AI Engineer - Agent Quality & Evaluations (Remote)

vibehackers • Northern (KY)

Hybrid
USD 150,000 - 250,000
Health insurance
Parental leave
Unlimited flexible time off
+2
Senior AI Quality & Evaluation Scientist — Remote
Senior AI Quality & Evaluation Scientist — Remote

Matcha • Northern (KY)

Hybrid
USD 180,000 - 230,000
Staff AI Systems Engineer - LLM, Evaluation, Equity
Staff AI Systems Engineer - LLM, Evaluation, Equity

Maven • San Jose (CA)

On-site
USD 180,000 - 240,000
Physical Health Benefits
Mental Health Benefits
Emotional Health Benefits
+5
Staff Software Engineer - AI Agent Evaluation & DataQuality
Staff Software Engineer - AI Agent Evaluation & DataQuality

engineeringjobs.net, Inc. • Town of Montana (WI)

On-site
USD 207,000 - 300,000
Senior AI Agent Engineer for Productivity Platforms
Senior AI Agent Engineer for Productivity Platforms

Clera • Palo Alto (CA)

On-site
USD 180,000 - 240,000
Remote AI Evaluation & Quality Assurance Engineer
Remote AI Evaluation & Quality Assurance Engineer

Equiliem • United States

Remote
USD 69,000 - 74,000
Data Scientist (AI Quality & Evaluation)
Data Scientist (AI Quality & Evaluation)

Bioscope.ai, Inc. • Boston (MA)

On-site
USD 100,000 - 130,000
Remote Data Scientist - AI Evaluation & ML Quality
Remote Data Scientist - AI Evaluation & ML Quality

YO AI Labs • Maryland

Remote
USD 83,000 - 124,000
Remote Data Quality Analyst — AI Evaluation
Remote Data Quality Analyst — AI Evaluation

AI Trainer Jobs • United States

Remote
USD 70,000 - 110,000