AI Evaluation Engineer: Build Quality & Feedback Systems

Cursor

California (MO)

On-site

USD 120,000 - 180,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Cursor is seeking a Software Engineer to join the Agent Quality team, building measurement, evaluation, and feedback-loop infrastructure that improves the core Cursor agent over time.

This role sits at the intersection of product, data, and engineering: instrumenting metrics, shaping quality definitions, and delivering pipelines to analyze agent behavior at scale. You will partner with research, product, and infrastructure to turn insights into improvements.

Qualifications

  • Experience building AI evaluation or measurement systems (e.g., evals, experiments, ranking, or quality metrics).
  • Strong data acumen with ability to collaborate with data scientists/researchers.
  • Up-to-date with model/agent behavior research and industry trends.

Responsibilities

  • Designing and building best-in-class AI evaluation system: curated datasets, offline replay, scorers/judges, regression alerts, dashboards.
  • Designing feedback loops from real usage: collecting, cleaning, and interpreting user signals to inform model and harness changes.
  • Developing analysis tooling and workflows for debugging agent behavior: deep dives on failure modes and clustering themes.
  • Improving reliability and guardrails by making quality measurable and actionable: defining good/bad/degraded sessions, alerting, and triage primitives.

Skills

AI evals
Data analysis
Research collaboration
Production engineering

Tools

Python
Experimentation tooling

Job description

Cursor is seeking a Software Engineer to join the Agent Quality team, building measurement, evaluation, and feedback-loop infrastructure that improves the core Cursor agent over time.

This role sits at the intersection of product, data, and engineering: instrumenting metrics, shaping quality definitions, and delivering pipelines to analyze agent behavior at scale. You will partner with research, product, and infrastructure to turn insights into improvements.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Software Engineer, Agent Evaluation and Quality
Software Engineer, Agent Evaluation and Quality

Cursor • California (MO)

On-site
USD 120,000 - 180,000
Engineering Manager, AI Evaluation & Metrics
Engineering Manager, AI Evaluation & Metrics

Cursor • California (MO)

On-site
USD 150,000 - 215,000
Engineering Manager, Evals
Engineering Manager, Evals

Cursor • California (MO)

On-site
USD 150,000 - 215,000
Engineering Manager: Agent & Product Security
Engineering Manager: Agent & Product Security

Cursor • San Francisco (CA), New York (NY)

On-site
USD 180,000 - 260,000
AI Evaluation QA Engineer: Scale Testing & Metrics
AI Evaluation QA Engineer: Scale Testing & Metrics

Appnovation • Miami (FL)

On-site
USD 100,000 - 140,000
AI Engineer, Evals & Agent Quality
AI Engineer, Evals & Agent Quality

Town.com, Inc. • San Francisco (CA)

On-site
USD 250,000 - 300,000
AI Quality Engineer: Evaluation Pipelines & LLM Testing
AI Quality Engineer: Evaluation Pipelines & LLM Testing

Dealstitch LLC. • United States

On-site
USD 160,000 - 220,000
AI Evaluation Engineer: Scale QA & Metrics
AI Evaluation Engineer: Scale QA & Metrics

Appnovation Technologies • Phoenix (AZ)

On-site
USD 100,000 - 160,000
Agent Platform Engineer — AI Orchestration & Tools
Agent Platform Engineer — AI Orchestration & Tools

Cursor • California (MO)

On-site
USD 120,000 - 180,000
Senior Engineer, AI Agent Quality & Platform
Senior Engineer, AI Agent Quality & Platform

ACM CAIS 2026 • New York (NY)

On-site
USD 190,000 - 270,000