AI Quality & Safety Evaluation Engineer

Capital Rx

Denver (CO)

On-site

USD 120,000 - 180,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Judi Health is seeking an AI Evaluation Engineer to build testing frameworks, metrics, and tooling to assess the safety, reliability, and accuracy of AI models in production. You will translate ambiguous product goals into measurable quality targets and drive standardized evaluation across multiple agent types.

You will own data engineering tasks, platform observability, and evaluation tooling, collaborating with data science and engineering teams to ensure high-quality, reproducible results and

Qualifications

  • 4+ years of experience in data engineering, ML engineering, or software engineering.
  • Bachelor's or Master's degree in Computer Science, Machine Learning, or a related quantitative field.
  • Strong proficiency in Python.
  • Strong SQL skills.
  • Experience building and maintaining production data pipelines.
  • Experience working with at least one cloud platform (AWS preferred).

Responsibilities

  • Data Engineering: Build and maintain ETL pipelines for heterogeneous data sources (traces, logs, transcripts, user feedback).
  • Platform & Observability: Develop dashboards and monitoring tools for AI quality metrics and integrate evaluations into CI/CD pipelines.
  • AI / ML Evaluation Tooling: Apply and extend evaluation patterns and design metrics for stochastic systems using LangSmith and related tools.
  • Collaboration: Partner with data science, engineering, and product teams to translate goals into engineering requirements and ensure high usability of tooling.

Skills

Python
SQL
Cloud platforms (AWS)
Data pipelines

Education

Bachelor's or Master's in CS/ML/related field

Tools

LangSmith
Playwright

Job description

Judi Health is seeking an AI Evaluation Engineer to build testing frameworks, metrics, and tooling to assess the safety, reliability, and accuracy of AI models in production. You will translate ambiguous product goals into measurable quality targets and drive standardized evaluation across multiple agent types.

You will own data engineering tasks, platform observability, and evaluation tooling, collaborating with data science and engineering teams to ensure high-quality, reproducible results and

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

AI Quality & Safety Evaluation Engineer
AI Quality & Safety Evaluation Engineer

Capital Rx • New York (NY)

On-site
USD 120,000 - 160,000
AI Quality & Evaluation Engineer
AI Quality & Evaluation Engineer

Capital Rx • Charlotte (NC)

On-site
USD 120,000 - 180,000
AI Evaluation & Quality Engineer
AI Evaluation & Quality Engineer

Capitalrx • Charlotte (NC)

On-site
USD 134,800 - 168,500
AI Evaluation Engineer: Shape Production AI Quality
AI Evaluation Engineer: Shape Production AI Quality

Transformcap • United States

On-site
USD 135,000 - 200,000
AI Evaluation Engineer
AI Evaluation Engineer

Capital Rx • Denver (CO)

On-site
USD 120,000 - 180,000
AI Evaluation Engineer
AI Evaluation Engineer

Capital Rx • Charlotte (NC)

On-site
USD 120,000 - 180,000
AI Evaluation Engineer
AI Evaluation Engineer

Capital Rx • New York (NY)

On-site
USD 120,000 - 160,000
AI Evaluation Engineer
AI Evaluation Engineer

Transformcap • United States

On-site
USD 135,000 - 200,000
AI Evaluation Engineer
AI Evaluation Engineer

Capitalrx • Charlotte (NC)

On-site
USD 134,800 - 168,500
AI Quality Engineer: Evaluation Pipelines & LLM Testing
AI Quality Engineer: Evaluation Pipelines & LLM Testing

Dealstitch LLC. • United States

On-site
USD 160,000 - 220,000