AI Quality Scientist - LLM Evaluation & Metrics (Hybrid)

Programmers.io

Louisville (KY)

Hybrid

USD 90,000 - 130,000

Full time

8 days ago
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Programmers.io seeks a Data Scientist to build and maintain a robust evaluation framework for conversational AI systems in a hybrid Louisville, KY environment. You will develop automated AI quality measurement solutions, including LLM-as-a-Judge systems, and collaborate with product teams and governance stakeholders to ensure accuracy and safety of AI experiences.

You will design experiments, analyze model performance with statistical best practices, and create dashboards to support Responsible

Qualifications

  • Master's degree or PhD in Data Science, Statistics, Computer Science, ML, or related field, or equivalent experience.
  • 3+ years of experience in data science, ML, analytics, or AI model evaluation.
  • Experience analyzing voice-based language data.
  • Experience with Generative AI, LLMs, or conversational AI systems.
  • Experience with cloud-based AI platforms and experimentation environments.

Responsibilities

  • Design and develop LLM-as-a-Judge evaluation frameworks for conversational AI systems.
  • Build automated monitoring solutions to evaluate millions of voice and chat-based interactions.
  • Create dashboards and reporting to support governance, compliance, and Responsible AI reviews.
  • Measure and report precision, recall, false-positive rates, and false-negative rates.
  • Analyze hallucination rates, intent classification accuracy, transcript quality (WER), fairness metrics.
  • Collaborate with annotation teams to improve label quality and gold-standard datasets.

Skills

Python
Data science tooling
Experiment design
Statistical analysis
Model evaluation
Communication with stakeholders

Education

Master's or PhD in Data Science/Statistics/CS/ML

Tools

Python libraries

Job description

Programmers.io seeks a Data Scientist to build and maintain a robust evaluation framework for conversational AI systems in a hybrid Louisville, KY environment. You will develop automated AI quality measurement solutions, including LLM-as-a-Judge systems, and collaborate with product teams and governance stakeholders to ensure accuracy and safety of AI experiences.

You will design experiments, analyze model performance with statistical best practices, and create dashboards to support Responsible

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Data Scientist
Data Scientist

Programmers.io • Louisville (KY)

Hybrid
USD 90,000 - 130,000
Applied Scientist, AGI Quality & LLM Evaluation
Applied Scientist, AGI Quality & LLM Evaluation

Amazon • Factoria (WA)

On-site
USD 136,000 - 184,000
Senior AI Quality Leader
Senior AI Quality Leader

LILT AI • City of Syracuse (NY)

Hybrid
USD 150,000 - 190,000
AI Quality & Evaluation Scientist for Clinical LLMs
AI Quality & Evaluation Scientist for Clinical LLMs

Bioscope.ai, Inc. • Boston (MA)

On-site
USD 100,000 - 130,000
Senior AI Quality Engineer — LLMs & Evaluation Systems
Senior AI Quality Engineer — LLMs & Evaluation Systems

Block • San Francisco (CA)

On-site
USD 190,000 - 230,000
Applied Scientist, LLM Quality & Evaluation
Applied Scientist, LLM Quality & Evaluation

Socket.dev • Bellevue (WA)

On-site
USD 136,000 - 184,000
RSUs
Sign-on bonus
Health insurance
Senior AI Engineer: LLM Evaluation & Production
Senior AI Engineer: LLM Evaluation & Production

LawPro.ai • Georgia

On-site
USD 140,000 - 210,000
AI QA Engineer for LLM & GenAI Testing & Automation
AI QA Engineer for LLM & GenAI Testing & Automation

Compunnel, Inc. • New York (NY), Northern (KY)

Hybrid
USD 140,000 - 190,000
Applied Scientist - AGI Quality & LLM Evaluation
Applied Scientist - AGI Quality & LLM Evaluation

Socket.dev • Bellevue (WA)

On-site
USD 136,000 - 184,000
Health insurance
RSUs
Sign-on bonus
+1
AI Quality Engineer: Evaluation Pipelines & LLM Testing
AI Quality Engineer: Evaluation Pipelines & LLM Testing

Dealstitch LLC. • United States

On-site
USD 160,000 - 220,000