Data Scientist (AI Quality & Evaluation)

Bioscope.ai, Inc.

Boston (MA)

On-site

USD 100,000 - 130,000

Full time

14 days+
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

A leading clinical AI company is seeking a Data Scientist responsible for ensuring the quality and reliability of AI outputs. You will design automated evaluation pipelines, develop uncertainty quantification systems, and build comprehensive frameworks that combine automated assessments with clinician validations. The ideal candidate has expertise in deep learning frameworks such as PyTorch, experience with model evaluation metrics, and excellent communication skills. A Master's degree in a related field is preferred.

Qualifications

  • Strong foundation in deep learning frameworks (PyTorch) and LLM architectures.
  • Experience with model evaluation, benchmarking, and quality metrics.
  • Proficiency in Python and modern ML development tools.

Responsibilities

  • Design and implement automated evaluation pipelines to assess AI output quality.
  • Develop uncertainty quantification systems correlating confidence scores with accuracy.
  • Build evaluation frameworks combining automated assessment and clinician-validated cases.

Skills

Deep learning frameworks (PyTorch)
Model evaluation and quality metrics
Proficiency in Python
Statistical analysis
Communication skills

Education

Master's degree in Computer Science, Machine Learning, Statistics, or related field

Job description

About the Role

We're looking for a Data Scientist to own the quality, reliability, and trustworthiness of our clinical AI outputs. You'll build the systems that ensure our AI "knows what it doesn't know"—developing evaluation frameworks, calibrated confidence scoring, and automated quality assurance that physicians can actually trust.

What You'll Do
  • Design and implement automated evaluation pipelines that assess AI output quality, accuracy, and safety at scale

  • Develop uncertainty quantification systems where confidence scores meaningfully correlate with accuracy

  • Build comprehensive evaluation frameworks combining automated assessment with clinician-validated test cases

  • Implement feedback loops that continuously improve model outputs based on validation signals

  • Establish scalable quality gates that catch errors before they reach end users

  • Contribute to model alignment and fine-tuning efforts

Qualifications
Required
  • Strong foundation in deep learning frameworks (PyTorch) and LLM architectures

  • Experience with model evaluation, benchmarking, and quality metrics

  • Proficiency in Python and modern ML development tools

  • Strong statistical foundations

  • Ability to read, implement, and extend research papers

  • Excellent communication skills

Preferred
  • Master's degree in Computer Science, Machine Learning, Statistics, or related quantitative field (PhD preferred)

  • Publications in top ML/AI venues (NeurIPS, ICML, ICLR, ACL)

  • Experience with RLHF, DPO, or preference optimization techniques

  • Background in healthcare AI or regulated industries

  • Experience building evaluation systems for production LLM applications

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

AI Quality & Evaluation Scientist for Clinical LLMs
AI Quality & Evaluation Scientist for Clinical LLMs

Bioscope.ai, Inc. • Boston (MA)

On-site
USD 100,000 - 130,000
Data Scientist — Agent Evaluations & Quality
Data Scientist — Agent Evaluations & Quality

Clera • United States

Remote
USD 120,000 - 190,000
Data Scientist (Agentic AI)
Data Scientist (Agentic AI)

Bioscope.ai, Inc. • Boston (MA)

On-site
USD 100,000 - 130,000
Tech Lead Data Scientist, AI Evaluation & Monitoring
Tech Lead Data Scientist, AI Evaluation & Monitoring

Geisinger • Danville (PA)

On-site
USD 120,000 - 150,000
Data Scientist (Agentic AI)
Data Scientist (Agentic AI)

Bioscope AI • Boston (MA)

On-site
USD 100,000 - 130,000
Research Engineer - Data Quality & Evals
Research Engineer - Data Quality & Evals

Epsilon Health • San Francisco (CA)

On-site
USD 120,000 - 180,000
Senior AI Quality & Evaluation Scientist — Remote
Senior AI Quality & Evaluation Scientist — Remote

Matcha • Northern (KY)

Hybrid
USD 180,000 - 230,000
AI Engineer
AI Engineer

Harnham • San Francisco (CA)

On-site
USD 100,000 - 150,000
Data Scientist, Consultant
Data Scientist, Consultant

Blue Shield of CA • Springfield Meadows (CA)

Hybrid
USD 140,000 - 230,000
Data Scientist, Consultant
Data Scientist, Consultant

Blue Shield of CA • Miami (FL)

Hybrid
USD 130,000 - 180,000