Data Scientist (AI Quality & Evaluation)

Bioscope.ai, Inc.

Boston (MA)

On-site

USD 100,000 - 130,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

A leading clinical AI company is seeking a Data Scientist responsible for ensuring the quality and reliability of AI outputs. You will design automated evaluation pipelines, develop uncertainty quantification systems, and build comprehensive frameworks that combine automated assessments with clinician validations. The ideal candidate has expertise in deep learning frameworks such as PyTorch, experience with model evaluation metrics, and excellent communication skills. A Master's degree in a related field is preferred.

Qualifications

  • Strong foundation in deep learning frameworks (PyTorch) and LLM architectures.
  • Experience with model evaluation, benchmarking, and quality metrics.
  • Proficiency in Python and modern ML development tools.

Responsibilities

  • Design and implement automated evaluation pipelines to assess AI output quality.
  • Develop uncertainty quantification systems correlating confidence scores with accuracy.
  • Build evaluation frameworks combining automated assessment and clinician-validated cases.

Skills

Deep learning frameworks (PyTorch)
Model evaluation and quality metrics
Proficiency in Python
Statistical analysis
Communication skills

Education

Master's degree in Computer Science, Machine Learning, Statistics, or related field

Job description

About the Role

We're looking for a Data Scientist to own the quality, reliability, and trustworthiness of our clinical AI outputs. You'll build the systems that ensure our AI "knows what it doesn't know"—developing evaluation frameworks, calibrated confidence scoring, and automated quality assurance that physicians can actually trust.

What You'll Do
  • Design and implement automated evaluation pipelines that assess AI output quality, accuracy, and safety at scale

  • Develop uncertainty quantification systems where confidence scores meaningfully correlate with accuracy

  • Build comprehensive evaluation frameworks combining automated assessment with clinician-validated test cases

  • Implement feedback loops that continuously improve model outputs based on validation signals

  • Establish scalable quality gates that catch errors before they reach end users

  • Contribute to model alignment and fine-tuning efforts

Qualifications
Required
  • Strong foundation in deep learning frameworks (PyTorch) and LLM architectures

  • Experience with model evaluation, benchmarking, and quality metrics

  • Proficiency in Python and modern ML development tools

  • Strong statistical foundations

  • Ability to read, implement, and extend research papers

  • Excellent communication skills

Preferred
  • Master's degree in Computer Science, Machine Learning, Statistics, or related quantitative field (PhD preferred)

  • Publications in top ML/AI venues (NeurIPS, ICML, ICLR, ACL)

  • Experience with RLHF, DPO, or preference optimization techniques

  • Background in healthcare AI or regulated industries

  • Experience building evaluation systems for production LLM applications

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

AI Quality & Evaluation Scientist for Clinical LLMs
AI Quality & Evaluation Scientist for Clinical LLMs

Bioscope.ai, Inc. • Boston (MA)

On-site
USD 100,000 - 130,000
Tech Lead Data Scientist, AI Evaluation & Monitoring
Tech Lead Data Scientist, AI Evaluation & Monitoring

Geisinger • Danville (PA)

Hybrid
USD 120,000 - 150,000
Data Scientist (Agentic AI)
Data Scientist (Agentic AI)

Bioscope.ai, Inc. • Boston (MA)

On-site
USD 100,000 - 130,000
Data Scientist, AI/ML Model Quality
Data Scientist, AI/ML Model Quality

Socket.dev • Austin (TX)

On-site
USD 120,000 - 180,000
Data Scientist (Agentic AI)
Data Scientist (Agentic AI)

Bioscope AI • Boston (MA)

On-site
USD 100,000 - 130,000
AI Engineer
AI Engineer

Harnham • San Francisco (CA)

On-site
USD 100,000 - 150,000
Data Scientist, AI/ML Model Quality
Data Scientist, AI/ML Model Quality

Apple Inc. • San Diego (CA)

On-site
USD 130,000 - 170,000
AI Safety & Data Quality Analyst (HITL) - Washington
AI Safety & Data Quality Analyst (HITL) - Washington

welo-data • United States

On-site
Gourmet Dining
Endless Snacks
Campus Life
+3
AI Safety & Data Quality Analyst (HITL) - Washington
AI Safety & Data Quality Analyst (HITL) - Washington

Welo Data • Washington

On-site
Gourmet Dining
Endless Snacks
Campus Life
+3
AI Safety & Data Quality Analyst (HITL) - California
AI Safety & Data Quality Analyst (HITL) - California

Welo Data • California (MO)

On-site
Gourmet dining
Endless snacks
Access to rooftop nature parks
+3