Data Science Evaluation Architect & AI Trainer

Obsidian

Philadelphia (Philadelphia County)

On-site

USD 120,000 - 190,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Mercor is partnering with a leading AI research organization to engage experienced data scientists for a project focused on evaluating how well AI systems perform real-world data science work. You will define what excellent work looks like, designing task-specific grading criteria and providing rigorous written justifications for scores.

The ideal candidate has 5+ years in industry data science, with strong experiment design, SQL/Python analysis, and the ability to communicate findings to

Qualifications

  • 5+ years of professional data science experience in industry.
  • Experience in business operations, product, or growth data science at top-tier tech companies.
  • Deep fluency in experiment design and A/B testing, metric definition, SQL/Python analysis, and communicating findings to executives.
  • Exceptionally strong written communication.
  • Detail-oriented and comfortable with peer calibration.
  • Prior AI training/evaluation experience is a strong plus.

Responsibilities

  • Design precise, task-specific grading criteria for real-world data science deliverables.
  • Score AI-generated and human work samples against criteria with detailed written justifications.
  • Apply consistent, evidence-based judgment so scores are reproducible and defensible.
  • Incorporate structured feedback from senior reviewers and iterate quickly.

Skills

Data science experience
Experiment design
A/B testing
SQL
Python
Written communication

Tools

SQL
Python

Job description

Mercor is partnering with a leading AI research organization to engage experienced data scientists for a project focused on evaluating how well AI systems perform real-world data science work. You will define what excellent work looks like, designing task-specific grading criteria and providing rigorous written justifications for scores.

The ideal candidate has 5+ years in industry data science, with strong experiment design, SQL/Python analysis, and the ability to communicate findings to

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Data Science Evaluation Specialist
Data Science Evaluation Specialist

Mercor • New York (NY)

On-site
USD 120,000 - 160,000
Senior Data Science Evaluation Architect
Senior Data Science Evaluation Architect

Obsidian • New York (NY)

On-site
USD 110,000 - 170,000
Data Science Expert - Evaluation Specialist - AI Trainer
Data Science Expert - Evaluation Specialist - AI Trainer

Obsidian • Philadelphia

On-site
USD 120,000 - 190,000
Data Science Expert - AI Evaluation
Data Science Expert - AI Evaluation

Mercor • New York (NY)

On-site
USD 140,000 - 180,000
Data Science Expert - Evaluation Specialist - AI Trainer
Data Science Expert - Evaluation Specialist - AI Trainer

Mercor • Philadelphia

On-site
USD 110,000 - 160,000
Data Science Expert - Evaluation Specialist
Data Science Expert - Evaluation Specialist

Obsidian • New York (NY)

On-site
USD 110,000 - 170,000
AI Evaluation Architect for Data Science Excellence
AI Evaluation Architect for Data Science Excellence

Mercor • Philadelphia

On-site
USD 110,000 - 160,000
Data Science Expert - Evaluation Specialist
Data Science Expert - Evaluation Specialist

Mercor • New York (NY)

On-site
USD 120,000 - 160,000
AI Evaluation Architect for Data Science
AI Evaluation Architect for Data Science

Mercor • New York (NY)

On-site
USD 140,000 - 180,000
AI Evaluation Architect for Sales Engineering
AI Evaluation Architect for Sales Engineering

Mercor • New York (NY)

On-site
USD 120,000 - 180,000