AI Evaluation Architect for Data Science Excellence

Mercor

Philadelphia (Philadelphia County)

On-site

USD 110,000 - 160,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Mercor is collaborating with a leading AI research organization to engage experienced data scientists who will define high-quality grading criteria for real-world data science work and score samples with rigorous, written justifications.

You will shape evaluation standards, ensure reproducibility of scores, and integrate structured feedback from senior reviewers to rapidly improve the assessment process. Excellent written communication and 5+ years in data science are required.

Qualifications

  • 5+ years of professional data science experience in industry.
  • Background in business operations, product, or growth data science at top-tier technology companies.
  • Deep fluency in experiment design and A/B testing, metric definition, SQL/Python analysis, and communicating findings to executive stakeholders.
  • Exceptionally strong written communication.
  • Detail-oriented, consistent, and comfortable having your judgment reviewed and calibrated against peers.
  • Prior experience with AI training, evaluation, or human-data projects is a strong plus.

Responsibilities

  • Design precise, task-specific grading criteria for real-world data science deliverables (analyses, models, dashboards, experiment readouts, and written recommendations)
  • Score AI-generated and human work samples against those criteria, with detailed written justifications for every score
  • Apply consistent, evidence-based judgment so that scores are reproducible and defensible
  • Incorporate structured feedback from senior reviewers and iterate quickly on your work

Skills

Experiment design
A/B testing
SQL
Python
Executive communication
Written communication

Job description

Mercor is collaborating with a leading AI research organization to engage experienced data scientists who will define high-quality grading criteria for real-world data science work and score samples with rigorous, written justifications.

You will shape evaluation standards, ensure reproducibility of scores, and integrate structured feedback from senior reviewers to rapidly improve the assessment process. Excellent written communication and 5+ years in data science are required.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

AI Evaluation Architect for Data Science
AI Evaluation Architect for Data Science

Mercor • New York (NY)

On-site
USD 140,000 - 180,000
Senior Data Science Evaluation Architect
Senior Data Science Evaluation Architect

Obsidian • New York (NY)

On-site
USD 110,000 - 170,000
Data Science Evaluation Architect & AI Trainer
Data Science Evaluation Architect & AI Trainer

Obsidian • Philadelphia

On-site
USD 120,000 - 190,000
Data Science Evaluation Specialist
Data Science Evaluation Specialist

Mercor • New York (NY)

On-site
USD 120,000 - 160,000
Data Science Expert - Evaluation Specialist
Data Science Expert - Evaluation Specialist

Obsidian • New York (NY)

On-site
USD 110,000 - 170,000
Data Science Expert - AI Evaluation
Data Science Expert - AI Evaluation

Mercor • New York (NY)

On-site
USD 140,000 - 180,000
Data Science Expert - Evaluation Specialist - AI Trainer
Data Science Expert - Evaluation Specialist - AI Trainer

Obsidian • Philadelphia

On-site
USD 120,000 - 190,000
Data Science Expert - Evaluation Specialist
Data Science Expert - Evaluation Specialist

Mercor • New York (NY)

On-site
USD 120,000 - 160,000
Data Science Expert - Evaluation Specialist - AI Trainer
Data Science Expert - Evaluation Specialist - AI Trainer

Mercor • Philadelphia

On-site
USD 110,000 - 160,000
AI Evaluation Architect for Sales Engineering
AI Evaluation Architect for Sales Engineering

Mercor • New York (NY)

On-site
USD 120,000 - 180,000