Applied ML Evaluator & AI Rigor Reviewer

Obsidian

Philadelphia (Philadelphia County)

On-site

USD 120,000 - 170,000

Full time

14 days+
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Obsidian seeks a candidate to evaluate the quality, correctness, and methodological rigor of applied machine-learning tasks used to train and evaluate frontier AI lab models. You will critique experiment design, model-selection reasoning, and evaluation methodology, and provide rubric-based feedback to improve rigor.

The role emphasizes hands-on analysis of data quality and reproducibility, with a focus on leakage detection and proper train/test hygiene, using PyTorch, TensorFlow, scikit-learn,

Qualifications

  • 3+ years hands-on applied/experimental ML experience.
  • Strong grasp of data-quality rigor: leakage detection, metric gaming, and train/test/CV hygiene.
  • Proficiency with standard ML frameworks: PyTorch, TensorFlow, scikit-learn, XGBoost.
  • Ability to critique ML claims against evidence and reproduce results.

Responsibilities

  • Evaluate the quality, correctness, and methodological rigor of applied ML tasks.
  • Assess experiment design, model-selection reasoning, and evaluation methodology.
  • Provide rubric-based written feedback to guide improvements.

Skills

Applied ML
Experiment design
Model selection reasoning
Evaluation methodology
Data quality rigor
ML frameworks

Tools

PyTorch
TensorFlow
scikit-learn
XGBoost

Job description

Obsidian seeks a candidate to evaluate the quality, correctness, and methodological rigor of applied machine-learning tasks used to train and evaluate frontier AI lab models. You will critique experiment design, model-selection reasoning, and evaluation methodology, and provide rubric-based feedback to improve rigor.

The role emphasizes hands-on analysis of data quality and reproducibility, with a focus on leakage detection and proper train/test hygiene, using PyTorch, TensorFlow, scikit-learn,

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Applied ML Evaluation Auditor
Applied ML Evaluation Auditor

Obsidian • San Francisco (CA)

Remote
USD 90,000 - 130,000
Applied ML Task Auditor & Rubric Evaluator
Applied ML Task Auditor & Rubric Evaluator

Obsidian • San Francisco (CA)

On-site
USD 120,000 - 210,000
Applied ML Evaluator & Methodology Reviewer
Applied ML Evaluator & Methodology Reviewer

Mercor • Philadelphia

On-site
USD 120,000 - 180,000
ML Rigor Auditor for Experimental Tasks
ML Rigor Auditor for Experimental Tasks

Mercor • San Francisco (CA)

On-site
USD 130,000 - 190,000
Machine Learning Evaluator - AI Trainer
Machine Learning Evaluator - AI Trainer

Mercor • Philadelphia

On-site
USD 120,000 - 180,000
AI Evaluation Specialist: ML Task Auditor
AI Evaluation Specialist: ML Task Auditor

HumanitApp • Northern (KY)

Hybrid
USD 96,000 - 124,000
ML Task Auditor - Applied ML
ML Task Auditor - Applied ML

Mercor • San Francisco (CA)

On-site
USD 130,000 - 190,000
ML Task Auditor - Applied ML
ML Task Auditor - Applied ML

Obsidian • San Francisco (CA)

On-site
USD 120,000 - 210,000
ML Challenge Task Auditor
ML Challenge Task Auditor

DigiNo • Northern (KY)

Hybrid
USD 100,000 - 180,000
AI Benchmark Quality Engineer for Task Evaluation
AI Benchmark Quality Engineer for Task Evaluation

Obsidian • San Francisco (CA)

Remote
USD 115,000 - 160,000