AI Benchmark Auditor (Python & Evaluation)

HumanitApp

Northern (KY)

Hybrid

USD 96,000 - 124,000

Full time

6 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

HumanitApp is seeking a role focused on evaluating benchmark tasks used to train and assess frontier AI models, focusing on quality and reproducibility.

You will assess tasks, patches, and harnesses while delivering rubric-based feedback to ensure rigorous evaluation standards.

This remote-friendly opportunity offers compensation ranging from $70 to $90 per hour, with workload and terms clarified during the official application process.

Responsibilities

  • Evaluate the quality, correctness, and reproducibility of software-engineering benchmark tasks used to train and evaluate frontier AI models.
  • Review repository-level tasks, reference patches, test harnesses, and grading integrity.
  • Provide rubric-based written feedback.

Skills

AI evaluation
Python
Software engineering

Job description

HumanitApp is seeking a role focused on evaluating benchmark tasks used to train and assess frontier AI models, focusing on quality and reproducibility.

You will assess tasks, patches, and harnesses while delivering rubric-based feedback to ensure rigorous evaluation standards.

This remote-friendly opportunity offers compensation ranging from $70 to $90 per hour, with workload and terms clarified during the official application process.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

SWE-Bench Task Auditor
SWE-Bench Task Auditor

HumanitApp • Northern (KY)

Hybrid
USD 96,000 - 124,000
AI Benchmark Quality Engineer for Task Evaluation
AI Benchmark Quality Engineer for Task Evaluation

Obsidian • San Francisco (CA)

Remote
USD 115,000 - 160,000
AI Evaluation Specialist: ML Task Auditor
AI Evaluation Specialist: ML Task Auditor

HumanitApp • Northern (KY)

Hybrid
USD 96,000 - 124,000
AI Benchmark Technical Writer - Remote
AI Benchmark Technical Writer - Remote

YO AI Labs • Palo Alto (CA)

Remote
USD 60,000 - 90,000
Remote work
AI Developer Trace Task Auditor
AI Developer Trace Task Auditor

HumanitApp • Northern (KY)

Hybrid
USD 96,000 - 124,000
Kubernetes Task Auditor
Kubernetes Task Auditor

HumanitApp • Northern (KY)

Hybrid
USD 96,000 - 124,000
Kubernetes Task Auditor for AI Evaluation
Kubernetes Task Auditor for AI Evaluation

HumanitApp • Northern (KY)

Hybrid
USD 96,000 - 124,000
AI Trace Evaluator: Quality & Reasoning Auditor
AI Trace Evaluator: Quality & Reasoning Auditor

HumanitApp • Northern (KY)

Hybrid
USD 96,000 - 124,000
Software Benchmark Auditor: Reproducibility & Quality
Software Benchmark Auditor: Reproducibility & Quality

Obsidian • San Francisco (CA)

On-site
USD 140,000 - 190,000
AI Benchmark Technical Writer - Remote Contract
AI Benchmark Technical Writer - Remote Contract

YO AI Labs • Washington

Remote
USD 55,000 - 83,000