SWE Benchmark Auditor for AI Model Evaluation

Dorado

Northern (KY)

Hybrid

USD 100,000 - 150,000

Full time

11 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Dorado seeks a software engineering quality assessor to evaluate the quality, correctness, and reproducibility of benchmark tasks used for frontier AI lab models. You will audit repository-level tasks, reference patches, test harnesses, and grading integrity, and provide rubric-based feedback.

Ideal candidates will have 3+ years in professional software engineering, real open-source contribution or maintainer experience, and fluency in Python plus at least one of Java, Go, TypeScript, or C++.

Qualifications

  • 3+ years professional software engineering.
  • Real open-source contribution or maintainer experience (merged PRs, committer/maintainer roles).
  • Strong ability to audit reference patches, test runners, and Docker isolation, and to detect answer leakage / reward hacking.
  • Fluency across Python and at least one of Java / Go / TypeScript / C++.

Responsibilities

  • Evaluate the quality, correctness, and reproducibility of software-engineering benchmark tasks used to train and evaluate frontier AI lab models.
  • Assess repository-level tasks, reference patches, test harnesses, and grading integrity.
  • Provide rubric-based written feedback to guide improvements and ensure robust benchmarking practices.

Skills

Software engineering
Open-source contributions
Code review
Patching auditing
Python
Java
Go
TypeScript
C++

Tools

Docker

Job description

Dorado seeks a software engineering quality assessor to evaluate the quality, correctness, and reproducibility of benchmark tasks used for frontier AI lab models. You will audit repository-level tasks, reference patches, test harnesses, and grading integrity, and provide rubric-based feedback.

Ideal candidates will have 3+ years in professional software engineering, real open-source contribution or maintainer experience, and fluency in Python plus at least one of Java, Go, TypeScript, or C++.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Software Benchmark Auditor - Code Quality & Integrity
Senior Software Benchmark Auditor - Code Quality & Integrity

Mercor • San Francisco (CA)

On-site
USD 150,000 - 190,000
Software Engineer - Benchmark Auditor
Software Engineer - Benchmark Auditor

Mercor • San Francisco (CA)

On-site
USD 150,000 - 190,000
Software Engineer - Benchmark Auditor
Software Engineer - Benchmark Auditor

Obsidian • San Francisco (CA)

On-site
USD 140,000 - 190,000
Software Benchmark Auditor: Reproducibility & Quality
Software Benchmark Auditor: Reproducibility & Quality

Obsidian • San Francisco (CA)

On-site
USD 140,000 - 190,000
SWE-Bench Task Auditor Mercor · Remote — United States $70-90/hr →
SWE-Bench Task Auditor Mercor · Remote — United States $70-90/hr →

Dorado • Northern (KY)

Hybrid
USD 100,000 - 150,000
AI Benchmark Quality Engineer for Task Evaluation
AI Benchmark Quality Engineer for Task Evaluation

Obsidian • San Francisco (CA)

Remote
USD 115,000 - 160,000
Frontier AI Benchmark Task Auditor
Frontier AI Benchmark Task Auditor

Mercor • United States

Remote
USD 110,000 - 170,000
SWE-Bench Task Auditor
SWE-Bench Task Auditor

OpenTrain AI • Northern (KY)

Hybrid
USD 96,000 - 124,000
Remote contract role (US)
40 hours/week target (20+ hours)
Competitive hourly rate $70–$90
AI-Assisted Code Quality Evaluator
AI-Assisted Code Quality Evaluator

Dorado • Northern (KY)

Hybrid
USD 90,000 - 130,000
Remote SWE-Bench Auditor - Part-Time, $70-$90/hr
Remote SWE-Bench Auditor - Part-Time, $70-$90/hr

OpenTrain AI • Northern (KY)

Hybrid
USD 96,000 - 124,000
Remote contract role (US)
40 hours/week target (20+ hours)
Competitive hourly rate $70–$90