AI Benchmark Quality Engineer for Task Evaluation

Obsidian

San Francisco (CA)

Remote

USD 115,000 - 160,000

Full time

11 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Obsidian is seeking a candid evaluator to assess the quality, correctness, and reproducibility of software-engineering benchmark tasks used to train frontier AI labs. You will review repository-level tasks, reference patches, test harnesses, and grading integrity, and provide rubric-based written feedback.

Responsibilities include identifying gaps in tooling, ensuring task reproducibility across environments, and delivering concrete, rubric-based assessments to guide model training and

Qualifications

  • 3+ years of professional software engineering experience.
  • Proven open-source contributions or maintainer roles.
  • Ability to audit reference patches, test runners, and Docker isolation.
  • Fluency in Python and at least one of Java/Go/TypeScript/C++.

Skills

Software engineering
Open-source maintainer
Patch audit
Python & another language

Tools

Docker

Job description

Obsidian is seeking a candid evaluator to assess the quality, correctness, and reproducibility of software-engineering benchmark tasks used to train frontier AI labs. You will review repository-level tasks, reference patches, test harnesses, and grading integrity, and provide rubric-based written feedback.

Responsibilities include identifying gaps in tooling, ensuring task reproducibility across environments, and delivering concrete, rubric-based assessments to guide model training and

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Software Benchmark Auditor: Reproducibility & Quality
Software Benchmark Auditor: Reproducibility & Quality

Obsidian • San Francisco (CA)

On-site
USD 140,000 - 190,000
Frontier AI Benchmark Task Auditor
Frontier AI Benchmark Task Auditor

Mercor • United States

Remote
USD 110,000 - 170,000
Senior Software Benchmark Auditor - Code Quality & Integrity
Senior Software Benchmark Auditor - Code Quality & Integrity

Mercor • San Francisco (CA)

On-site
USD 150,000 - 190,000
SWE Benchmark Auditor for AI Model Evaluation
SWE Benchmark Auditor for AI Model Evaluation

Dorado • Northern (KY)

Hybrid
USD 100,000 - 150,000
Remote AI Benchmark Engineer (PhD)
Remote AI Benchmark Engineer (PhD)

Obsidian • New York (NY)

On-site
USD 90,000 - 130,000
AI/ML Software Engineer — Benchmark Task Designer
AI/ML Software Engineer — Benchmark Task Designer

Obsidian • San Francisco (CA)

On-site
Software Engineer - Benchmark Auditor
Software Engineer - Benchmark Auditor

Obsidian • San Francisco (CA)

On-site
USD 140,000 - 190,000
AI Banking Quality Architect & Evaluation Lead
AI Banking Quality Architect & Evaluation Lead

Obsidian • New York (NY)

On-site
USD 120,000 - 180,000
AI Task Designer — Materials & Mechanical Engineering
AI Task Designer — Materials & Mechanical Engineering

Obsidian • San Francisco (CA)

Remote
USD 140,000 - 210,000
Software Engineer - Benchmark Auditor
Software Engineer - Benchmark Auditor

Mercor • San Francisco (CA)

On-site
USD 150,000 - 190,000