Frontier Model Evaluation Reviewer: Generalization Failures

AI Trainer Jobs

United States

Remote

USD 34,000 - 48,000

Part time

2 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

AuraOne is seeking a Capability Generalization Failure Analysis Reviewer for a remote contractor role. You will evaluate frontier model outputs, compare paired responses, label edge cases, and provide structured feedback to retrain the system.

Responsibilities include scoring against a versioned rubric, tagging issues, and documenting rationale for program reviews. The role requires strong attention to detail and reliable async availability for 10+ hours weekly.

Qualifications

  • Prior evaluation, annotation, or human-rater experience in capability generalization failure analysis or related content.
  • Ability to apply rubrics consistently across long batches.
  • Clear written reasoning that names the issue and rubric clause.

Responsibilities

  • Evaluate model outputs against a rubric and assign severity tags.
  • Compare paired responses and select the stronger with a rationale.
  • Label hallucinations, instruction-following, and unsafe content with tags.
  • Capture ambiguous prompts and route to rubric updates.

Skills

Background in linguistics, content/mod
Inter-rater agreement metrics
Subject-matter error spotting

Job description

AuraOne is seeking a Capability Generalization Failure Analysis Reviewer for a remote contractor role. You will evaluate frontier model outputs, compare paired responses, label edge cases, and provide structured feedback to retrain the system.

Responsibilities include scoring against a versioned rubric, tagging issues, and documenting rationale for program reviews. The role requires strong attention to detail and reliable async availability for 10+ hours weekly.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote Frontier Model Evaluator - Failure Analysis Reviewer
Remote Frontier Model Evaluator - Failure Analysis Reviewer

AI Trainer Jobs • United States

Remote
USD 55,000 - 96,000
Remote Frontier Model Grading Failure Evaluator
Remote Frontier Model Grading Failure Evaluator

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Remote Frontier Model Evaluation Specialist
Remote Frontier Model Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote Uncertainty Calibration Reviewer - Frontier AI
Remote Uncertainty Calibration Reviewer - Frontier AI

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote Frontier Model Evaluator: Wholesale & Tech Sales
Remote Frontier Model Evaluator: Wholesale & Tech Sales

AI Trainer Jobs • United States

Remote
USD 69,000 - 76,000
Remote work
US-eligible contractor
Competitive pay
Remote Capability Risk Evaluator & Model Reviewer
Remote Capability Risk Evaluator & Model Reviewer

AI Trainer Jobs • United States

Remote
USD 34,000 - 62,000
Frontier Tool-Use Reasoning Evaluation Specialist
Frontier Tool-Use Reasoning Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 83,000 - 124,000
Remote Data Annotation Specialist – Frontier Model Evaluation
Remote Data Annotation Specialist – Frontier Model Evaluation

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Remote Rubric Evaluation Specialist
Remote Rubric Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Capability Generalization Failure Analysis Reviewer
Capability Generalization Failure Analysis Reviewer

AI Trainer Jobs • United States

Remote
USD 34,000 - 48,000