Remote Preference Dataset QA Evaluator RLHF

AuraOne

United States

On-site

USD 55,104 - 82,656

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

AuraOne is seeking a remote Preference Dataset QA Reward Model Evaluator to review prompts and model outputs against our quality rubric. You will compare paired responses, label edge cases, and write structured feedback to help retrain the model.

The role focuses on identifying hallucinations and instruction-following failures, tagging with the correct policy categories, and calibrating judgments against gold-standard examples.

Qualifications

  • Prior evaluation, annotation, or human-rater experience on preference dataset QA reward model evaluation or adjacent content.
  • Comfort applying multi-page rubrics consistently across long batches.
  • Clear written reasoning that names the issue and the rubric clause being applied.
  • Strong attention to detail and the ability to flag when a prompt itself is the problem.
  • Reliable async availability for at least 10 hours per week.

Responsibilities

  • Evaluate preference dataset QA reward model evaluation model outputs against a versioned rubric and assign severity tags for assignments.
  • Compare paired responses and pick the stronger answer with a written rationale.
  • Label hallucinations, instruction-following failures, and unsafe content with structured tags.
  • Capture ambiguous prompts and route them back to the program team for rubric updates.
  • Maintain reviewer-quality scores by calibrating against gold-standard examples each week.
  • Document recurring failure modes so the modeling team can target them in the next training run.

Skills

Model output evaluation
Rubric-based annotation
Severity tagging
Inter-rater calibration
Preference Dataset QA Reward Model
Preference ranking
RLHF
Rater calibration
Preference
Dataset

Job description

AuraOne is seeking a remote Preference Dataset QA Reward Model Evaluator to review prompts and model outputs against our quality rubric. You will compare paired responses, label edge cases, and write structured feedback to help retrain the model.

The role focuses on identifying hallucinations and instruction-following failures, tagging with the correct policy categories, and calibrating judgments against gold-standard examples.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Remote AI Preference Data QA Specialist
Remote AI Preference Data QA Specialist

AuraOne • United States

On-site
USD 34,440 - 55,104
Remote Evaluator: Preference Taxonomy & Model Quality
Remote Evaluator: Preference Taxonomy & Model Quality

AuraOne • United States

On-site
USD 34,440 - 55,104
Remote Pairwise Preference Evaluator & Feedback Specialist
Remote Pairwise Preference Evaluator & Feedback Specialist

AuraOne • United States

On-site
USD 27,552 - 55,104
Remote Scene Understanding Evaluator - AI Data Quality
Remote Scene Understanding Evaluator - AI Data Quality

AuraOne • United States

On-site
USD 34,000 - 62,000
Remote Retrieval Relevance Evaluator — Quality Feedback
Remote Retrieval Relevance Evaluator — Quality Feedback

AuraOne • United States

On-site
USD 34,440 - 55,104
Remote Human Data Evaluator & Rubric Reviewer
Remote Human Data Evaluator & Rubric Reviewer

AuraOne • United States

On-site
USD 34,000 - 55,000
Remote Visual QA Evaluator & Rubric Auditor
Remote Visual QA Evaluator & Rubric Auditor

AuraOne • United States

On-site
USD 34,440 - 55,104
Remote Data Quality Reviewer - Multi-Turn Ranking & RLHF
Remote Data Quality Reviewer - Multi-Turn Ranking & RLHF

AuraOne • United States

On-site
USD 34,440 - 55,104
Remote Data Readouts Evaluator & Rubric Auditor
Remote Data Readouts Evaluator & Rubric Auditor

AuraOne • United States

On-site
USD 110,208 - 165,312
Remote Memory Evaluation Quality Reviewer
Remote Memory Evaluation Quality Reviewer

AuraOne • United States

On-site
USD 34,440 - 61,992