Senior RLHF Preference Data Reviewer - Remote

AI Trainer Jobs

United States

Remote

USD 34,000 - 55,000

Full time

2 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

AuraOne is seeking an Expert Preference Preference Data Reviewer for remote evaluation of preference data against our quality rubric. You will compare paired outputs, label edge cases, and write structured feedback to retrain the model.

As a remote contractor, you will produce rankings, reward-model feedback, and calibrated human judgment for post-training pipelines. Strong attention to detail and clear reasoning are essential for success.

Qualifications

  • Prior evaluation, annotation, or human-rater experience on preference data evaluation.
  • Ability to apply multi-page rubrics consistently across long batches.
  • Clear written reasoning that names the issue and rubric clause.

Responsibilities

  • Evaluate preference data evaluation model outputs against a versioned rubric and assign severity tags.
  • Compare paired responses and select the stronger answer with written rationale.
  • Label hallucinations, instruction-following failures, and unsafe content with structured tags.
  • Capture ambiguous prompts and route them for rubric updates.

Skills

Model output evaluation
Rubric-based annotation
Inter-rater calibration
Preference data evaluation
Attention to detail

Job description

AuraOne is seeking an Expert Preference Preference Data Reviewer for remote evaluation of preference data against our quality rubric. You will compare paired outputs, label edge cases, and write structured feedback to retrain the model.

As a remote contractor, you will produce rankings, reward-model feedback, and calibrated human judgment for post-training pipelines. Strong attention to detail and clear reasoning are essential for success.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote RLHF QA Evaluator - Preference Data
Remote RLHF QA Evaluator - Preference Data

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote work
Remote AI Preference Data QA Reviewer & Feedback Specialist
Remote AI Preference Data QA Reviewer & Feedback Specialist

AI Trainer Jobs • United States

Remote
USD 28,000 - 48,000
Remote RLHF Evaluator: Preference Taxonomy Feedback
Remote RLHF Evaluator: Preference Taxonomy Feedback

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Remote RLHF: Reward Hacking Preference Data Reviewer
Remote RLHF: Reward Hacking Preference Data Reviewer

AI Trainer Jobs • United States

Remote
USD 27,552,000 - 41,328,000
Remote work (US-eligible)
Contractor role
Expert Preference Preference Data Reviewer
Expert Preference Preference Data Reviewer

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Preference Dataset QA Preference Data Reviewer
Preference Dataset QA Preference Data Reviewer

AI Trainer Jobs • United States

Remote
USD 28,000 - 48,000
Remote RLHF Data Reviewer: Consensus & Rubric Feedback
Remote RLHF Data Reviewer: Consensus & Rubric Feedback

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote Multi-Turn Ranking Feedback Reviewer
Remote Multi-Turn Ranking Feedback Reviewer

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Preference Dataset QA Reward Model Evaluator
Preference Dataset QA Reward Model Evaluator

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote work
Preference Taxonomy Reward Model Evaluator
Preference Taxonomy Reward Model Evaluator

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000