Remote RLHF: Reward Hacking Preference Data Reviewer

AI Trainer Jobs

United States

Remote

USD 27,552,000 - 41,328,000

Full time

2 days ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Benefits offered by this job

Remote work (US-eligible)
Contractor role

Job summary

AuraOne is seeking a Reward Hacking Detection Preference Data Reviewer for a remote evaluation track. You will review data prompts and responses against our quality rubric, compare paired outputs, and provide structured feedback to retrain models.

Responsibilities include labeling issues, ranking outputs, and writing clear rationales. This is a contractor, remote role with hourly pay to be confirmed after interview, and US eligibility is required.

Qualifications

  • Responsibilities include evaluating model outputs against a rubric, labeling issues, and providing feedback.
  • Ability to apply rubric criteria consistently to long text prompts.
  • Strong written reasoning and attention to detail.
  • Experience with RLHF, human preference data evaluation, or content moderation is a plus.

Responsibilities

  • Evaluate reward hacking detection preference data evaluation model outputs against a versioned rubric and assign severity tags for Reviewer assignments.
  • Compare paired responses and select the stronger answer with a written rationale.
  • Label hallucinations, instruction-following failures, and unsafe content with structured tags.
  • Capture ambiguous prompts and route them back to the program team for rubric updates.

Job description

AuraOne is seeking a Reward Hacking Detection Preference Data Reviewer for a remote evaluation track. You will review data prompts and responses against our quality rubric, compare paired outputs, and provide structured feedback to retrain models.

Responsibilities include labeling issues, ranking outputs, and writing clear rationales. This is a contractor, remote role with hourly pay to be confirmed after interview, and US eligibility is required.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Reward Hacking Detection Preference Data Reviewer
Reward Hacking Detection Preference Data Reviewer

AI Trainer Jobs • United States

Remote
USD 27,552,000 - 41,328,000
Remote work (US-eligible)
Contractor role
Remote RLHF QA Evaluator - Preference Data
Remote RLHF QA Evaluator - Preference Data

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote work
Senior RLHF Preference Data Reviewer - Remote
Senior RLHF Preference Data Reviewer - Remote

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Remote RLHF Evaluator: Preference Taxonomy Feedback
Remote RLHF Evaluator: Preference Taxonomy Feedback

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Remote Multi-Turn Ranking Feedback Reviewer
Remote Multi-Turn Ranking Feedback Reviewer

AI Trainer Jobs • United States

Remote
USD 34,000 - 55,000
Remote RLHF Evaluation Specialist — Instruction Tuning
Remote RLHF Evaluation Specialist — Instruction Tuning

AI Trainer Jobs • United States

Remote
USD 28,000 - 48,000
Remote AI Preference Data QA Reviewer & Feedback Specialist
Remote AI Preference Data QA Reviewer & Feedback Specialist

AI Trainer Jobs • United States

Remote
USD 28,000 - 48,000
Remote AI Data Reviewer: App User Evaluations
Remote AI Data Reviewer: App User Evaluations

AuraOne • United States

On-site
USD 41,000 - 55,000
Remote work
Remote AI Data Reviewer for Agentic Search Systems
Remote AI Data Reviewer for Agentic Search Systems

AI Trainer Jobs • United States

Remote
USD 110,000 - 207,000
Remote
Preference Dataset QA Reward Model Evaluator
Preference Dataset QA Reward Model Evaluator

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote work