Remote Prompt Robustness Evaluator (Model Evaluation)

AI Trainer Jobs

United States

Remote

USD 34,000 - 62,000

Part time

3 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

AuraOne is seeking a Prompt Robustness Model Evaluation Specialist to remotely review evaluation prompts and responses against AuraOne's quality rubric. Reviewers compare paired outputs, label edge cases, and provide structured feedback to retrain the model.

Responsibilities include evaluating frontier model outputs, judging failures, and calibrating other evaluators. Strong written reasoning and attention to detail are essential, with at least 10 hours per week availability.

Qualifications

  • Prior evaluation or annotation experience on prompt robustness evaluation.
  • Ability to apply multi-page rubrics consistently across long batches.
  • Clear written reasoning that names the issue and the rubric clause applied.
  • Strong attention to detail and ability to flag when a prompt itself is the problem.
  • Reliable async availability for at least 10 hours per week.

Responsibilities

  • Evaluate prompt robustness model outputs against a versioned rubric and assign severity tags.
  • Compare paired responses and select the stronger with a written rationale.
  • Label hallucinations, instruction-following failures, and unsafe content with structured tags.
  • Capture ambiguous prompts and route them back to the program team for rubric updates.

Skills

Attention to detail
Written reasoning
Analytical thinking
Inter-rater calibration
Linguistics background

Job description

AuraOne is seeking a Prompt Robustness Model Evaluation Specialist to remotely review evaluation prompts and responses against AuraOne's quality rubric. Reviewers compare paired outputs, label edge cases, and provide structured feedback to retrain the model.

Responsibilities include evaluating frontier model outputs, judging failures, and calibrating other evaluators. Strong written reasoning and attention to detail are essential, with at least 10 hours per week availability.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote Frontier Model Evaluator - Failure Analysis Reviewer
Remote Frontier Model Evaluator - Failure Analysis Reviewer

AI Trainer Jobs • United States

Remote
USD 55,000 - 96,000
Remote Capability Risk Evaluator & Model Reviewer
Remote Capability Risk Evaluator & Model Reviewer

AI Trainer Jobs • United States

Remote
USD 34,000 - 62,000
Remote Rubric Evaluation Specialist
Remote Rubric Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote Frontier Model Evaluation Specialist
Remote Frontier Model Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000
Remote Low-Resource Language AI Evaluator & Feedback Pro
Remote Low-Resource Language AI Evaluator & Feedback Pro

AI Trainer Jobs • United States

Remote
USD 28,000 - 41,000
Remote Visual Evaluation & Rubric Feedback Specialist
Remote Visual Evaluation & Rubric Feedback Specialist

AI Trainer Jobs • United States

Remote
USD 27,552,000 - 49,594,000
Remote Product Launch Evaluation & Rubrics Specialist
Remote Product Launch Evaluation & Rubrics Specialist

AI Trainer Jobs • United States

Remote
USD 110,000 - 165,000
Remote Customer Success Evaluation Specialist
Remote Customer Success Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 110,000 - 165,000
Remote Multimodal Evaluation Specialist
Remote Multimodal Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 47,000 - 63,000
Remote Social Content Quality Evaluator: AI Model Review
Remote Social Content Quality Evaluator: AI Model Review

AI Trainer Jobs • United States

Remote
USD 28,000 - 55,000