Remote AI Evaluation Engineer - Agentic Search Systems

AuraOne

United States

On-site

USD 110,000 - 207,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

AuraOne is seeking a remote contractor to evaluate software engineer agentic search model outputs against a quality rubric. You will label edge cases, provide rationales, and generate regression cases for auditing human data.

Responsibilities include comparing responses, tagging issues, and identifying recurring failures to guide improvements. This role requires strong written communication and a reliable weekly availability schedule.

Qualifications

  • Prior evaluation, annotation, or human-rater experience on software engineer agentic search systems evaluation.
  • Comfort applying multi-page rubrics consistently across long batches.
  • Clear written reasoning that names the issue and the rubric clause being applied.
  • Strong attention to detail and the ability to flag when a prompt itself is the problem.
  • Reliable async availability for at least 10 hours per week.

Responsibilities

  • Evaluate model outputs against a versioned rubric and tag severity for assignments.
  • Compare paired responses and select the stronger answer with a rationale.
  • Label hallucinations, instruction-following failures, and unsafe content with structured tags.
  • Capture ambiguous prompts and route to the program team for rubric updates.
  • Maintain reviewer-quality scores by calibrating against gold-standard examples weekly.
  • Document recurring failure modes to inform the next training run.

Skills

Model output evaluation
Rubric-based annotation
Severity tagging
Inter-rater calibration
Software Engineer Agentic Search

Job description

AuraOne is seeking a remote contractor to evaluate software engineer agentic search model outputs against a quality rubric. You will label edge cases, provide rationales, and generate regression cases for auditing human data.

Responsibilities include comparing responses, tagging issues, and identifying recurring failures to guide improvements. This role requires strong written communication and a reliable weekly availability schedule.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Remote AI Evaluation & Feedback Specialist
Remote AI Evaluation & Feedback Specialist

AuraOne • United States

On-site
USD 55,000 - 110,000
Remote work
US-eligible
Contractor position
Remote Mobile AI Evaluation Specialist
Remote Mobile AI Evaluation Specialist

AuraOne • United States

On-site
USD 34,000 - 69,000
Remote AI Evaluation & Annotation Specialist (Contractor)
Remote AI Evaluation & Annotation Specialist (Contractor)

AuraOne • United States

On-site
USD 34,000 - 55,000
Remote AI Evaluation Specialist — Business Operations Feedback
Remote AI Evaluation Specialist — Business Operations Feedback

AuraOne • United States

On-site
USD 34,000 - 69,000
Remote Chemical Eng AI Evaluator & Feedback Specialist
Remote Chemical Eng AI Evaluator & Feedback Specialist

AuraOne • United States

On-site
USD 34,000 - 55,000
Remote work
Flexible schedule
Contractor engagement
AI Dialogue & Interaction Evaluator (Remote)
AI Dialogue & Interaction Evaluator (Remote)

AuraOne • United States

On-site
USD 25,000 - 44,000
Remote AI Data Evaluation Reviewer (Contractor)
Remote AI Data Evaluation Reviewer (Contractor)

AuraOne • United States

On-site
USD 34,000 - 55,000
Remote AI Evaluator for Supply Chain Quality & Feedback
Remote AI Evaluator for Supply Chain Quality & Feedback

AuraOne • United States

On-site
USD 41,000 - 69,000
Remote AI Workflow Evaluator – Management Consultant
Remote AI Workflow Evaluator – Management Consultant

AuraOne • United States

On-site
USD 34,000 - 83,000
Remote AI Audit Specialist for Equity Research
Remote AI Audit Specialist for Equity Research

AuraOne • United States

Remote
USD 55,000 - 96,000
Big Four or bulge-bracket experience (
AI tooling familiarity
Cross-jurisdiction bilingual reviews