Generative AI Quality Evaluator (Remote)

Crossing Hurdles

United States

Remote

CAD 27,552 - 41,328

Part time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

A remote-focused technology firm is looking for an individual proficient in evaluating large language model outputs. The role involves assessing AI systems, reviewing workflows, and providing actionable feedback to enhance product quality. Ideal candidates will have strong analytical skills, attention to detail, and excellent communication abilities in English. This position allows for flexibility, with a commitment between 10 to 40 hours each week, compensated hourly at $20–$30.

Qualifications

  • Strong experience in LLM evaluation, AI output analysis, QA/testing, UX research, or similar analytical roles.
  • Proficiency in rubric-based scoring, benchmarking frameworks, and AI quality assessment.
  • Excellent attention to detail with strong decision-making skills in ambiguous cases.
  • Proficient English communication skills (written and verbal).
  • Ability to work independently in a remote environment.
  • Comfortable committing to structured evaluation workflows and evolving guidelines.

Responsibilities

  • Evaluate outputs from large language models and autonomous agent systems using defined rubrics and quality standards.
  • Review multi-step agent workflows, including screenshots and reasoning traces, to assess accuracy and completeness.
  • Apply benchmarking criteria consistently while identifying edge cases and recurring failure patterns.
  • Provide structured, actionable feedback to support model refinement and product improvements.
  • Participate in calibration sessions to ensure consistent evaluation alignment across reviewers.
  • Adapt to evolving guidelines and ambiguous scenarios with sound judgment.
  • Document findings clearly and communicate insights to relevant stakeholders.

Skills

LLM evaluation
AI output analysis
QA/testing
UX research
Attention to detail
Proficient English communication

Job description

A remote-focused technology firm is looking for an individual proficient in evaluating large language model outputs. The role involves assessing AI systems, reviewing workflows, and providing actionable feedback to enhance product quality. Ideal candidates will have strong analytical skills, attention to detail, and excellent communication abilities in English. This position allows for flexibility, with a commitment between 10 to 40 hours each week, compensated hourly at $20–$30.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Remote AI Prompt Evaluator & Quality Assurance Specialist
Remote AI Prompt Evaluator & Quality Assurance Specialist

Crossing Hurdles • United States

Remote
USD 60,000 - 80,000
Generative AI Evaluator | $30/hr Remote
Generative AI Evaluator | $30/hr Remote

Crossing Hurdles • United States

Remote
Remote AI Output Evaluator: Personalization & Quality
Remote AI Output Evaluator: Personalization & Quality

Crossing Hurdles • United States

On-site
USD 60,000 - 80,000
Remote AI Quality Evaluator & Feedback Specialist
Remote AI Quality Evaluator & Feedback Specialist

24-Mag Llc • Northern (KY)

Hybrid
USD 41,000 - 124,000
Remote GenAI Reviewer & Quality Analyst (Flexible Hours)
Remote GenAI Reviewer & Quality Analyst (Flexible Hours)

Uber AI Solutions • United States

Remote
USD 80,000 - 100,000
AI Response Evaluator & Feedback Specialist
AI Response Evaluator & Feedback Specialist

Crossing Hurdles • United States

On-site
USD 52,000 - 93,000
Autonomous AI QA & Evaluation Analyst (Remote)
Autonomous AI QA & Evaluation Analyst (Remote)

Mindrift • Arizona

Remote
USD 60,000 - 80,000
Remote AI Language Quality Specialist
Remote AI Language Quality Specialist

YO AI Labs • Washington

Remote
USD 34,000 - 83,000
Remote AI Agent Evaluator QA Strategist
Remote AI Agent Evaluator QA Strategist

Mindrift • Wisconsin

Remote
USD 60,000 - 80,000
AI Quality Annotator — Remote, Hourly Contract
AI Quality Annotator — Remote, Hourly Contract

Crossing Hurdles • United States

Remote
GBP 60,000 - 80,000