AI Prompt Quality Rater

AI Trainer Jobs

United States

À distance

USD 48 000 - 76 000

Plein temps

Il y a 3 jours
Soyez parmi les premiers à postuler
Générateur de candidature

Une candidature conçue pour ce poste — un CV et une lettre de motivation personnalisés qui correspondent à l’offre.

Passez les filtres ATS

Résumé du poste

AI Trainer Jobs is seeking a detail-oriented evaluator to score prompt-response pairs from large language models. You will use structured rubrics to rate factual accuracy, instruction-following, and coherence across batches, typically 20–50 pairs per session.

You will flag edge cases, document subtle failure modes, and contribute to fine-tuning data. Sessions are asynchronous with calibration meetings every two weeks, offering potential tracks in legal, medical, or coding domains.

Qualifications

  • Experience evaluating prompts using structured rubrics.
  • Ability to identify edge cases and subtle failure modes.
  • Strong analytical writing to justify scores.

Responsabilités

  • Evaluate prompts and model responses using a rubric.
  • Identify and flag edge cases and misleading outputs.
  • Write concise justifications for non-obvious scores and share findings.

Connaissances

Prompt evaluation
Rubric-based scoring
LLM output analysis
Instruction-following assessment
Factual accuracy verification
Annotation platform proficiency

Description du poste

Pay: $35-55/hour

You'll evaluate prompt-response pairs generated by large language models, scoring them across dimensions like factual accuracy, instruction-following, coherence, and appropriate refusal behavior. Each session involves reviewing batches of 20-50 pairs using a structured rubric inside a web-based annotation platform, flagging edge cases, and writing brief justifications for non-obvious scores.

Beyond surface-level ratings, you'll identify subtle failure modes — responses that are technically accurate but misleading, answers that follow the letter of a prompt while violating its intent, and outputs that pass a quick read but contain embedded errors. You'll work asynchronously, with a typical batch taking 60-90 minutes, and you're expected to maintain inter-annotator agreement scores above 0.75 kappa.

Feedback you submit feeds directly into preference datasets used to fine-tune and align production models. Calibration sessions run bi-weekly, where you'll review disagreements with a senior evaluator and update your scoring approach. Strong performance can lead to specialized tracks covering domain-specific evaluation (legal, medical, code).

Skills & requirements
  • Prompt evaluation
  • Rubric-based scoring
  • LLM output analysis
  • Instruction-following assessment
  • Factual accuracy verification
  • Annotation platform proficiency

Category: RLHF

Obtenez votre examen gratuit et confidentiel de votre CV.

ou faites glisser et déposez votre fichier ici.

Similar jobs

Postes similaires à comparer

AI Prompt Quality Evaluator & Feedback Analyst
AI Prompt Quality Evaluator & Feedback Analyst

AI Trainer Jobs • États-Unis

À distance
USD 48 000 - 76 000
Prompt Robustness Failure Analysis Reviewer
Prompt Robustness Failure Analysis Reviewer

AuraOne, Inc. • États-Unis

Sur place
USD 34 000 - 55 000
Project Lion - Senior Prompt Engineer - Italy (Remote, Part-Time)
Project Lion - Senior Prompt Engineer - Italy (Remote, Part-Time)

Welo Global • Town of Italy (NY)

À distance
USD 90 000 - 130 000
Pricing / ROI / revenue economics Evaluator
Pricing / ROI / revenue economics Evaluator

AI Trainer Jobs • États-Unis

À distance
USD 110 000 - 165 000
Remote work
Speech and Audio Quality Evaluator
Speech and Audio Quality Evaluator

AI Trainer Jobs • États-Unis

À distance
USD 28 000 - 55 000
Product launch / experiment readiness Evaluator
Product launch / experiment readiness Evaluator

AI Trainer Jobs • États-Unis

À distance
USD 110 000 - 165 000
Bilingual AI Response Evaluator
Bilingual AI Response Evaluator

AI Trainer Jobs • États-Unis

À distance
USD 34 000 - 55 000
Voice Actors Prompt Writter
Voice Actors Prompt Writter

AI Trainer Jobs • États-Unis

À distance
USD 55 000 - 83 000
Remote work
US eligibility
Japanese-Language AI Response Evaluator (Remote, Japan)
Japanese-Language AI Response Evaluator (Remote, Japan)

AuraOne, Inc. • États-Unis

À distance
USD 55 000 - 83 000
Simultaneous Interpretation AI Evaluator
Simultaneous Interpretation AI Evaluator

AI Trainer Jobs • États-Unis

À distance
USD 34 000 - 55 000