Adversarial AI Safety Red Team Evaluator

AI Trainer Jobs

United States

Remote

USD 90,000 - 96,000

Full time

3 days ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

AuraOne is seeking a Manipulation Risk Risk Evaluator for a remote, contractor role focused on stress-testing AI systems against adversarial prompts. Reviewers craft attack scenarios, document failures, and pair each jailbreak with the violated rubric clause so the safety team can patch gaps.

Adversarial evaluation helps harden models before they ship to customers. Applicants should push on refusal boundaries, document rigorously, and score defenses across single-turn and multi-turn

Qualifications

  • Experience red-teaming AI systems or adversarial ML work.
  • Ability to document attacks with reproduction steps and patch tickets.
  • Strong written communication and ability to document policy-rationale clearly.

Responsibilities

  • Design adversarial prompts that probe weakness classes (jailbreak, policy bypass, prompt injection).
  • Document every successful attack with reproduction steps and the policy clause it violated.
  • Score model defenses across single-turn and multi-turn conversations.
  • Triage emerging attack vectors and route them to the safety team with severity ratings.
  • Maintain a personal library of attack patterns and propose new red-team rubrics.

Skills

Adversarial prompting
Red-team analysis
Policy taxonomy
Failure documentation
Manipulation Risk Risk evaluation
AI safety
Red-team evaluation
Policy rubrics
Manipulation
Risk

Job description

AuraOne is seeking a Manipulation Risk Risk Evaluator for a remote, contractor role focused on stress-testing AI systems against adversarial prompts. Reviewers craft attack scenarios, document failures, and pair each jailbreak with the violated rubric clause so the safety team can patch gaps.

Adversarial evaluation helps harden models before they ship to customers. Applicants should push on refusal boundaries, document rigorously, and score defenses across single-turn and multi-turn

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote Adversarial AI Safety Evaluator
Remote Adversarial AI Safety Evaluator

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Safety Red-Team Risk Evaluator
Remote AI Safety Red-Team Risk Evaluator

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Safety & Adversarial Evaluation Specialist
Remote AI Safety & Adversarial Evaluation Specialist

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Safety Cybersecurity Red Team Engineer
Remote AI Safety Cybersecurity Red Team Engineer

AI Trainer Jobs • United States

Remote
USD 83,000 - 124,000
Remote AI Adversarial Security Analyst (Red Team)
Remote AI Adversarial Security Analyst (Red Team)

AI Trainer Jobs • United States

Remote
USD 96,000 - 138,000
Remote AI Adversarial Testing Red Team Engineer
Remote AI Adversarial Testing Red Team Engineer

AI Trainer Jobs • United States

Remote
USD 96,000 - 138,000
Manipulation Risk Risk Evaluator
Manipulation Risk Risk Evaluator

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Safety Red Team Specialist
Remote AI Safety Red Team Specialist

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Safety Red Team Specialist (English & Thai)
Remote AI Safety Red Team Specialist (English & Thai)

AI Trainer Jobs • United States

Remote
USD 33,000 - 48,000
AI Safety Red Team Specialist (English & Malay) — Remote
AI Safety Red Team Specialist (English & Malay) — Remote

AI Trainer Jobs • United States

Remote
USD 23,000 - 34,000