Remote LLM Red Team: Failure Modes & Edge Cases

AI Trainer Jobs

United States

Remote

USD 83,000 - 124,000

Full time

4 days ago
Be an early applicant
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

AI Trainer Jobs is seeking an LLM Red Team Specialist — Failure Modes & Edge Cases for a remote contractor role focused on stress-testing AI systems against adversarial prompts. Reviewers craft attack scenarios and pair each jailbreak with the rubric clause it violated to help patch gaps.

You will design adversarial prompts, document reproducible steps, score defenses, and triage emerging vectors for safety teams. This position requires about 10 hours per week and US eligibility.

Qualifications

  • Demonstrated experience red-teaming AI systems, security research, or adversarial ML work for LLM Red Team Specialist — Failure Modes & Edge Cases work.
  • Strong written communication — your reports become the patch ticket.
  • Comfort working in policy-grey areas with clear documentation of what was attempted and why.
  • Familiarity with prompt-injection, jailbreak, and policy-bypass taxonomies.
  • Reliable async availability for at least 10 hours per week.

Responsibilities

  • Design adversarial prompts that probe known weakness classes (jailbreak, policy bypass, prompt injection) for LLM Red Team Specialist — Failure Modes & Edge Cases assignments.
  • Document every successful attack with reproduction steps and the policy clause it violated.
  • Score model defenses across single-turn and multi-turn conversations.
  • Triage emerging attack vectors and route them to the safety team with severity ratings.

Skills

Adversarial prompting
Red-team analysis
Policy taxonomy
Failure documentation
Adversarial prompt testing

Job description

AI Trainer Jobs is seeking an LLM Red Team Specialist — Failure Modes & Edge Cases for a remote contractor role focused on stress-testing AI systems against adversarial prompts. Reviewers craft attack scenarios and pair each jailbreak with the rubric clause it violated to help patch gaps.

You will design adversarial prompts, document reproducible steps, score defenses, and triage emerging vectors for safety teams. This position requires about 10 hours per week and US eligibility.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote AI Red Team Specialist — Adversarial ML & Safety Testing
Remote AI Red Team Specialist — Adversarial ML & Safety Testing

AI Trainer Jobs • United States

Remote
USD 83,000 - 165,000
Remote work
Contractor engagement
LLM Red Team Specialist — Failure Modes & Edge Cases
LLM Red Team Specialist — Failure Modes & Edge Cases

AI Trainer Jobs • United States

Remote
USD 83,000 - 124,000
Remote AI Adversarial Red Teamer: Jailbreak & Prompt Injection
Remote AI Adversarial Red Teamer: Jailbreak & Prompt Injection

AI Trainer Jobs • United States

Remote
USD 96,000 - 138,000
Remote AI Red Team Specialist: Adversarial Prompt Testing
Remote AI Red Team Specialist: Adversarial Prompt Testing

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Safety Red-Team Risk Evaluator
Remote AI Safety Red-Team Risk Evaluator

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Malware Adversarial Red-Team Specialist
Remote AI Malware Adversarial Red-Team Specialist

AI Trainer Jobs • United States

Remote
USD 83,000 - 152,000
AI Safety Red-Team Engineer (Remote)
AI Safety Red-Team Engineer (Remote)

AI Trainer Jobs • United States

Remote
USD 83,000 - 131,000
Remote AI Safety Red Team Specialist (Adversarial Testing)
Remote AI Safety Red Team Specialist (Adversarial Testing)

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote AI Safety Red Team Specialist - Policy Compliance
Remote AI Safety Red Team Specialist - Policy Compliance

AI Trainer Jobs • United States

Remote
USD 90,000 - 96,000
Remote Adversarial AI Security Engineer (AppSec)
Remote Adversarial AI Security Engineer (AppSec)

AI Trainer Jobs • United States

Remote
USD 96,000 - 138,000