AI Safety Red Team Specialist (Remote)

Mercor

Greater London

On-site

GBP 60,000 - 90,000

Full time

14 days+
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Mercor is building a red team for AI safety. This role focuses on adversarial testing of conversational AI models, including jailbreaks, prompt injections, and bias exploration.

You will generate high-quality human data, annotate failures, and document reproducible attack cases for customers. Ideal candidates have prior red-teaming experience in AI or cybersecurity, are curious, structured, and able to communicate risks clearly to technical and non-technical stakeholders.

Qualifications

  • Prior red teaming experience (AI adversarial work, cybersecurity, socio-technical probing).
  • Curious and adversarial: you push systems to breaking points.
  • Structured: you use frameworks or benchmarks, not just random hacks.
  • Communicative: you explain risks clearly to technical and non-technical stakeholders.
  • Adaptable: thrive on moving across projects and customers.

Responsibilities

  • Red team conversational AI models and agents: jailbreaks, prompt injections, misuse cases, bias exploitation, multi-turn manipulation
  • Generate high-quality human data: annotate failures, classify vulnerabilities, and flag systemic risks
  • Apply structure: follow taxonomies, benchmarks, and playbooks to keep testing consistent
  • Document reproducibly: produce reports, datasets, and attack cases customers can act on

Skills

Red team experience
Adversarial mindset
Structured thinking
Communication
Adaptability

Job description

Mercor is building a red team for AI safety. This role focuses on adversarial testing of conversational AI models, including jailbreaks, prompt injections, and bias exploration.

You will generate high-quality human data, annotate failures, and document reproducible attack cases for customers. Ideal candidates have prior red-teaming experience in AI or cybersecurity, are curious, structured, and able to communicate risks clearly to technical and non-technical stakeholders.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Remote AI Red Team Specialist - Safety Adversarial Testing
Remote AI Red Team Specialist - Safety Adversarial Testing

Mercor • Greater London

On-site
GBP 60,000 - 90,000
Remote AI Safety Red Team Specialist
Remote AI Safety Red Team Specialist

Obsidian • Greater London

Remote
GBP 60,000 - 90,000
Remote AI Safety Red Team Specialist
Remote AI Safety Red Team Specialist

Obsidian • Greater London

Remote
GBP 70,000 - 90,000
Remote AI Adversarial Specialist — Red Team & Safety
Remote AI Adversarial Specialist — Red Team & Safety

Mercor • Greater London

Remote
GBP 80,000 - 110,000
Remote AI Safety Red Team Specialist (EN/FI)
Remote AI Safety Red Team Specialist (EN/FI)

Mercor • Greater London

Remote
GBP 70,000 - 90,000
Remote AI Safety Red Team Specialist
Remote AI Safety Red Team Specialist

Mercor • Greater London

On-site
GBP 70,000 - 110,000
Remote AI Safety Red Team Specialist
Remote AI Safety Red Team Specialist

Obsidian • Greater London

Remote
GBP 60,000 - 120,000
Remote AI Safety Red Team Specialist (English & Finnish)
Remote AI Safety Red Team Specialist (English & Finnish)

Mercor • Greater London

Remote
GBP 70,000 - 90,000
Remote AI Red Team Specialist - Adversarial Testing
Remote AI Red Team Specialist - Adversarial Testing

Mercor • Greater London

Remote
GBP 70,000 - 100,000
Remote Bilingual AI Safety Red Teamer
Remote Bilingual AI Safety Red Teamer

Mercor • Greater London

On-site
GBP 70,000 - 110,000