Remote Harmful Instruction Risk Evaluator

AuraOne

United States

On-site

USD 82,656 - 165,312

Full time

14 days+
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

AuraOne is seeking a remote Harmful Instruction Refusal Risk Evaluator to stress-test AI systems through adversarial prompts and rigorous documentation. You will craft attack scenarios, record failures with exact steps, and map each breach to the violated policy clause to help patch gaps before release.

The role emphasizes strong written reporting, clear rationale for each attempt, and the ability to work asynchronously for at least 10 hours per week from a US-based remote setup.

Qualifications

  • Demonstrated experience red-teaming AI systems, security research, or adversarial ML work for Harmful Instruction Refusal Risk Evaluator work.
  • Strong written communication so reports become patch tickets.
  • Clear documentation of what was attempted and why.

Responsibilities

  • Design adversarial prompts that probe known weakness classes (jailbreak, policy bypass, prompt injection) for Harmful Instruction Refusal Risk Evaluator assignments.
  • Document every successful attack with reproduction steps and the policy clause it violated.
  • Score model defenses across single-turn and multi-turn conversations.
  • Triage emerging attack vectors and route them to the safety team with severity ratings.
  • Maintain a personal library of attack patterns and propose new red-team rubrics.
  • Calibrate against the broader red-team cohort to keep coverage and severity consistent.

Skills

Adversarial prompting
Red-team analysis
Policy taxonomy
Failure documentation
Harmful Instruction Refusal Risk eval
AI safety
Red-team evaluation
Policy rubrics
Harmful
Instruction
Refusal

Job description

AuraOne is seeking a remote Harmful Instruction Refusal Risk Evaluator to stress-test AI systems through adversarial prompts and rigorous documentation. You will craft attack scenarios, record failures with exact steps, and map each breach to the violated policy clause to help patch gaps before release.

The role emphasizes strong written reporting, clear rationale for each attempt, and the ability to work asynchronously for at least 10 hours per week from a US-based remote setup.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Remote Adversarial AI Risk Evaluator (Red‑Team)
Remote Adversarial AI Risk Evaluator (Red‑Team)

AuraOne • United States

On-site
USD 82,656 - 123,984
Remote Adversarial AI Safety Red‑Team Evaluator
Remote Adversarial AI Safety Red‑Team Evaluator

AuraOne • United States

On-site
USD 55,104 - 110,208
Remote work
Contractor position
Remote AI Safety Evaluator - Adversarial Prompts Jailbreaks
Remote AI Safety Evaluator - Adversarial Prompts Jailbreaks

AuraOne • United States

On-site
USD 52,000 - 58,000
Remote Adversarial AI Security Researcher
Remote Adversarial AI Security Researcher

AuraOne • United States

On-site
USD 120,000 - 180,000
Vulnerability Researcher, AI Adversarial Testing (Remote)
Vulnerability Researcher, AI Adversarial Testing (Remote)

AuraOne • United States

On-site
USD 83,000 - 165,000
Remote Threat Intelligence AI Evaluator & Quality Reviewer
Remote Threat Intelligence AI Evaluator & Quality Reviewer

AuraOne • United States

On-site
USD 34,000 - 55,000
Remote AI Policy Adversarial Red Team Specialist
Remote AI Policy Adversarial Red Team Specialist

AuraOne • United States

On-site
USD 82,656 - 165,312
Remote work
Contractor engagement
Remote AI Adversarial QA Specialist
Remote AI Adversarial QA Specialist

AuraOne • United States

On-site
USD 82,656 - 165,312
Remote Elections Integrity AI Red Team Specialist
Remote Elections Integrity AI Red Team Specialist

AuraOne • United States

On-site
USD 82,656 - 165,312
Remote InfoSec Ops QA & Policy Auditor
Remote InfoSec Ops QA & Policy Auditor

AuraOne • United States

On-site
USD 55,000 - 83,000