Mechanistic Interpretability Researcher for AI Safety

OpenAI

Los Angeles (CA)

On-site

USD 120,000 - 150,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

A leading AI research company in California is seeking a passionate Researcher in Mechanistic Interpretability. You will develop techniques for understanding deep learning models. The role requires a Ph.D. or equivalent experience in related fields and 2+ years in research engineering. Collaborating in a curiosity-driven team, you will impact AI safety's trajectory as models grow in capability. This position embraces the core values of safety and human benefit in AI deployment, contributing to building a better future.

Qualifications

  • 2+ years of research engineering experience.
  • Experience in AI safety or mechanistic interpretability.
  • Enthusiasm for long-term AI safety and its technical paths.

Responsibilities

  • Develop and publish research on techniques for understanding representations of deep networks.
  • Engineer infrastructure for studying model internals at scale.
  • Collaborate on projects that OpenAI is uniquely suited to pursue.
  • Guide research directions toward demonstrable usefulness.

Skills

Python or similar languages
Quantitative reasoning
Research engineering experience
Deep learning understanding
AI safety knowledge

Education

Ph.D. in computer science, machine learning, or related field

Job description

A leading AI research company in California is seeking a passionate Researcher in Mechanistic Interpretability. You will develop techniques for understanding deep learning models. The role requires a Ph.D. or equivalent experience in related fields and 2+ years in research engineering. Collaborating in a curiosity-driven team, you will impact AI safety's trajectory as models grow in capability. This position embraces the core values of safety and human benefit in AI deployment, contributing to building a better future.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Research Manager, Interpretability — Lead Safe AI Teams
Research Manager, Interpretability — Lead Safe AI Teams

Anthropic • San Francisco (CA)

On-site
USD 340,000 - 425,000
Competitive compensation
Generous vacation leave
Flexible working hours
Researcher—Alignment & Mechanistic Interpretability
Researcher—Alignment & Mechanistic Interpretability

Triwill Group • San Francisco (CA), Northern (KY)

Hybrid
USD 180,000 - 260,000
Mechanistic AI Interpretability Scientist
Mechanistic AI Interpretability Scientist

Anthropic • San Francisco (CA)

Hybrid
USD 350,000 - 850,000
Mechanistic Interpretability Researcher
Mechanistic Interpretability Researcher

OpenAI • San Francisco (CA)

On-site
USD 180,000 - 240,000
Researcher, Interpretability
Researcher, Interpretability

OpenAI • Los Angeles (CA)

On-site
USD 120,000 - 150,000
Interpretability Research Manager — AI Safety Leadership
Interpretability Research Manager — AI Safety Leadership

Menlo Ventures • San Francisco (CA)

Hybrid
USD 340,000 - 425,000
Competitive salary
Generous vacation and parental leave
Flexible working hours
+1
Interpretability Engineer for AI Safety & Research
Interpretability Engineer for AI Safety & Research

Anthropic • San Francisco (CA)

Hybrid
USD 315,000 - 560,000
Researcher, Alignment Interpretability
Researcher, Alignment Interpretability

OpenAI • San Francisco (CA)

On-site
USD 180,000 - 240,000
Research Engineer, Interpretability
Research Engineer, Interpretability

Anthropic • United States

Hybrid
USD 315,000 - 560,000
Remote work considered case-by-case
Visa sponsorship may be available
Office in San Francisco
Interpretability Engineer, LLM Research & Infra
Interpretability Engineer, LLM Research & Infra

Anthropic • United States

Hybrid
USD 315,000 - 560,000
Remote work considered case-by-case
Visa sponsorship may be available
Office in San Francisco