LLM Power User & Real-World AI Evaluator

Obsidian

San Francisco (CA)

Remote

USD 34,000 - 83,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Obsidian, a leading AI research organization, is seeking advanced LLM power users to evaluate how well AI systems handle personalized, real-world life tasks. You will judge usefulness, personalization, and realism of AI responses across daily activities.

Ideal candidates use AI tools heavily in personal life and can explain why outputs are good, bad, or unsafe. This role emphasizes practical judgment, attention to detail, and clear written feedback to improve AI assistants.

Qualifications

  • Heavily uses LLM products in daily life.
  • Experience using AI for multi-step tasks, planning, research, or personal workflows.
  • Familiarity with AI agents such as ChatGPT, Claude, Gemini, Perplexity, Cursor, Windsurf, Codex.

Responsibilities

  • Evaluate AI outputs on real-world life tasks.
  • Assess usefulness, personalization, realism, and success of AI responses.
  • Document criteria and provide clear feedback to improve AI systems.
  • Focus on tasks across food, health, productivity, careers, and learning.

Skills

Heavy personal LLM usage
Multi-step task experience
Critical evaluation
Strong written judgment

Tools

ChatGPT
Claude
Gemini
Perplexity
Cursor
Windsurf
Codex

Job description

Obsidian, a leading AI research organization, is seeking advanced LLM power users to evaluate how well AI systems handle personalized, real-world life tasks. You will judge usefulness, personalization, and realism of AI responses across daily activities.

Ideal candidates use AI tools heavily in personal life and can explain why outputs are good, bad, or unsafe. This role emphasizes practical judgment, attention to detail, and clear written feedback to improve AI assistants.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

LLM Power User: Real-World Task Evaluator
LLM Power User: Real-World Task Evaluator

Obsidian • San Francisco (CA)

On-site
USD 55,000 - 96,000
LLM Power User - AI Trainer
LLM Power User - AI Trainer

Obsidian • San Francisco (CA)

On-site
USD 55,000 - 96,000
AI Personal Assistant Evaluator
AI Personal Assistant Evaluator

Mercor • San Francisco (CA)

On-site
USD 50,000 - 90,000
AI Personal Assistant Evaluator
AI Personal Assistant Evaluator

Obsidian • San Francisco (CA)

On-site
USD 34,000 - 83,000
LLM Power User - Fully Remote | Upto $200/hr
LLM Power User - Fully Remote | Upto $200/hr

Obsidian • San Francisco (CA)

Remote
USD 34,000 - 83,000
AI Personal Assistant Quality Evaluator
AI Personal Assistant Quality Evaluator

Obsidian • San Francisco (CA)

On-site
USD 34,000 - 83,000
AI Personal Assistant Evaluator - Real-World Task Specialist
AI Personal Assistant Evaluator - Real-World Task Specialist

Mercor • San Francisco (CA)

On-site
USD 50,000 - 90,000
AI Workflow Evaluator & Personal Task Trainer
AI Workflow Evaluator & Personal Task Trainer

Obsidian • New York (NY)

On-site
USD 60,000 - 90,000
AI Personal Workflow Evaluator
AI Personal Workflow Evaluator

Obsidian • New York (NY)

Remote
USD 34,000 - 55,000
LLM Power User & MCP Specialist: Plugin-Driven Tasks
LLM Power User & MCP Specialist: Plugin-Driven Tasks

Mercor • New York (NY)

On-site
USD 60,000 - 90,000