AI Model Evaluation Data Engineer

Obsidian

San Francisco (CA)

On-site

USD 207,000 - 551,000

Part time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Obsidian is partnering with an AI research initiative to support a Frontier Code Agents project in San Francisco. You will evaluate frontier AI coding models by performing realistic data engineering tasks, reviewing ETL pipelines, data warehouses, and distributed systems.

Join a sprint-based program where each accepted task is compensated, with rapid ramp-up and tight feedback cycles. Candidates should have 2+ years in data engineering and comfort using AI coding agents to assess infrastructure.

Qualifications

  • 2+ years of professional data engineering experience.
  • Experience building ETL pipelines, data warehouses, analytics platforms, or distributed data systems.
  • Regular use of AI coding agents such as Cursor, Claude Code, Codex, Windsurf, Gemini CLI, or similar tools.
  • Ability to evaluate model-generated data infrastructure and pipeline implementations.
  • Experience operating large-scale data platforms is preferred.

Responsibilities

  • Use frontier AI coding agents to complete and evaluate complex data engineering tasks.
  • Review model-generated implementations involving ETL pipelines, data warehouses, analytics platforms, and distributed data systems.
  • Identify bugs, edge cases, scalability issues, and failure modes.
  • Compare outputs from multiple frontier models and assess their strengths and weaknesses.
  • Apply professional engineering judgment to realistic data engineering scenarios.

Skills

Data engineering
ETL pipelines
Data warehouses
Analytics platforms
Distributed data systems
AI coding agents usage

Tools

Cursor
Claude Code
Codex
Windsurf
Gemini CLI

Job description

Obsidian is partnering with an AI research initiative to support a Frontier Code Agents project in San Francisco. You will evaluate frontier AI coding models by performing realistic data engineering tasks, reviewing ETL pipelines, data warehouses, and distributed systems.

Join a sprint-based program where each accepted task is compensated, with rapid ramp-up and tight feedback cycles. Candidates should have 2+ years in data engineering and comfort using AI coding agents to assess infrastructure.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

AI-Driven Data Engineer - Frontier Pipeline Evaluator
AI-Driven Data Engineer - Frontier Pipeline Evaluator

Obsidian • New York (NY)

Remote
USD 193,000 - 248,000
AI Data Engineer for Frontier Code Agents
AI Data Engineer for Frontier Code Agents

Obsidian • Philadelphia

On-site
Frontier AI Data Engineer — Model Evaluation & ETL
Frontier AI Data Engineer — Model Evaluation & ETL

Mercor • San Francisco (CA)

On-site
USD 207,000 - 234,000
Data Engineer - AI Model Evaluation
Data Engineer - AI Model Evaluation

Mercor • San Francisco (CA)

On-site
USD 207,000 - 234,000
Data Engineer - AI Model Evaluation
Data Engineer - AI Model Evaluation

Obsidian • San Francisco (CA)

On-site
USD 207,000 - 551,000
Frontier AI Data Engineer: ETL & Model Evaluation
Frontier AI Data Engineer: ETL & Model Evaluation

Mercor • Philadelphia

On-site
USD 179,000 - 276,000
Data Engineer - AI Model Evaluator - AI Trainer
Data Engineer - AI Model Evaluator - AI Trainer

Mercor • Philadelphia

On-site
USD 179,000 - 276,000
Frontier ML Engineer: AI Coding Agent Evaluator
Frontier ML Engineer: AI Coding Agent Evaluator

Obsidian • New York (NY)

Hybrid
AI Code-Agent Evaluator: Frontier DevOps Engineer
AI Code-Agent Evaluator: Frontier DevOps Engineer

Obsidian • New York (NY)

On-site
USD 455,000 - 647,000
Backend Engineer: AI Coding Agent Evaluator
Backend Engineer: AI Coding Agent Evaluator

Obsidian • New York (NY)

On-site