Data Engineer — Training Data

Best AI Tools Wiki

San Francisco, Northern (CA, KY)

Hybrid

USD 150,000 - 210,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Benefits offered by this job

Unlimited PTO
Free meals
401(k) match

Job summary

OpenAI is hiring a Data Engineer to build and maintain the data pipelines that power our model training. You will develop systems for data collection, cleaning, deduplication, and quality assessment at massive scale.

Requirements include 5+ years of data engineering experience, strong Python and SQL skills, and experience with distributed data processing and frameworks like Spark or Beam. Nice to have training data experience for language models and web crawling knowledge.

Qualifications

  • 5+ years of data engineering experience.
  • Strong skills in Python, SQL, and distributed data processing.
  • Experience with Apache Spark, Beam, or similar frameworks.
  • Knowledge of data quality and governance.
  • Experience with petabyte-scale data systems.

Responsibilities

  • Build and maintain data pipelines powering model training.
  • Develop systems for data collection, cleaning, deduplication, and quality assessment at massive scale.

Skills

Python
SQL
Distributed data processing
Apache Spark / Beam
Data quality and governance
Petabyte-scale data systems

Job description

OpenAI is hiring a Data Engineer to build and maintain the data pipelines that power our model training. You will develop systems for data collection, cleaning, deduplication, and quality assessment at massive scale.

Requirements
  • 5+ years of data engineering experience
  • Strong skills in Python, SQL, and distributed data processing
  • Experience with Apache Spark, Beam, or similar frameworks
  • Knowledge of data quality and governance
  • Experience with petabyte-scale data systems
Nice to Have
  • Experience with training data for language models
  • Background in web crawling and text extraction
  • Familiarity with data deduplication techniques
  • Experience with data labeling and annotation platforms

Unlimited PTO

Free meals

401(k) match

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Data Engineer: Training Data Pipelines + 401(k) Match
Senior Data Engineer: Training Data Pipelines + 401(k) Match

Best AI Tools Wiki • San Francisco (CA), Northern (KY)

Hybrid
USD 150,000 - 210,000
Unlimited PTO
Free meals
401(k) match
Data Engineer
Data Engineer

OpenAI • Los Angeles (CA)

On-site
USD 120,000 - 160,000
Data Engineer
Data Engineer

OpenAI • San Francisco (CA)

On-site
USD 235,000 - 385,000
Relocation assistance
Data Engineer
Data Engineer

OpenAI • Mountain View (CA)

On-site
USD 150,000 - 190,000
Relocation assistance
Data Engineer: Scalable AI Pipelines & Safety
Data Engineer: Scalable AI Pipelines & Safety

OpenAI • Mountain View (CA)

On-site
USD 150,000 - 190,000
Relocation assistance
Member of Technical Staff, Data Infrastructure
Member of Technical Staff, Data Infrastructure

Inception • San Francisco (CA)

On-site
USD 140,000 - 190,000
Data Engineer: Pipelines & Analytics Lead
Data Engineer: Pipelines & Analytics Lead

OpenAI • San Francisco (CA)

On-site
USD 235,000 - 385,000
Relocation assistance
Member of Technical Staff, Data
Member of Technical Staff, Data

Inception • San Francisco (CA)

On-site
USD 180,000 - 240,000
Data Engineer
Data Engineer

Apera • Sunnyvale (CA)

On-site
USD 170,000 - 260,000
Data Engineer, People Innovation Labs
Data Engineer, People Innovation Labs

Visa Hunt • San Francisco (CA), Northern (KY)

Hybrid
USD 145,000 - 210,000