Lead Data Engineer for Multimodal ML Pipelines

pika

United States

Hybrid

USD 180,000 - 240,000

Full time

14 days+
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Benefits offered by this job

Competitive salary & equity
Full health benefits
Hybrid on-site/remote (HQ Palo Alto)

Job summary

Pika is seeking a staff or lead-level Research Engineer, Data to architect and scale data pipelines for multimodal foundation models. You will own data ingestion, labeling, quality, and privacy, enabling high-quality training datasets across text, image, audio, and video.

Join a collaborative, fast-growing startup with HQ in Palo Alto, offering full benefits and equity, hybrid work, and opportunities to influence cutting-edge generative AI research.

Qualifications

  • 5+ years building and scaling data pipelines for ML in staff/lead roles.
  • Experience with LLMs, VLMs, or multimodal model data curation.
  • Proficient in distributed data systems (Spark, Hadoop, Ray).
  • Proven ability to deploy production-grade ML data infrastructure.
  • Strong Python/SQL and cloud platform skills (AWS, GCP, Azure).
  • Knowledge of data privacy, ethics, and governance.

Responsibilities

  • Own large-scale data pipeline architecture to support model training.
  • Curate and manage diverse multimodal datasets.
  • Develop scalable data ingestion, labeling, filtering, augmentation, storage.
  • Ensure data quality, privacy, and compliance.
  • Optimize data processing for distributed training pipelines.
  • Prototype data management tools aligned with researcher needs.
  • Integrate data innovations into production-ready systems.
  • Stay updated on ML data management best practices.

Skills

Data pipelines
ML data curation
Distributed data systems
Python
SQL
Cross-functional collaboration
Problem solving

Tools

Spark
Hadoop
Ray
PySpark
AWS
GCP
Azure

Job description

Pika is seeking a staff or lead-level Research Engineer, Data to architect and scale data pipelines for multimodal foundation models. You will own data ingestion, labeling, quality, and privacy, enabling high-quality training datasets across text, image, audio, and video.

Join a collaborative, fast-growing startup with HQ in Palo Alto, offering full benefits and equity, hybrid work, and opportunities to influence cutting-edge generative AI research.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Lead Data Architect for Multimodal ML Pipelines — Remote
Lead Data Architect for Multimodal ML Pipelines — Remote

Pika • Palo Alto (CA)

Hybrid
USD 120,000 - 160,000
Competitive salary
Full health benefits
401k matching
+1
Research Scientist, Data
Research Scientist, Data

Pika • Palo Alto (CA)

Hybrid
USD 120,000 - 160,000
Competitive salary
Full health benefits
401k matching
+1
Research Scientist, Data
Research Scientist, Data

pika • United States

Hybrid
USD 180,000 - 240,000
Competitive salary & equity
Full health benefits
Hybrid on-site/remote (HQ Palo Alto)
Data Engineer: AI Platform Pipelines & Impact
Data Engineer: AI Platform Pipelines & Impact

pika • United States

Hybrid
USD 120,000 - 170,000
Competitive salary
Equity
Health benefits
+3
Lead Multimodal Data Engineer for ML Pipelines
Lead Multimodal Data Engineer for ML Pipelines

Hark, Inc. • San Jose (CA)

On-site
USD 170,000 - 450,000
Data Engineer: Scale AI Pipelines for Creative Tools
Data Engineer: Scale AI Pipelines for Creative Tools

Pika Labs Inc. • Palo Alto (CA), Northern (KY)

Hybrid
USD 140,000 - 190,000
Competitive salary
Substantial equity
Comprehensive health benefits
+1
Data Engineer for AI Creative Tools — Equity & Hybrid
Data Engineer for AI Creative Tools — Equity & Hybrid

pika • Palo Alto (CA)

Hybrid
USD 140,000 - 190,000
Equity
Health benefits
Monthly stipends
+1
Data Engineer
Data Engineer

pika • United States

Hybrid
USD 120,000 - 170,000
Competitive salary
Equity
Health benefits
+3
Data Engineer
Data Engineer

Pika Labs Inc. • Palo Alto (CA), Northern (KY)

Hybrid
USD 140,000 - 190,000
Competitive salary
Substantial equity
Comprehensive health benefits
+1
Data Engineer
Data Engineer

pika • Palo Alto (CA)

Hybrid
USD 140,000 - 190,000
Equity
Health benefits
Monthly stipends
+1