Data Infra Engineer for Scalable AI Pipelines Unlimited PTO

AI Chopping Block, Inc.

San Francisco (CA)

On-site

USD 300,000 - 400,000

Full time

3 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Thinking Machines in San Francisco, CA, is hiring an engineer to architect and scale core data infrastructure for distributed training and multimodal data catalogs. You’ll work with researchers to accelerate experiments and build from the ground up using Spark, Kafka, Beam, Ray, and Delta Lake.

Responsibilities include data ingestion, quality checks, deduplication, and search, plus end-to-end lifecycle traceability and robust monitoring to improve platform reliability.

Qualifications

  • Bachelor's degree or equivalent in CS/engineering or related field.
  • Proficiency in Python or Rust and at least one backend framework.
  • Experience with distributed compute frameworks such as Spark or Ray.
  • Strong understanding of cloud data lake architectures and pipelines.
  • Ability to own projects end-to-end with cross-functional partners.

Responsibilities

  • Design, build, and operate scalable infrastructure for LLM research.
  • Develop high-throughput data ingestion, processing, and transformation pipelines.
  • Create traceability and quality controls across the data lifecycle.
  • Implement monitoring and alerting to ensure reliability and performance.
  • Collaborate with researchers to speed up experiments and feature development.

Skills

Python
Rust
Apache Spark
Ray
Cloud infrastructure
Data lake architectures
Batch and streaming pipelines
End-to-end ownership
Cross-functional collaboration
initiative to ship

Education

Bachelor's degree in Computer Science or related field

Tools

Kafka
dbt
Terraform
Airflow

Job description

Thinking Machines in San Francisco, CA, is hiring an engineer to architect and scale core data infrastructure for distributed training and multimodal data catalogs. You’ll work with researchers to accelerate experiments and build from the ground up using Spark, Kafka, Beam, Ray, and Delta Lake.

Responsibilities include data ingestion, quality checks, deduplication, and search, plus end-to-end lifecycle traceability and robust monitoring to improve platform reliability.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Data Infrastructure Engineer for Large-Scale AI Pipelines
Data Infrastructure Engineer for Large-Scale AI Pipelines

Thinking Machines Lab Inc. • San Francisco (CA)

On-site
USD 300,000 - 400,000
Health benefits
Dental & Vision benefits
Unlimited PTO
+2
Data Foundations Engineer – Scalable Pipelines & Open AI
Data Foundations Engineer – Scalable Pipelines & Open AI

Reflection • San Francisco (CA)

On-site
USD 150,000 - 210,000
Top-tier compensation
Stock options
Health & wellness
+3
Software Engineer, Data Infrastructure
Software Engineer, Data Infrastructure

Thinking Machines Lab Inc. • San Francisco (CA)

On-site
USD 300,000 - 400,000
Health benefits
Dental & Vision benefits
Unlimited PTO
+2
Software Engineer, Data Infrastructure
Software Engineer, Data Infrastructure

AI Chopping Block, Inc. • San Francisco (CA)

On-site
USD 300,000 - 400,000
Data Engineer — Build Scalable Pipelines (Hybrid)
Data Engineer — Build Scalable Pipelines (Hybrid)

Talentify • San Francisco (CA)

Hybrid
USD 140,000 - 190,000
Staff Data Platform Engineer - Scalable Pipelines
Staff Data Platform Engineer - Scalable Pipelines

reflectionai • New York (NY)

On-site
USD 180,000 - 240,000
Top-tier compensation
Stock options
Health & wellness
+5
Staff Data Infrastructure Engineer: Scale AI Pipelines
Staff Data Infrastructure Engineer: Scale AI Pipelines

Inception • San Francisco (CA)

On-site
USD 140,000 - 190,000
Data Engineering Lead: Scalable ML Data Pipelines
Data Engineering Lead: Scalable ML Data Pipelines

Hark • San Jose (CA)

On-site
USD 170,000 - 450,000
Senior Data Engineer: Build Scalable Data Pipelines
Senior Data Engineer: Build Scalable Data Pipelines

Pattern AI • Hayward Park (CA)

On-site
USD 100,000 - 130,000
Senior Data Engineer — Scalable ML & Data Pipelines
Senior Data Engineer — Scalable ML & Data Pipelines

ZipRecruiter, Inc. • Northern (KY)

Hybrid
USD 130,000 - 175,000
Competitive compensation
Exceptional benefits package
Flexible Vacation & Paid Time Off
+1