Multimodal AI Engineer: Multimedia Pipelines & Evaluation

Meta

Helena (MT)

On-site

USD 154,000 - 217,000

Full time

2 days ago
Be an early applicant
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Meta’s Applied AI organization seeks a seasoned software engineer to advance multimodal data pipelines and evaluation for speech, audio, and music. You will own data production, define metrics, and drive end-to-end pipelines across image, video, and audio modalities.

You will mentor engineers, contribute to hiring, reproduce state-of-the-art methods, and help raise quality and responsible AI practices while scaling systems in production.

Qualifications

  • Bachelor's degree in Computer Science, Computer Engineering, relevant technical field, or equivalent practical experience
  • 6+ years of programming experience in a relevant language or 3+ years of experience + PhD
  • 3+ years building ML systems in production or research settings
  • strong Python and PyTorch
  • Demonstrated experience with speech, audio, or music ML - ASR, TTS, audio codecs, music information retrieval, self-supervised audio representation learning, or audio generative modeling
  • Experience with large-scale data pipelines and distributed training
  • Track record of translating research ideas into working, measurable systems

Responsibilities

  • Design and build agentic workflows and pipelines, including human-in-the-loop and expert-in-the-loop designs, to automate data production and scale output past what manual authoring supports.
  • Design and own data pipelines at scale: ingestion, filtering, pseudo-labeling and captioning with attribute classifiers, and provenance tracking for audio corpora.
  • Build evaluation infrastructure: objective metrics (speaker/style similarity, codec and generator quality), human listening-test pipelines, and the correlation analysis that ties the two together.
  • Improve training efficiency and reliability — distributed training, GPU utilization, codec and tokenizer retraining, experiment management.
  • Reproduce and extend state‑of‑the‑art research: implement new methods from papers into our codebases and run rigorous ablations.
  • Mentor engineers on the team, contribute to hiring and onboarding, and raise the bar on evaluation and quality practice.
  • Build and train generative and representation models for speech, sound, and music — including text-, audio-, and video-conditioned generation, infilling, editing, and style transfer.

Skills

Python
PyTorch
ML systems
Multimodal ML
Distributed training
Data pipelines
Research-to-production

Education

Bachelor's degree in Computer Science/Engineering or equivalent
PhD (optional)

Job description

Meta’s Applied AI organization seeks a seasoned software engineer to advance multimodal data pipelines and evaluation for speech, audio, and music. You will own data production, define metrics, and drive end-to-end pipelines across image, video, and audio modalities.

You will mentor engineers, contribute to hiring, reproduce state-of-the-art methods, and help raise quality and responsible AI practices while scaling systems in production.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Multimodal AI Engineer — Media Pipelines & Evaluation
Multimodal AI Engineer — Media Pipelines & Evaluation

Meta • United States

On-site
USD 154,000 - 217,000
Bonus
Equity
Benefits
Multimodal AI Engineer — Audio, Video & Speech Pipelines
Multimodal AI Engineer — Audio, Video & Speech Pipelines

Meta • Menlo Park (CA)

On-site
USD 154,000 - 217,000
Equity
Bonus
Benefits
Multimodal AI Engineer: Data Pipelines & Evaluation
Multimodal AI Engineer: Data Pipelines & Evaluation

Meta Careers • United States

Remote
USD 154,000 - 217,000
Bonus
Equity
Benefits
Multimodal AI Engineer — Multimedia Pipelines & Eval
Multimodal AI Engineer — Multimedia Pipelines & Eval

Meta • Augusta (ME)

On-site
USD 154,000 - 217,000
Multimodal AI Engineer: Pipelines, Evaluation & Synthesis
Multimodal AI Engineer: Pipelines, Evaluation & Synthesis

Meta • Indianapolis (IN)

On-site
USD 154,000 - 217,000
Multimodal AI Systems Engineer: Data Pipelines & Evaluation
Multimodal AI Systems Engineer: Data Pipelines & Evaluation

Meta • Juneau (AK)

On-site
USD 154,000 - 217,000
Multimodal AI Engineer: Multimedia Pipelines & Evaluation
Multimodal AI Engineer: Multimedia Pipelines & Evaluation

Meta • Boise (ID)

On-site
USD 154,000 - 217,000
Multimodal AI Engineer: Build Media Pipelines
Multimodal AI Engineer: Build Media Pipelines

Meta • Santa Fe (NM)

On-site
USD 154,000 - 217,000
Senior Multimodal AI Engineer - Multimedia Pipelines
Senior Multimodal AI Engineer - Multimedia Pipelines

Meta Careers • New York (NY)

On-site
USD 184,000 - 257,000
Senior Multimodal AI Engineer - End-to-End Media Pipelines
Senior Multimodal AI Engineer - End-to-End Media Pipelines

Meta • Cheyenne (WY)

On-site
USD 154,000 - 217,000