Multimodal AI Engineer — Audio, Video & Speech Pipelines

Meta

Menlo Park (CA)

On-site

USD 154,000 - 217,000

Full time

14 hours ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Equity
Bonus
Benefits

Job summary

Meta’s Applied AI organization seeks a Software Engineer for Multimedia & Multimodal AI to own data production pipelines across image, video, audio, and speech modalities. You will shape what data is produced, how it’s measured, and ensure scalable, high-quality evaluation that informs model development.

You will build end-to-end data workflows, reproduce state-of-the-art research, and mentor engineers while advancing generative and representation models for speech, sound, and music.

Qualifications

  • 3+ years building ML systems in production or research.
  • Strong Python and PyTorch skills.
  • Experience with speech, audio, or music ML (ASR, TTS, codecs, MIR, self-supervised audio, or audio generative modeling).
  • Experience with large-scale data pipelines and distributed training.
  • Track record of turning research ideas into working, measurable systems.

Responsibilities

  • Design and build agentic workflows and pipelines to automate data production and scale output beyond manual authoring.
  • Design and own data pipelines: ingestion, filtering, pseudo-labeling and captioning with attribute classifiers, and provenance tracking for audio corpora.
  • Build evaluation infrastructure: objective metrics, human listening-test pipelines, and correlation analysis that ties metrics together.
  • Improve training efficiency and reliability: distributed training, GPU utilization, codec and tokenizer retraining, experiment management.
  • Reproduce and extend state-of-the-art research: implement new methods from papers into our codebases and run rigorous ablations.
  • Mentor engineers on the team, contribute to hiring and onboarding, and raise the bar on evaluation and quality practice.
  • Build and train generative and representation models for speech, sound, and music — including text-, audio-, and video-conditioned generation, infilling, editing, and style transfer.

Skills

Python
PyTorch
ML systems
Data pipelines
Speech/Audio/Music ML
Research-to-production

Job description

Meta’s Applied AI organization seeks a Software Engineer for Multimedia & Multimodal AI to own data production pipelines across image, video, audio, and speech modalities. You will shape what data is produced, how it’s measured, and ensure scalable, high-quality evaluation that informs model development.

You will build end-to-end data workflows, reproduce state-of-the-art research, and mentor engineers while advancing generative and representation models for speech, sound, and music.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Multimodal AI Engineer: Multimedia Pipelines & Evaluation
Multimodal AI Engineer: Multimedia Pipelines & Evaluation

Meta • Helena (MT)

On-site
USD 154,000 - 217,000
Multimodal AI Engineer — Media Pipelines & Evaluation
Multimodal AI Engineer — Media Pipelines & Evaluation

Meta • United States

On-site
USD 154,000 - 217,000
Bonus
Equity
Benefits
Multimodal AI Engineer: Data Pipelines & Evaluation
Multimodal AI Engineer: Data Pipelines & Evaluation

Meta Careers • United States

Remote
USD 154,000 - 217,000
Bonus
Equity
Benefits
Multimodal AI Engineer — Multimedia Pipelines & Eval
Multimodal AI Engineer — Multimedia Pipelines & Eval

Meta • Augusta (ME)

On-site
USD 154,000 - 217,000
Multimodal AI Engineer: Pipelines, Evaluation & Synthesis
Multimodal AI Engineer: Pipelines, Evaluation & Synthesis

Meta • Indianapolis (IN)

On-site
USD 154,000 - 217,000
Multimodal AI Engineer: Vision, Audio & Speech Systems
Multimodal AI Engineer: Vision, Audio & Speech Systems

Meta • Montpelier (VT)

On-site
USD 154,000 - 217,000
Senior Multimodal AI Engineer: Audio, Video & Speech
Senior Multimodal AI Engineer: Audio, Video & Speech

Meta • Honolulu (HI)

On-site
USD 154,000 - 217,000
Multimodal AI Systems Engineer: Data Pipelines & Evaluation
Multimodal AI Systems Engineer: Data Pipelines & Evaluation

Meta • Juneau (AK)

On-site
USD 154,000 - 217,000
Senior Multimodal AI Engineer - Multimedia Pipelines
Senior Multimodal AI Engineer - Multimedia Pipelines

Meta Careers • New York (NY)

On-site
USD 184,000 - 257,000
Senior Multimodal AI Engineer - End-to-End Media Pipelines
Senior Multimodal AI Engineer - End-to-End Media Pipelines

Meta • Cheyenne (WY)

On-site
USD 154,000 - 217,000