Multimodal AI Engineer: Vision, Audio & Speech Systems

Meta

Montpelier (VT)

Sur place

USD 154 000 - 217 000

Plein temps

Il y a 2 jours
Soyez parmi les premiers à postuler
Générateur de candidature

N’envoyez pas de CV générique — générez un CV et une lettre de motivation adaptés à ce poste précis.

Passez les filtres ATS

Résumé du poste

Meta’s Applied AI (AAI) team seeks a software engineer to advance multimodal AI capabilities across image, video, audio, and speech. You will define data to produce, measurement, and pipelines that run end-to-end, from open questions to production-grade measurements.

You will own data and evaluations that scale, collaborate with research and engineering partners, and mentor engineers while raising the bar on quality and responsible AI practices.

Qualifications

  • Bachelor's degree in Computer Science, Computer Engineering, relevant technical field, or equivalent practical experience
  • 6+ years of programming experience in a relevant language or 3+ years of experience + PhD
  • 3+ years building ML systems in production or research settings
  • strong Python and PyTorch
  • Demonstrated experience with speech, audio, or music ML - ASR, TTS, audio codecs, music information retrieval, self-supervised audio representation learning, or audio generative modeling
  • Experience with large-scale data pipelines and distributed training
  • Track record of translating research ideas into working, measurable systems

Responsabilités

  • Design and build agentic workflows and pipelines, including human-in-the-loop and expert-in-the-loop designs, to automate data production and scale output past what manual authoring supports.
  • Design and own data pipelines at scale: ingestion, filtering, pseudo-labeling and captioning with attribute classifiers, and provenance tracking for audio corpora.
  • Build evaluation infrastructure: objective metrics (speaker/style similarity, codec and generator quality), human listening-test pipelines, and the correlation analysis that ties the two together.
  • Improve training efficiency and reliability — distributed training, GPU utilization, codec and tokenizer retraining, experiment management.
  • Reproduce and extend state‑of‑the‑art research: implement new methods from papers into our codebases and run rigorous ablations.
  • Mentor engineers on the team, contribute to hiring and onboarding, and raise the bar on evaluation and quality practice.
  • Build and train generative and representation models for speech, sound, and music — including text-, audio-, and video-conditioned generation, infilling, editing, and style transfer.

Connaissances

Python
PyTorch
ML systems
speech/audio/music ML
distributed training
data pipelines
research-to-production
mentoring

Formation

Bachelor's degree in Computer Science, Computer Engineering, relevant technical field, or equivalent practical experience

Description du poste

Meta’s Applied AI (AAI) team seeks a software engineer to advance multimodal AI capabilities across image, video, audio, and speech. You will define data to produce, measurement, and pipelines that run end-to-end, from open questions to production-grade measurements.

You will own data and evaluations that scale, collaborate with research and engineering partners, and mentor engineers while raising the bar on quality and responsible AI practices.

Obtenez votre examen gratuit et confidentiel de votre CV.

ou faites glisser et déposez votre fichier ici.

Similar jobs

Postes similaires à comparer

Senior Multimodal AI Engineer: Audio, Video & Speech
Senior Multimodal AI Engineer: Audio, Video & Speech

Meta • Honolulu (HI)

Sur place
USD 154 000 - 217 000
Multimodal AI Engineer — Audio, Video & Speech Pipelines
Multimodal AI Engineer — Audio, Video & Speech Pipelines

Meta • Menlo Park (CA)

Sur place
USD 154 000 - 217 000
Equity
Bonus
Benefits
Multimodal AI Systems Engineer: Data Pipelines & Evaluation
Multimodal AI Systems Engineer: Data Pipelines & Evaluation

Meta • Juneau (AK)

Sur place
USD 154 000 - 217 000
Multimodal AI Engineer: Multimedia Pipelines & Evaluation
Multimodal AI Engineer: Multimedia Pipelines & Evaluation

Meta • Helena (MT)

Sur place
USD 154 000 - 217 000
Multimodal AI Engineer: Data Pipelines & Evaluation
Multimodal AI Engineer: Data Pipelines & Evaluation

Meta Careers • États-Unis

À distance
USD 154 000 - 217 000
Bonus
Equity
Benefits
Multimodal AI Engineer — Multimedia Pipelines & Eval
Multimodal AI Engineer — Multimedia Pipelines & Eval

Meta • Augusta (ME)

Sur place
USD 154 000 - 217 000
Multimodal AI Engineer: Pipelines, Evaluation & Synthesis
Multimodal AI Engineer: Pipelines, Evaluation & Synthesis

Meta • Indianapolis (IN)

Sur place
USD 154 000 - 217 000
Multimodal AI Engineer: Build Media Pipelines
Multimodal AI Engineer: Build Media Pipelines

Meta • Santa Fe (NM)

Sur place
USD 154 000 - 217 000
Multimodal AI Engineer: Multimedia Pipelines & Evaluation
Multimodal AI Engineer: Multimedia Pipelines & Evaluation

Meta • Boise (ID)

Sur place
USD 154 000 - 217 000
Senior Multimodal AI Engineer - Data Pipelines & Evaluation
Senior Multimodal AI Engineer - Data Pipelines & Evaluation

Meta • Carson City (NV)

Sur place
USD 154 000 - 217 000