Multimodal AI Engineer — Multimedia Systems

Meta

Salem (OR)

Presencial

USD 154.000 - 217.000

Jornada completa

hace 21 horas
Sé de los primeros/as/es en solicitar esta vacante
Generador de candidaturas

Convierte este puesto en una entrevista — un currículum y una carta de presentación creados pensando en lo que quiere el empleador.

Supera los filtros ATS

Descripción de la vacante

Meta is seeking a Software Engineer for the Multimedia & Multimodal AI team within Applied AI (AAI) to advance data pipelines and evaluation for multimodal models. You will work across image, video, audio, and speech to design data production, measurement pipelines, and scalable infrastructure.

You will mentor teammates, contribute to hiring, and push quality and responsible AI practices while reproducing state-of-the-art research in practical systems.

Formación

  • 3+ years building ML systems in production or research settings
  • Strong Python and PyTorch
  • Demonstrated experience with speech, audio, or music ML - ASR, TTS, audio codecs, music information retrieval, self-supervised audio representation learning, or audio generative modeling
  • Experience with large-scale data pipelines and distributed training
  • Track record of translating research ideas into working, measurable systems

Responsabilidades

  • Design and build agentic workflows and pipelines, including human-in-the-loop and expert-in-the-loop designs, to automate data production and scale output past what manual authoring supports.
  • Design and own data pipelines at scale: ingestion, filtering, pseudo-labeling and captioning with attribute classifiers, and provenance tracking for audio corpora.
  • Build evaluation infrastructure: objective metrics (speaker/style similarity, codec and generator quality), human listening-test pipelines, and the correlation analysis that ties the two together.
  • Improve training efficiency and reliability — distributed training, GPU utilization, codec and tokenizer retraining, experiment management.
  • Reproduce and extend state-of-the-art research: implement new methods from papers into our codebases and run rigorous ablations.
  • Mentor engineers on the team, contribute to hiring and onboarding, and raise the bar on evaluation and quality practice.
  • Build and train generative and representation models for speech, sound, and music — including text-, audio-, and video-conditioned generation, infilling, editing, and style transfer.

Conocimientos

Collaboration
Mentorship
Problem solving

Herramientas

Python
PyTorch
Distributed training
Data pipelines
Audio processing
Multimodal AI

Descripción del empleo

Meta is seeking a Software Engineer for the Multimedia & Multimodal AI team within Applied AI (AAI) to advance data pipelines and evaluation for multimodal models. You will work across image, video, audio, and speech to design data production, measurement pipelines, and scalable infrastructure.

You will mentor teammates, contribute to hiring, and push quality and responsible AI practices while reproducing state-of-the-art research in practical systems.

Consigue la evaluación confidencial y gratuita de tu currículum.

o arrastra y suelta tu archivo aquí

Similar jobs

Puestos de trabajo similares que vale la pena comparar

Multimodal AI Engineer — Media, Speech & Audio
Multimodal AI Engineer — Media, Speech & Audio

Meta • Little Rock (AR)

Presencial
USD 154.000 - 217.000
Multimodal AI Engineer: Audio, Video & Speech
Multimodal AI Engineer: Audio, Video & Speech

Meta • Denver (CO)

Presencial
USD 154.000 - 217.000
Multimodal AI Engineer: Data Pipelines & Evaluation
Multimodal AI Engineer: Data Pipelines & Evaluation

Meta Careers • EE. UU.

A distancia
USD 154.000 - 217.000
Bonus
Equity
Benefits
Multimodal AI Engineer - Audio, Video & Speech Systems
Multimodal AI Engineer - Audio, Video & Speech Systems

Meta • Dover (DE)

Presencial
USD 154.000 - 217.000
Multimodal AI Engineer — Multimedia Pipelines & Eval
Multimodal AI Engineer — Multimedia Pipelines & Eval

Meta • Augusta (ME)

Presencial
USD 154.000 - 217.000
Multimodal AI Engineer - Audio, Video & Data Pipelines
Multimodal AI Engineer - Audio, Video & Data Pipelines

Meta • Lincoln (NE)

Presencial
USD 154.000 - 217.000
Multimodal AI Engineer: Multimedia Pipelines & Evaluation
Multimodal AI Engineer: Multimedia Pipelines & Evaluation

Meta • Helena (MT)

Presencial
USD 154.000 - 217.000
Multimodal AI Engineer — Media Pipelines & Evaluation
Multimodal AI Engineer — Media Pipelines & Evaluation

Meta • EE. UU.

Presencial
USD 154.000 - 217.000
Bonus
Equity
Benefits
Multimodal AI Engineer: Audio/Video Pipelines
Multimodal AI Engineer: Audio/Video Pipelines

Meta • Topeka (KS)

Presencial
USD 154.000 - 217.000
Multimodal AI Engineer — Audio, Video & Speech Pipelines
Multimodal AI Engineer — Audio, Video & Speech Pipelines

Meta • Menlo Park (CA)

Presencial
USD 154.000 - 217.000
Equity
Bonus
Benefits