Multimodal Speech ML Engineer - Real-Time AV AI

Cantina

United States

Remote

USD 200,000 - 220,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Medical, dental, and vision insurance
Equity
Paid time off: 42 days including PTO,
Parental leave & fertility support
401(k) retirement plan
Lifestyle spending account
Office lunch and snacks

Job summary

Cantina Labs is hiring a Research / ML Engineer to join our Speech Team and own the audio side of multimodal generation. You will design, train, and deploy audio VAEs, neural codecs, and diffusion-based backbones, with multi-speaker conditioning and AV synchronization for cinematic dialogue and sound design.

You will collaborate across research, video, data, and infra to ship reliable, cost-aware models; lead experiments, tune data pipelines, and push safe, steerable AI that speaks and emotes in

Qualifications

  • Extensive research/development experience with large-scale audio models and multimodal systems.
  • Hands-on diffusion/flow-matching transformer work and practical audio/VAE/codec knowledge.
  • Experience with multi-node distributed training and production-grade code.

Responsibilities

  • Design, train, and improve audio VAEs, neural codecs, and vocoders for large-scale AV models.
  • Architect and fine-tune diffusion/flow-matching transformers for audio/video generation.
  • Develop audio conditioning and cross-modal alignment in joint AV models.
  • Run experiments, analyze results, and drive data-driven improvements.
  • Own data requirements, curation, AV-sync, and quality filtering for paired corpora.
  • Evaluate audio fidelity, intelligibility, AV-sync, and robustness; address safety concerns.

Skills

Audio modeling
Multimodal analysis
Diffusion models
PyTorch
Distributed training
Voice cloning
Video generation
Experimentation
Data collaboration

Tools

CUDA
DeepSpeed
TensorRT

Job description

Cantina Labs is hiring a Research / ML Engineer to join our Speech Team and own the audio side of multimodal generation. You will design, train, and deploy audio VAEs, neural codecs, and diffusion-based backbones, with multi-speaker conditioning and AV synchronization for cinematic dialogue and sound design.

You will collaborate across research, video, data, and infra to ship reliable, cost-aware models; lead experiments, tune data pipelines, and push safe, steerable AI that speaks and emotes in

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Speech ML Engineer — End-to-End Voice Systems
Senior Speech ML Engineer — End-to-End Voice Systems

Cantina • United States

Remote
USD 200,000 - 220,000
Equity
Healthcare
PTO 42 days
+5
Lead Audio AI Research for Multimodal Systems
Lead Audio AI Research for Multimodal Systems

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 350,000 - 475,000
Health, dental, and vision benefits
Unlimited PTO
Paid parental leave
+1
Senior Multimodal AI Researcher (Audio) - Flexible Work
Senior Multimodal AI Researcher (Audio) - Flexible Work

Dolby • Atlanta (GA)

On-site
USD 141,000 - 170,000
Flex Work
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000
Multimodal ML Researcher — Frontiers in AI
Multimodal ML Researcher — Frontiers in AI

Apple Inc. • Cambridge (MA)

On-site
USD 166,000 - 250,000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 110,000 - 150,000
Senior Real-Time Multimodal AI Scientist
Senior Real-Time Multimodal AI Scientist

Amazon Science • Sunnyvale (CA)

On-site
USD 192,000 - 260,000
Audio & Speech Research Engineer – Real-Time Voice AI
Audio & Speech Research Engineer – Real-Time Voice AI

Decagon • New York (NY)

On-site
USD 200,000 - 400,000
Medical, Dental, Vision
Life Insurance
Retirement Plan
+3
Lead Real-Time Multimodal AI Scientist, Conversational/AGI
Lead Real-Time Multimodal AI Scientist, Conversational/AGI

Amazon • Bellevue (WA)

On-site
USD 180,000 - 260,000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Boston (MA)

On-site
USD 130,000 - 160,000