Research Scientist, Multimodal Video AI

Cantina

California (MO)

On-site

USD 200,000 - 320,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Competitive salary
Equity
Medical / Dental / Vision
Paid time off
Parental leave
401(k)
Lifestyle stipend
In-office meals
One Medical

Job summary

Cantina Labs is building a core team to advance native video and omni foundation models for multimodal generation and understanding. The role covers pre-training, continued training, and post-training for high-quality, controllable generation.

You will influence architecture, data, training, evaluation, and efficient inference, shaping technical direction early on. You will collaborate with researchers, engineers, and product teams, with opportunities to publish research and contribute to

Qualifications

  • Strong research and engineering experience in generative modeling, including diffusion models, video generation, and multimodal models.
  • Hands-on experience training and evaluating large-scale image, video, or unified multimodal models using modern deep learning frameworks and distributed training systems.
  • A track record of developing impactful models or systems, demonstrated through publications, open-source contributions, or production impact.
  • Ability to independently own ambiguous research problems and move from ideas to experiments in a highly collaborative environment.
  • Specialized depth in foundation model lifecycle areas such as architecture, data curation, controllable generation, or post-training.

Responsibilities

  • Research, develop, and scale native video and multimodal foundation models from prototypes to large-scale pre-training, continued training, and post-training.
  • Explore new architectures, training objectives, and conditioning mechanisms for video generation and multimodal interaction.
  • Build and improve data curation, distributed training, evaluation, and post-training pipelines for high-quality generation.
  • Design systematic experiments to understand model scaling, generation quality, controllability, and inference efficiency.
  • Collaborate with researchers, engineers, and product teams to shape roadmaps and translate advances into capabilities.
  • Contribute to research publications and open-source releases when appropriate.

Job description

Cantina Labs is building a core team to advance native video and omni foundation models for multimodal generation and understanding. The role covers pre-training, continued training, and post-training for high-quality, controllable generation.

You will influence architecture, data, training, evaluation, and efficient inference, shaping technical direction early on. You will collaborate with researchers, engineers, and product teams, with opportunities to publish research and contribute to

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Research Scientist, Video Foundation Models
Research Scientist, Video Foundation Models

Cantina Labs • California (MO)

On-site
USD 200,000 - 320,000
Competitive salary and equity
Medical, dental, and vision insurance
42 days of PTO and holidays
+4
Research Scientist, Video Foundation Models
Research Scientist, Video Foundation Models

Cantina • California (MO)

On-site
USD 200,000 - 320,000
Competitive salary
Equity
Medical / Dental / Vision
+6
Multimodal AI Research Scientist for Video Editing
Multimodal AI Research Scientist for Video Editing

Descript • San Francisco (CA)

Hybrid
USD 197,000 - 263,000
Equity
AI Research Scientist, Multimodal: Video & Audio Generation
AI Research Scientist, Multimodal: Video & Audio Generation

Meta • Menlo Park (CA)

On-site
USD 180,000 - 280,000
Multimodal AI Researcher - Image/Video Gen & Editing
Multimodal AI Researcher - Image/Video Gen & Editing

Apple Inc. • Santa Clara (CA)

On-site
USD 181,000 - 319,000
Comprehensive medical and dental coverage
Retirement benefits
Employee stock purchase plan
+1
Research Scientist, Multi-Modal Human Understanding
Research Scientist, Multi-Modal Human Understanding

Meta • Pittsburgh, Burlingame (CA)

On-site
USD 150,000 - 190,000
AI Research Scientist, Multimodal - Monetization GenAI
AI Research Scientist, Multimodal - Monetization GenAI

Meta • Menlo Park (CA)

On-site
USD 180,000 - 280,000
Multimodal Image/Video Generation Researcher
Multimodal Image/Video Generation Researcher

Apple Inc. • Seattle (WA)

On-site
USD 184,700 - 324,800
Medical & Dental
Retirement benefits
Employee stock plan
+1
Multi-Modal AI Research Scientist – Human Understanding
Multi-Modal AI Research Scientist – Human Understanding

Meta • Pittsburgh, Burlingame (CA)

On-site
USD 150,000 - 190,000
GenAI Research Scientist - Multimodal Video & AI
GenAI Research Scientist - Multimodal Video & AI

TikTok • San Jose (CA)

On-site
USD 162,000 - 317,000
Medical, dental, and vision insurance
401(k) with company match
Paid parental leave
+6