Multimodal AI Research Scientist for Video Editing

Descript

San Francisco (CA)

Hybrid

USD 197,000 - 263,000

Full time

14 days+
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Benefits offered by this job

Equity

Job summary

Descript's Research team builds models behind the product's standout features, including Video Regenerate and lipsync. This role focuses on multimodal understanding, training models to perceive edited media the way a human editor does, enabling better evaluation and smarter editing decisions.

The candidate will design and implement deep learning solutions, evaluate experiments, and help ship production features.

Qualifications

  • Proven ability to design and implement deep learning algorithms.
  • Strong programming skills and fluency in PyTorch.
  • Track record of generating new ideas and shipping results.

Responsibilities

  • Train models from scratch or fine-tune existing foundation models.
  • Design benchmarks and evaluation methods for edited media.
  • Ship production features in collaboration with engineering teams.
  • Mentor or lead researchers as needed for senior roles.

Skills

Deep learning
PyTorch
Experimental judgment
Communication
Publications

Education

PhD or Master's in deep learning or related field

Job description

Descript's Research team builds models behind the product's standout features, including Video Regenerate and lipsync. This role focuses on multimodal understanding, training models to perceive edited media the way a human editor does, enabling better evaluation and smarter editing decisions.

The candidate will design and implement deep learning solutions, evaluate experiments, and help ship production features.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Multimodal AI Research Scientist for Production Editing
Multimodal AI Research Scientist for Production Editing

Neura Market • San Francisco (CA), Northern (KY)

Hybrid
USD 197,000 - 263,000
Healthcare package
401k matching
Catered lunches
+1
Multimodal AI Researcher - Image/Video Gen & Editing
Multimodal AI Researcher - Image/Video Gen & Editing

Apple Inc. • Santa Clara (CA)

On-site
USD 181,000 - 319,000
Comprehensive medical and dental coverage
Retirement benefits
Employee stock purchase plan
+1
Senior Research Scientist: Multimodal VLM & Video Understanding
Senior Research Scientist: Multimodal VLM & Video Understanding

techire ai • San Francisco (CA)

On-site
USD 210,000 - 260,000
AI Research Scientist, Multimodal: Video & Audio Generation
AI Research Scientist, Multimodal: Video & Audio Generation

Meta • Menlo Park (CA)

On-site
USD 180,000 - 280,000
Multimodal AI Researcher
Multimodal AI Researcher

Socket.dev • Sunnyvale (CA)

Hybrid
USD 150,000 - 230,000
Multimodal AI Research Scientist — Intelligent Editing
Multimodal AI Research Scientist — Intelligent Editing

ByteDance • Seattle (WA)

On-site
USD 177,688 - 341,734
Medical, dental, and vision insurance
401(k) savings plan with company match
Paid parental leave
+1
Multi-Modal AI Research Scientist – Human Understanding
Multi-Modal AI Research Scientist – Human Understanding

Meta • Pittsburgh, Burlingame (CA)

On-site
USD 150,000 - 190,000
Research Engineer
Research Engineer

Harnham • California (MO)

On-site
USD 120,000 - 180,000
Agentic Systems Research Engineer for Multimodal Video AI
Agentic Systems Research Engineer for Multimodal Video AI

Doist • New York (NY)

On-site
USD 140,000 - 230,000
Medical, dental, and vision
401K with match
Commuter benefits
+5
AI Research Scientist, Multimodal - Monetization GenAI
AI Research Scientist, Multimodal - Monetization GenAI

Meta • Menlo Park (CA)

On-site
USD 180,000 - 280,000