Video & Multimodal AI Research Scientist

Innodata

Ridgefield Park (NJ)

On-site

USD 160,000 - 185,000

Full time

18 hours ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Innodata is hiring a Research Scientist to own the science behind video and multimodal evaluations. You will define data designs, evaluation criteria, and experimental protocols to advance video understanding and generation.

The role emphasizes rigorous experiments, cross‑functional collaboration, and publishing benchmarks and methodologies. Required are 5+ years in video or multimodal ML, a CS/EE degree (MS/PhD preferred), and strong PyTorch experience.

Qualifications

  • 5+ years of hands-on industry experience in video understanding or multimodal ML.
  • Bachelor's in CS/EE or related technical field required; MS/PhD preferred.
  • Proficient with PyTorch and model fine-tuning in video/vision-language tasks.

Responsibilities

  • Define data design, schemas, and evaluation criteria for video and multimodal models.
  • Create evaluation methodologies for temporal grounding, long-horizon reasoning, and cross-modal retrieval.
  • Develop data collection and labeling plans with annotation teams and synthetic-data pipelines.
  • Run experiments linking data choices to model performance and publish results.

Skills

Video understanding
Multimodal ML
PyTorch fundamentals
HuggingFace transformers
Datasets & benchmarks

Education

Bachelor's in CS/EE or related
MS or PhD preferred

Tools

ffmpeg
decord
WebDataset
Parquet/Arrow
HuggingFace datasets

Job description

Innodata is hiring a Research Scientist to own the science behind video and multimodal evaluations. You will define data designs, evaluation criteria, and experimental protocols to advance video understanding and generation.

The role emphasizes rigorous experiments, cross‑functional collaboration, and publishing benchmarks and methodologies. Required are 5+ years in video or multimodal ML, a CS/EE degree (MS/PhD preferred), and strong PyTorch experience.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Research Scientist, Video & Multimodal
Research Scientist, Video & Multimodal

Innodata • Ridgefield Park (NJ)

On-site
USD 160,000 - 185,000
Research Scientist, Multimodal Video AI
Research Scientist, Multimodal Video AI

Cantina • California (MO)

On-site
USD 200,000 - 320,000
Competitive salary
Equity
Medical / Dental / Vision
+6
Research Engineer
Research Engineer

Harnham • California (MO)

On-site
USD 120,000 - 180,000
Multimodal AI Research Scientist for Video Editing
Multimodal AI Research Scientist for Video Editing

Descript • San Francisco (CA)

Hybrid
USD 197,000 - 263,000
Equity
Senior Technical Lead, Multimodal AI Research
Senior Technical Lead, Multimodal AI Research

Mixpeek • San Francisco (CA)

On-site
USD 180,000 - 240,000
In‑person SF office
Competitive compensation
Catered lunches and dinners
+6
Multimodal AI Research Engineer
Multimodal AI Research Engineer

Harnham • California (MO)

On-site
USD 120,000 - 180,000
Lead AI Researcher — Build Scalable Multimodal Video AI
Lead AI Researcher — Build Scalable Multimodal Video AI

Opus • Mountain View (CA)

Hybrid
USD 180,000 - 300,000
GenAI Research Scientist - Multimodal Video & AI
GenAI Research Scientist - Multimodal Video & AI

TikTok • San Jose (CA)

On-site
USD 162,000 - 317,000
Medical, dental, and vision insurance
401(k) with company match
Paid parental leave
+6
Multimodal AI Research Scientist: Video & Personalization
Multimodal AI Research Scientist: Video & Personalization

lumalabs-ai • New York (NY)

On-site
USD 200,000 - 450,000
Senior AI Research Scientist - Vision & Multimodal
Senior AI Research Scientist - Vision & Multimodal

ByteDance • Seattle (WA)

On-site
USD 232,560 - 427,500