Vision-Language AI Research Scientist

Institute of Foundation Models

Sunnyvale (CA)

On-site

USD 180,000 - 250,000

Full time

2 days ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Institute of Foundation Models in Sunnyvale, CA seeks a Research Scientist to advance state-of-the-art Vision Language Models and multimodal AI systems. You will explore architectures, data recipes, and training strategies for large-scale VLMs alongside researchers and engineers.

Responsibilities include data processing pipelines, distributed training, and evaluating multimodal reasoning and agentic capabilities.

Qualifications

  • PhD or equivalent research experience in Machine Learning, Computer Vision, Natural Language Processing, or Multimodal AI.
  • Experience with large language models and/or vision-language models across pre-training, fine-tuning, evaluation, or inference.
  • Strong Python and PyTorch development skills for large-scale ML research.

Responsibilities

  • Research and development of next-generation Vision Language Models across pre-training, instruction tuning, reasoning, and agents.
  • Develop novel architectures and training methodologies for visual understanding, language reasoning, and tool-use capabilities.
  • Research efficient multimodal learning techniques, including data-efficient training and long-context modeling.
  • Build and improve large-scale multimodal datasets, synthetic data generation pipelines, and evaluation benchmarks for VLM capabilities.
  • Represent MBZUAI at research conferences and mentor junior researchers.

Skills

Python
PyTorch
Distributed training
Multimodal reasoning
English communication

Education

PhD or equivalent research experience in ML/CV/NLP/Multimodal AI

Tools

PyTorch Distributed
Megatron
Triton
CUDA

Job description

Institute of Foundation Models in Sunnyvale, CA seeks a Research Scientist to advance state-of-the-art Vision Language Models and multimodal AI systems. You will explore architectures, data recipes, and training strategies for large-scale VLMs alongside researchers and engineers.

Responsibilities include data processing pipelines, distributed training, and evaluating multimodal reasoning and agentic capabilities.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Vision-Language AI Research Scientist
Senior Vision-Language AI Research Scientist

Lever, Inc. • Sunnyvale (CA)

On-site
USD 150,000 - 450,000
Vision-Language ML Architect & Inventor of Novel VLMs
Vision-Language ML Architect & Inventor of Novel VLMs

Arcade • Presidio (TX)

On-site
USD 180,000 - 240,000
Daily catered lunch
Company events
Equal opportunity employer
Vision-Language Research Engineer
Vision-Language Research Engineer

Anthropic • San Francisco (CA)

Hybrid
USD 350,000 - 850,000
Research Scientist - Vision Language Model
Research Scientist - Vision Language Model

Institute of Foundation Models • Sunnyvale (CA)

On-site
USD 180,000 - 250,000
Research Scientist - Vision Language Model
Research Scientist - Vision Language Model

Lever, Inc. • Sunnyvale (CA)

On-site
USD 150,000 - 450,000
Senior Vision-Language AI Scientist
Senior Vision-Language AI Scientist

Ambient.ai • San Francisco (CA)

On-site
USD 180,000 - 240,000
Stock options
Health + welfare package
Flexible time off
+1
Construction Vision-Language AI Research Scientist
Construction Vision-Language AI Research Scientist

ironsite-ai • San Francisco (CA)

On-site
USD 175,000 - 275,000
Multimodal AI Research Scientist
Multimodal AI Research Scientist

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 350,000 - 475,000
Health benefits
Dental benefits
Vision benefits
+3
Vision-Language AI Scientist: Invent Multimodal Systems
Vision-Language AI Scientist: Invent Multimodal Systems

Arcade • San Francisco (CA)

On-site
USD 180,000 - 240,000
Competitive compensation
Daily catered lunch
Company events
Multi-Modal AI Research Scientist – Human Understanding
Multi-Modal AI Research Scientist – Human Understanding

Meta • Pittsburgh, Burlingame (CA)

On-site
USD 150,000 - 190,000