Internship: Multimodal Vision-Language Reasoning

Mitsubishi Electric Research Laboratories

Cambridge (MA)

On-site

USD 27,552 - 55,104

Part time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

A leading research organization in Cambridge is seeking an intern for a role focused on multimodal algorithmic reasoning. The ideal candidate is a PhD student with experience in machine learning and computer vision, specifically in training multimodal models for vision-and-language tasks. This position offers an opportunity to collaborate with the computer vision team, and candidates are encouraged to bring a strong publication record and experience in mathematical reasoning. Strong programming skills in Python using PyTorch are required.

Qualifications

  • Strong background in machine learning and computer vision.
  • Prior experience with training multimodal LLMs for vision-and-language tasks.
  • Experience in participating and winning mathematical Olympiads.

Responsibilities

  • Research on multimodal large language models and neural algorithmic reasoning.
  • Collaborate with researchers in the computer vision team.
  • Develop algorithms and prepare manuscripts for publications.

Skills

Experience with training large vision-and-language models
Experience with solving mathematical reasoning problems
Programming in Python using PyTorch
Strong track record of publications

Education

Enrolled in a PhD program

Job description

A leading research organization in Cambridge is seeking an intern for a role focused on multimodal algorithmic reasoning. The ideal candidate is a PhD student with experience in machine learning and computer vision, specifically in training multimodal models for vision-and-language tasks. This position offers an opportunity to collaborate with the computer vision team, and candidates are encouraged to bring a strong publication record and experience in mathematical reasoning. Strong programming skills in Python using PyTorch are required.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

PhD Internship: Multimodal Embodied AI in Dynamic Environments
PhD Internship: Multimodal Embodied AI in Dynamic Environments

Mitsubishi Electric Research Laboratories • Cambridge (MA)

On-site
USD 30,000 - 40,000
Applied Researcher: On-Device Multimodal Reasoning
Applied Researcher: On-Device Multimodal Reasoning

Socket.dev • Sunnyvale (CA)

On-site
USD 200,000 - 320,000
Internship - Multimodal Algorithmic Reasoning
Internship - Multimodal Algorithmic Reasoning

Mitsubishi Electric Research Laboratories • Cambridge (MA)

On-site
Research Vision Expertise
Research Vision Expertise

Thinking Machines Lab • San Francisco (CA)

On-site
USD 350,000 - 475,000
Generous health, dental, and vision benefits
Unlimited PTO
Paid parental leave
+1
Multimodal Vision Researcher
Multimodal Vision Researcher

Thinkingmachines • San Francisco (CA)

On-site
USD 350,000 - 475,000
Generous health, dental, and vision benefits
Unlimited PTO
Paid parental leave
+1
Research, Vision Expertise
Research, Vision Expertise

Thinkingmachines • San Francisco (CA)

On-site
USD 350,000 - 475,000
Generous health, dental, and vision benefits
Unlimited PTO
Paid parental leave
+1
PhD Research Intern: AI/ML, RL & Multimodal Vision
PhD Research Intern: AI/ML, RL & Multimodal Vision

Simular Inc. • Palo Alto (CA)

On-site
USD 30,000 - 50,000
Research Scientist - Vision Language Model
Research Scientist - Vision Language Model

Ifm Us • Sunnyvale (CA)

On-site
USD 120,000 - 150,000
Research Intern: Post-Training LLMs & AI Reasoning
Research Intern: Post-Training LLMs & AI Reasoning

ByteDance • San Jose (CA)

On-site
USD 97,000 - 138,000
Health insurance
Life insurance
Wellbeing benefits
+3
NLP & Multimodal Research Intern: LLMs & Vision
NLP & Multimodal Research Intern: LLMs & Vision

Kitware Inc. • Town of Clifton Park (NY)

On-site
Flexible work assignments
Employee ownership
Collaborative environment