Vision-Language AI Scientist: Invent Multimodal Systems

Arcade

San Francisco (CA)

On-site

USD 180,000 - 240,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Competitive compensation
Daily catered lunch
Company events

Job summary

Arcade is seeking a Vision-Language Model expert to lead our efforts in teaching foundation models how to evaluate consumer products like an expert appraiser.

You will invent new technologies, design novel architectures, and author proprietary training paradigms when open-source or commercial models fall short, building systems that assess abstract attributes of product images and generate rich captions, price estimates, and aesthetic quality scores.

Qualifications

  • Ph.D. in CS, AI, ML, CV, or related field.
  • First-author publications in top AI/CV/NLP venues.
  • Deep understanding of Vision-Language Models and transformers.
  • Expert Python and PyTorch; optimize training loops.
  • Industry research and production deployment experience a plus.
  • E-commerce/product ML exposure is a bonus.

Responsibilities

  • Pioneer novel neural architectures and multimodal integration techniques.
  • Lead fine-tuning and adaptation of VLMs for complex CV tasks.
  • Develop methods to extract nuanced signals from product images.
  • Guide creation and augmentation of specialized multimodal datasets.
  • Invent evaluation frameworks and metrics for abstract tasks.
  • Collaborate with engineering teams to deploy research into production.

Skills

Vision-Language Models
Multimodal architectures
PyTorch
Python
Deep learning
Research & publications

Education

Ph.D. in CS/AI/ML

Job description

Arcade is seeking a Vision-Language Model expert to lead our efforts in teaching foundation models how to evaluate consumer products like an expert appraiser.

You will invent new technologies, design novel architectures, and author proprietary training paradigms when open-source or commercial models fall short, building systems that assess abstract attributes of product images and generate rich captions, price estimates, and aesthetic quality scores.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Pioneering Vision-Language AI Scientist — Invent & Scale
Pioneering Vision-Language AI Scientist — Invent & Scale

Arcade • California (MO), Northern (KY)

Hybrid
USD 180,000 - 280,000
Competitive compensation
Daily catered lunch
Company events
Research Scientist
Research Scientist

Arcade • California (MO), Northern (KY)

Hybrid
USD 180,000 - 280,000
Competitive compensation
Daily catered lunch
Company events
Research Scientist
Research Scientist

Arcade • San Francisco (CA)

On-site
USD 180,000 - 240,000
Competitive compensation
Daily catered lunch
Company events
Applied AI Scientist: Multimodal Vision & Language
Applied AI Scientist: Multimodal Vision & Language

Apple Inc. • Seattle (WA)

On-site
USD 205,000 - 309,000
Comprehensive medical and dental
Retirement benefits
Discounted products and free services
+1
Multimodal AI Researcher - Agent & Vision-Language Systems
Multimodal AI Researcher - Agent & Vision-Language Systems

Apple Inc. • Santa Clara (CA)

On-site
USD 184,700 - 324,800
Multimodal AI Research Engineer (Vision & Language)
Multimodal AI Research Engineer (Vision & Language)

Apple Inc. • Cupertino (CA)

On-site
USD 150,000 - 278,000
Multi-Modal AI Research Scientist – Human Understanding
Multi-Modal AI Research Scientist – Human Understanding

Meta • Pittsburgh, Burlingame (CA)

On-site
USD 150,000 - 190,000
Vision AI Engineer for Multimodal LLMs (Equity Eligible)
Vision AI Engineer for Multimodal LLMs (Equity Eligible)

Pinterest • San Francisco (CA)

Hybrid
USD 139,000 - 286,000
Equity
Vision-Language Models (VLMs)
Vision-Language Models (VLMs)

TalentOla • Waukesha (WI)

On-site
USD 120,000 - 150,000
Multimodal AI Engineer: Vision-Language in Production
Multimodal AI Engineer: Vision-Language in Production

Tether.io • Indiana (PA)

On-site
USD 90,000 - 130,000