Member of Technical Staff (MTS) - Multimodal Foundation Models

Deeproute Dot A I

Iowa (LA)

On-site

USD 150,000 - 210,000

Full time

14 days+
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Deeproute AI seeks researchers to advance foundation models for autonomous driving, focusing on scalable pretraining pipelines for multimodal driving data and robust model optimization.

The role emphasizes hands-on engineering, rigorous experimentation, and bridging research with production. Publications in top venues are valued.

Qualifications

  • Strong experimental rigor and practical engineering ability.
  • Experience with self-supervised and multimodal learning methods.
  • Publication record in top-tier venues preferred (CVPR/NeurIPS/ICLR/ICML).
  • Familiarity with large-scale pretraining, distribution, and deployment.

Responsibilities

  • Lead large-scale foundation model pretraining and data pipelines for multimodal driving data.
  • Advance representation learning and method innovation for real-world autonomy.
  • Enhance efficiency, scalability, and deployability of models in production.

Skills

Foundation models
Self-supervised learning
Multimodal learning
Large-scale pretraining
Vision Transformers
Video architectures
Retrieval systems
Distributed training

Education

MS/PhD in CV/ML/Robotics/CS

Tools

PyTorch
DeepSpeed
Megatron-LM

Job description

Focus

Multimodal Foundation Models Representation Learning Method Innovation

We are looking for strong technical builders and researchers who deeply understand foundation models and representation learning beyond simply applying existing frameworks.

Ideal candidates should have:

  • Strong experimental rigor
  • Solid systems and modeling intuition
  • Hands-on engineering ability
  • Interest in scalable multimodal AI systems for real-world autonomy

We value people who can bridge research and production, and who care about robustness, scalability, efficiency, and practical deployment in large-scale autonomous driving systems.

Responsibilities
1. Large-Scale Foundation Model Pretraining
  • Develop scalable pretraining pipelines for large-scale multimodal driving data
  • Design and optimize training strategies for:
    • Vision-language-action models
    • Video foundation models
    • Long-context temporal modeling
    • Multimodal representation alignment
  • Improve:
    • Training stability
    • Data efficiency
    • Scaling efficiency
    • Representation robustness
  • Work on distributed training systems and large-scale model optimization using frameworks such as:
    • PyTorch Distributed
    • DeepSpeed
    • Megatron-LM
2. Representation Learning & Method Innovation
  • Design and improve self-supervised and multimodal learning methods for real-world autonomous driving systems
  • Conduct architecture-level research on:
    • Vision Transformers (ViT)
    • Video / temporal architectures
    • Multimodal fusion and alignment
    • Embedding and retrieval systems
    • Long-context and memory-efficient architectures
  • Explore and improve:
    • Pretraining objectives
    • Loss functions
    • Training paradigms
    • Generalization and robustness
  • Analyze model behavior through:
    • Rigorous ablation studies
    • Failure case analysis
  • Representation probing and evaluation
3. Efficient Foundation Models & Scalable Deployment
  • Improve the efficiency, scalability, and deployability of large multimodal foundation models for real-world autonomous driving systems
  • Work on areas such as:
    • Model quantization
    • Knowledge distillation
    • Efficient attention mechanisms
    • Sparse architectures and Mixture-of-Experts (MoE)
    • Long-context and memory-efficient modeling
    • Inference acceleration and serving optimization
    • Training and inference system efficiency
  • Optimize model throughput, latency, memory usage, and deployment performance for large-scale production environments
Requirements
  1. MS or PhD in:
  • Computer Vision
  • Machine Learning
  • Robotics
  • Computer Science
  • Related fields
  • Strong understanding of:
    • Foundation models
    • Self-supervised learning
    • Representation learning
    • Multimodal learning
    • Large-scale pretraining
  • Hands-on experience with methods such as:
    • CLIP
    • DINO / DINOv2
    • MAE
    • Contrastive learning
    • Masked modeling
    • MoE or scalable transformer architectures
  • Experience with one or more of the following is highly valued:
    • Video foundation models
    • Long-context modeling
    • Retrieval systems
    • Efficient inference
    • Distributed training
    • Model compression and deployment optimization
  • Strong publication record in top-tier venues is preferred:
    • CVPR
    • ICCV
    • ECCV
    • NeurIPS
    • ICLR
    • ICML
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Member of Technical Staff (MTS) - Multimodal Foundation Models
Member of Technical Staff (MTS) - Multimodal Foundation Models

Deeproute.ai • Colorado

On-site
USD 90,000 - 120,000
Member of Technical Staff, Machine Learning - NomadicML
Member of Technical Staff, Machine Learning - NomadicML

Praxis, Inc. • San Francisco (CA)

On-site
USD 150,000 - 240,000
Member of Technical Staff, Machine Learning
Member of Technical Staff, Machine Learning

Nomadic AI • San Francisco (CA)

On-site
USD 170,000 - 250,000
Machine Learning: Multimodal Foundation Models
Machine Learning: Multimodal Foundation Models

The Bot Company • San Francisco (CA)

On-site
USD 180,000 - 290,000
Machine Learning: Multimodal Foundation Models
Machine Learning: Multimodal Foundation Models

Maven Ventures • San Francisco (CA)

On-site
USD 150,000 - 230,000
Research Scientist - Vision Language Model
Research Scientist - Vision Language Model

Lever, Inc. • Sunnyvale (CA)

On-site
USD 150,000 - 450,000
Member of Technical Staff — ML Research, Multimodal
Member of Technical Staff — ML Research, Multimodal

Causal Labs • San Francisco (CA)

On-site
USD 180,000 - 260,000
Staff Machine Learning Engineer – BEV/Multi-Modal Perception
Staff Machine Learning Engineer – BEV/Multi-Modal Perception

Jobtailor • Ann Arbor (MI)

On-site
USD 150,000 - 230,000
Member of Technical Staff — ML Research, Multimodal
Member of Technical Staff — ML Research, Multimodal

Kindredventures • San Francisco (CA)

On-site
USD 180,000 - 260,000
Member of Technical Staff - ML Performance
Member of Technical Staff - ML Performance

Veeda Innovation • Northern (KY)

On-site
USD 150,000 - 230,000