Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited

San Francisco (CA)

On-site

USD 120,000 - 160,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Hyphen Connect Limited in San Francisco is seeking a Multimodal AI Systems Architect to develop and optimize AI systems that integrate vision and audio models. This role focuses on enhancing voice-to-voice interactions and multimodal retrieval capabilities, ensuring efficient and innovative systems.

The ideal candidate has experience with Whisper, CLIP, and multimodal LLM integration, as well as knowledge of streaming architectures and cross-modal alignment.

Qualifications

  • Experience with Whisper, CLIP, and multimodal LLM integration.
  • Knowledge of streaming architectures and WebRTC.
  • Expertise in cross-modal alignment.

Responsibilities

  • Integrate vision encoders and audio-native models into core agent reasoning loops.
  • Optimize streaming latency for voice-to-voice AI interactions.
  • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.

Skills

Whisper
CLIP
multimodal LLM integration
streaming architectures
WebRTC
cross-modal alignment

Job description

We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models. This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative.

Responsibilities
  • Integrate vision encoders and audio-native models into core agent reasoning loops.
  • Optimize streaming latency for voice-to-voice AI interactions.
  • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.
Qualifications
  • Experience with Whisper, CLIP, and multimodal LLM integration.
  • Knowledge of streaming architectures and WebRTC.
  • Expertise in cross-modal alignment.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 110,000 - 150,000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Boston (MA)

On-site
USD 130,000 - 160,000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Seattle (WA)

On-site
USD 120,000 - 150,000
Multimodal AI Architect: Vision, Voice & RAG Systems
Multimodal AI Architect: Vision, Voice & RAG Systems

Hyphen Connect Limited • Seattle (WA)

On-site
USD 120,000 - 150,000
Real-Time Vision & Voice AI Architect
Real-Time Vision & Voice AI Architect

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000
Multimodal AI Systems Architect: Vision & Audio Orchestrator
Multimodal AI Systems Architect: Vision & Audio Orchestrator

Hyphen Connect Limited • Boston (MA)

On-site
USD 130,000 - 160,000
Multimodal AI Engineer — Image/Video & Audio
Multimodal AI Engineer — Image/Video & Audio

xAI • Seattle (WA)

On-site
USD 180,000 - 440,000
Equity
Comprehensive medical, vision, and dental coverage
401(k) retirement plan
+2
Multimodal AI Research Engineer — Speech & Vision
Multimodal AI Research Engineer — Speech & Vision

Google DeepMind • Los Angeles (CA)

On-site
USD 174,000 - 252,000
Bonus
Equity
Comprehensive benefits
Senior Multimodal AI Systems Engineer
Senior Multimodal AI Systems Engineer

Cohere • New York (NY), San Francisco (CA)

Hybrid
USD 180,000 - 250,000
Weekly lunch stipend
Full health and dental benefits
RRSP matching / 401(k)
+5
Multimodal AI Researcher
Multimodal AI Researcher

Socket.dev • Sunnyvale (CA)

Hybrid
USD 150,000 - 230,000