Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited

Seattle (WA)

Sur place

USD 120 000 - 150 000

Plein temps

14 jours+
Générateur de candidature

Démarquez-vous pour ce poste — générez un CV et une lettre de motivation personnalisés en environ une minute.

Passez les filtres ATS

Résumé du poste

Hyphen Connect Limited is seeking a talented Multimodal AI Systems Architect in Seattle, USA. This role is focused on developing and optimizing AI systems that seamlessly integrate vision and audio models, enhancing voice-to-voice interactions and multimodal retrieval capabilities.

Qualified candidates should have experience with Whisper, CLIP, and streaming architectures. Responsibilities include integrating various modules and optimizing interaction latencies.

Qualifications

  • Experience with Whisper, CLIP, and multimodal LLM integration.
  • Knowledge of streaming architectures and WebRTC.
  • Expertise in cross-modal alignment.

Responsabilités

  • Integrate vision encoders and audio-native models into core agent reasoning loops.
  • Optimize streaming latency for voice-to-voice AI interactions.
  • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.

Connaissances

Experience with Whisper
Knowledge of streaming architectures
Expertise in cross-modal alignment

Description du poste

Seattle, USA

We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models. This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative.

Responsibilities
  • Integrate vision encoders and audio-native models into core agent reasoning loops.
  • Optimize streaming latency for voice-to-voice AI interactions.
  • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.
Qualifications
  • Experience with Whisper, CLIP, and multimodal LLM integration.
  • Knowledge of streaming architectures and WebRTC.
  • Expertise in cross-modal alignment.
Obtenez votre examen gratuit et confidentiel de votre CV.

ou faites glisser et déposez votre fichier ici.

Similar jobs

Postes similaires à comparer

Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Boston (MA)

Sur place
USD 130 000 - 160 000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Oregon (WI)

Sur place
USD 110 000 - 150 000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • San Francisco (CA)

Sur place
USD 120 000 - 160 000
Multimodal AI Architect: Vision, Voice & RAG Systems
Multimodal AI Architect: Vision, Voice & RAG Systems

Hyphen Connect Limited • Seattle (WA)

Sur place
USD 120 000 - 150 000
Real-Time Vision & Voice AI Architect
Real-Time Vision & Voice AI Architect

Hyphen Connect Limited • San Francisco (CA)

Sur place
USD 120 000 - 160 000
Multimodal AI Systems Architect: Vision & Audio Orchestrator
Multimodal AI Systems Architect: Vision & Audio Orchestrator

Hyphen Connect Limited • Boston (MA)

Sur place
USD 130 000 - 160 000
Multimodal AI Engineer — Image/Video & Audio
Multimodal AI Engineer — Image/Video & Audio

xAI • Seattle (WA)

Sur place
USD 180 000 - 440 000
Equity
Comprehensive medical, vision, and dental coverage
401(k) retirement plan
+2
Multimodal Speech AI Scientist
Multimodal Speech AI Scientist

Lightspeed Studios • Bellevue (WA)

Sur place
USD 123 000 - 230 000
Sign-on bonus
Relocation package
RSUs
Multimodal AI Engineer (voice and vision)
Multimodal AI Engineer (voice and vision)

Axiom Global Technologies • États-Unis

À distance
USD 150 000 - 190 000
Multimodal AI Systems Engineer: Media & Speech
Multimodal AI Systems Engineer: Media & Speech

Meta • Columbia (SC)

Sur place
USD 154 000 - 217 000