Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited

Boston (MA)

On-site

USD 130,000 - 160,000

Full time

14 days+
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Hyphen Connect Limited is seeking a talented Multimodal AI Systems Architect based in Boston, USA. The successful candidate will develop and optimize innovative AI systems that integrate both vision and audio models, focusing on enhancing voice-to-voice interactions.

This role requires expertise in multimodal systems, and the ability to architect solutions that efficiently retrieve insights from diverse media formats like videos and PDFs. Join a team that values cutting-edge technology and innovation.

Qualifications

  • Experience with multimodal LLM integration.
  • Proficient in using WebRTC.
  • Strong understanding of streaming technologies.

Responsibilities

  • Integrate vision encoders and audio-native models into core agent reasoning loops.
  • Optimize streaming latency for voice-to-voice AI interactions.
  • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.

Skills

Experience with Whisper
Knowledge of streaming architectures
Expertise in cross-modal alignment

Job description

Boston, USA

We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models. This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative.

Responsibilities
  • Integrate vision encoders and audio-native models into core agent reasoning loops.
  • Optimize streaming latency for voice-to-voice AI interactions.
  • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.
Qualifications
  • Experience with Whisper, CLIP, and multimodal LLM integration.
  • Knowledge of streaming architectures and WebRTC.
  • Expertise in cross-modal alignment.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Seattle (WA)

On-site
USD 120,000 - 150,000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 110,000 - 150,000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000
Multimodal AI Architect: Vision, Voice & RAG Systems
Multimodal AI Architect: Vision, Voice & RAG Systems

Hyphen Connect Limited • Seattle (WA)

On-site
USD 120,000 - 150,000
Multimodal AI Systems Architect: Vision & Audio Orchestrator
Multimodal AI Systems Architect: Vision & Audio Orchestrator

Hyphen Connect Limited • Boston (MA)

On-site
USD 130,000 - 160,000
Real-Time Vision & Voice AI Architect
Real-Time Vision & Voice AI Architect

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000
Multimodal AI Engineer: Vision, Audio & Speech Systems
Multimodal AI Engineer: Vision, Audio & Speech Systems

Meta • Montpelier (VT)

On-site
USD 154,000 - 217,000
Multimodal AI Engineer (voice and vision)
Multimodal AI Engineer (voice and vision)

Axiom Global Technologies • United States

Remote
USD 150,000 - 190,000
Multimodal AI Engineer — Image/Video & Audio
Multimodal AI Engineer — Image/Video & Audio

xAI • Seattle (WA)

On-site
USD 180,000 - 440,000
Equity
Comprehensive medical, vision, and dental coverage
401(k) retirement plan
+2
Multimodal Intelligence Systems Engineer
Multimodal Intelligence Systems Engineer

MaxIT Consulting - Max Corporate Group • California (MO)

On-site
USD 120,000 - 180,000