Multimodal Speech AI Scientist

Lightspeed Studios

Bellevue (WA)

On-site

USD 123,000 - 230,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Sign-on bonus
Relocation package
RSUs

Job summary

Tencent in Bellevue, WA is seeking researchers to develop large-scale, native multimodal model systems that jointly support vision, audio, and text for comprehensive perception and understanding of the physical world.

The role focuses on end‑to‑end speech models, representation learning, and cross‑modal alignment with potential collaboration across image and text modalities. Requires advanced degrees and strong background in speech processing.

Qualifications

  • Ph.D. in Computer Science, Electrical Engineering, Artificial Intelligence, Linguistics, or a related field; or Master’s degree with several years of relevant experience.
  • Solid understanding of speech and audio signal processing, acoustic modeling, language modeling, and large model architectures.
  • Proficient in core speech system pipelines such as ASR, TTS, or speech translation; multilingual/multitask/end-to-end experience is a plus.

Responsibilities

  • Develop general‑purpose, end‑to‑end large speech models across multilingual ASR, translation, synthesis, and understanding.
  • Advance research on speech representation learning and encoder/decoder architectures for unified acoustic representations.
  • Explore alignment and fusion between audio/speech and other modalities for multimodal training/inference.
  • Build and maintain high‑quality multimodal speech datasets with annotation and data synthesis.

Skills

Speech processing
Acoustic modeling
Language modeling
Transformer architectures
Multimodal training
Distributed systems
PyTorch
TensorFlow

Education

Ph.D. or Master’s degree in CS/EE/AI/Linguistics
Relevant experience after degree

Tools

PyTorch
TensorFlow

Job description

Tencent in Bellevue, WA is seeking researchers to develop large-scale, native multimodal model systems that jointly support vision, audio, and text for comprehensive perception and understanding of the physical world.

The role focuses on end‑to‑end speech models, representation learning, and cross‑modal alignment with potential collaboration across image and text modalities. Requires advanced degrees and strong background in speech processing.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Seattle (WA)

On-site
USD 120,000 - 150,000
Multimodal AI Architect: Vision, Voice & RAG Systems
Multimodal AI Architect: Vision, Voice & RAG Systems

Hyphen Connect Limited • Seattle (WA)

On-site
USD 120,000 - 150,000
Research Scientist – Speech and Audio Understanding (Large Models & Multimodal Systems)
Research Scientist – Speech and Audio Understanding (Large Models & Multimodal Systems)

Lightspeed Studios • Bellevue (WA)

On-site
USD 123,000 - 230,000
Sign-on bonus
Relocation package
RSUs
Multimodal AI Research Scientist
Multimodal AI Research Scientist

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 350,000 - 475,000
Health benefits
Dental benefits
Vision benefits
+3
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Boston (MA)

On-site
USD 130,000 - 160,000
Multimodal AI Engineer — Image/Video & Audio
Multimodal AI Engineer — Image/Video & Audio

xAI • Seattle (WA)

On-site
USD 180,000 - 440,000
Equity
Comprehensive medical, vision, and dental coverage
401(k) retirement plan
+2
Omni-Modal AI Research Scientist (Large Models)
Omni-Modal AI Research Scientist (Large Models)

Tencent • Palo Alto (CA)

On-site
USD 134,900 - 253,400
Medical, dental, and vision coverage
Relocation package
401(k) plan
+2
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000
Multimodal AI Systems Architect (AI Engineering)
Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 110,000 - 150,000
Senior AI Research Scientist - Vision & Multimodal
Senior AI Research Scientist - Vision & Multimodal

ByteDance • Seattle (WA)

On-site
USD 232,560 - 427,500