Senior Machine Learning Engineer, Speech, LLM Training Data

Jobtailor

Overland Park (KS)

On-site

USD 140,000 - 190,000

Full time

3 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Jobtailor in Overland Park, KS is seeking an experienced ML engineer to define the data roadmap for multilingual speech, translation, multimodal LLMs, and conversational AI. You will build audio-processing pipelines, dataset pipelines with redaction and quality checks, and design robust annotation guidelines for scalable QA.

Join a team focused on end-to-end ML data workflows, model evaluation, and secure, reproducible production on AWS, with opportunities to advance SFT, RLHF-style training,

Qualifications

  • Bachelor’s or Master’s degree in CS/ML or related field.
  • 5+ years of experience in ML engineering, speech/audio ML, NLP, or LLM training-data workflows.
  • Strong hands-on experience with Python, SQL, Linux, Git, and Docker.
  • Experience training or evaluating models using PyTorch, Hugging Face, or comparable ML frameworks.
  • Experience with FFmpeg and audio-processing libraries such as torchaudio or librosa.
  • Experience with speech-processing tasks such as VAD, diarization, ASR, and language identification.
  • Experience with Databricks/Spark and large-scale dataset pipelines.
  • Working knowledge of AWS services (S3, SageMaker, Glue, Step Functions, IAM, KMS).
  • Experience with annotation platforms (Label Studio, Prodigy, etc.).
  • Experiment tracking and data versioning tools (MLflow, Weights & Biases, DVC).
  • Experience with multilingual speech, translation, annotation workflows, and evaluation datasets.

Responsibilities

  • Define the data roadmap for multilingual speech, translation, multimodal LLMs, and conversational AI
  • Build audio-processing pipelines covering resampling, VAD, diarization, language identification, transcription, alignment, and quality filtering
  • Build dataset pipelines for cleaning, deduplication, PII/PHI redaction, quality scoring, sampling, balancing, versioning, and lineage
  • Design annotation guidelines, QA rubrics, golden datasets, and reviewer workflows
  • Build evaluation datasets, analyze model failures, and translate performance gaps into targeted data improvements
  • Run training, fine-tuning, post-training, and evaluation experiments (SFT, preferences, RLHF-style, synthetic data)
  • Productionize secure, traceable, and reproducible data and ML workflows on AWS

Skills

Machine Learning
Natural Language Processing
Audio Processing
Data Engineering
Model Evaluation
Transcription
Quality Filtering
Data Redaction
Experiment Tracking
Dataset Versioning

Education

Bachelor’s or Master’s degree in CS/ML or related field

Tools

PyTorch
Hugging Face
FFmpeg
Databricks
MLflow

Job description

  • Define the data roadmap for multilingual speech, translation, multimodal LLMs, and conversational AI
  • Build audio-processing pipelines covering resampling, channel handling, VAD, diarization, language identification, transcription, alignment, and quality filtering
  • Build dataset pipelines for cleaning, deduplication, PII/PHI redaction, quality scoring, sampling, balancing, versioning, and lineage
  • Design annotation guidelines, QA rubrics, golden datasets, and reviewer workflows
  • Build evaluation datasets, analyze model failures, and translate performance gaps into targeted data improvements
  • Run training, fine-tuning, post-training, and evaluation experiments, including SFT, preference data, DPO/RLHF-style workflows, and synthetic data generation
  • Productionize secure, traceable, and reproducible data and ML workflows on AWS
Requirements
  • Bachelor’s or Master’s degree in Computer Science, Machine Learning, Data Science, Electrical Engineering, Computational Linguistics, or a related field, or equivalent practical experience
  • 5+ years of experience in ML engineering, speech/audio ML, ML data engineering, NLP, or LLM training-data workflows
  • Strong hands-on experience with Python, SQL, Linux, Git, and Docker
  • Experience training or evaluating models using PyTorch, Hugging Face, or comparable ML frameworks
  • Experience with FFmpeg and audio-processing libraries such as TorchCodec, torchaudio, librosa, or equivalent tools
  • Experience with speech-processing tasks such as VAD, diarization, ASR, forced alignment, language identification, and audio-quality analysis
  • Experience with Databricks/Spark, Parquet/Arrow, and large-scale dataset pipelines
  • Working knowledge of AWS S3, SageMaker, Glue, Step Functions, IAM, and KMS
  • Experience with an annotation platform such as Labelbox, Label Studio, Scale AI, Prodigy, Argilla, or custom internal tooling
  • Experience with experiment tracking and data versioning tools such as MLflow, Weights & Biases, DVC, Delta Lake, or LakeFS
  • Experience with multilingual speech, translation, annotation workflows, and evaluation datasets
Core Competencies

Demonstrates expertise in building and optimizing multilingual speech and audio-processing pipelines, with a strong focus on machine learning workflows and data management on AWS. Proficient in model training, evaluation, and the use of advanced audio-processing tools and libraries.

Highest-signal resume keywords
  • Machine Learning Engineering
  • Multilingual Speech Processing
  • Python Programming
  • AWS Services
  • Data Pipeline Development
ATS Optimization Keywords
Hard Skills
  • Machine Learning
  • Natural Language Processing
  • Audio Processing
  • Data Engineering
  • Model Evaluation
  • Transcription
  • Quality Filtering
  • Data Redaction
  • Experiment Tracking
  • Dataset Versioning
Industry Keywords
  • Conversational AI
  • Speech Recognition
  • Diarization
  • Language Identification
  • Annotation Workflows
  • Quality Scoring
  • Synthetic Data Generation
  • VAD
  • ASR
  • Data Roadmap
Tools & Technologies
  • Python
  • SQL
  • Linux
  • Git
  • Docker
  • PyTorch
  • Hugging Face
  • FFmpeg
  • Databricks
  • MLflow
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Applied Scientist – LLM Training Data
Applied Scientist – LLM Training Data

Jobtailor • Overland Park (KS)

On-site
USD 120,000 - 180,000
Senior Machine Learning Engineer, Speech & LLM Training Data
Senior Machine Learning Engineer, Speech & LLM Training Data

Propio Language Services • Overland Park (KS)

On-site
USD 100,000 - 170,000
Senior Machine Learning Engineer, Speech & LLM Training Data
Senior Machine Learning Engineer, Speech & LLM Training Data

Propio • Overland Park (KS)

Hybrid
USD 120,000 - 190,000
Audio Applied Research Science Intern
Audio Applied Research Science Intern

Jobtailor • Niles (IL)

On-site
USD 90,000 - 140,000
Junior AI/ML Engineer
Junior AI/ML Engineer

Jobtailor • California (MO)

On-site
USD 120,000 - 190,000
Senior Machine Learning Engineer
Senior Machine Learning Engineer

Jobtailor • New York (NY)

On-site
USD 120,000 - 160,000
Staff AI Software Engineer
Staff AI Software Engineer

Jobtailor • California (MO)

On-site
USD 170,000 - 210,000
Applied Scientist/Research Engineer, LLM Training Data
Applied Scientist/Research Engineer, LLM Training Data

Propio • Overland Park (KS)

Hybrid
USD 120,000 - 180,000
Software Engineer, AI Infrastructure – LVM Inference & Evaluation
Software Engineer, AI Infrastructure – LVM Inference & Evaluation

Jobtailor • Redwood City (CA)

On-site
USD 180,000 - 240,000
AI Architect – Media
AI Architect – Media

Jobtailor • Atlanta (GA)

On-site
USD 180,000 - 240,000