Senior LLM Inference Engineer – Distributed AI Serving

Atos SE

Bezons

Sur place

EUR 120 000 - 190 000

Plein temps

Il y a 2 jours
Soyez parmi les premiers à postuler
Générateur de candidature

Démarquez-vous pour ce poste — générez un CV et une lettre de motivation personnalisés en environ une minute.

Passez les filtres ATS

Résumé du poste

Bull recherche un Staff/Principal LLM Inference Engineer pour piloter la pile d'inférence BullSequana AI et son intégration hardware. Vous dirigerez des architectures d'inférence natives Kubernetes, avec du déploiement multi-nœuds et des pipelines multimodaux sur des infrastructures souveraines sur site, cloud ou hybride.

Le rôle combine leadership technique et travail hands-on, en collaboration avec Data, IA, Foundation et le hardware, visant à réduire le coût par token et la latence tout en

Qualifications

  • Expérience solide (7+ ans) en ingénierie et serving ML/AI en production.
  • Maîtrise des plateformes de serving natives Kubernetes et d'inférence distribuée.
  • Connaissance approfondie des architectures de modèles open-weight et leur impact.
  • Capacité à communiquer en anglais à l'écrit et à l'oral.

Responsabilités

  • Concevoir et optimiser une plateforme de serving basée sur vLLM et llm-d.
  • Gérer le cycle de vie des modèles et les pipelines multimodaux (audio, STT, TTS, OCR).
  • Instrumenter le serving avec Prometheus et Grafana et mener des benchmarks.
  • Apporter le dimensionnement et le soutien avant-vente.

Connaissances

Python avancé
Go
Kubernetes
vLLM
llm-d
SGLang
TensorRT-LLM
NVIDIA Dynamo
Docker
Prometheus
Grafana

Outils

Kubernetes
Docker
Helm
KServe
llm-d
SGLang
TensorRT-LLM
NVIDIA Dynamo

Description du poste

Bull recherche un Staff/Principal LLM Inference Engineer pour piloter la pile d'inférence BullSequana AI et son intégration hardware. Vous dirigerez des architectures d'inférence natives Kubernetes, avec du déploiement multi-nœuds et des pipelines multimodaux sur des infrastructures souveraines sur site, cloud ou hybride.

Le rôle combine leadership technique et travail hands-on, en collaboration avec Data, IA, Foundation et le hardware, visant à réduire le coût par token et la latence tout en

Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez votre fichier ici.
Similar jobs

Postes similaires à comparer

Principal LLM Inference Engineer Architecting Sovereign AI
Principal LLM Inference Engineer Architecting Sovereign AI

Atos • Valbonne

Sur place
EUR 120 000 - 190 000
Senior LLM Inference & Serving Architect
Senior LLM Inference & Serving Architect

Atos • Bezons

Sur place
EUR 120 000 - 160 000
Principal LLM Inference Architect for Sovereign AI
Principal LLM Inference Architect for Sovereign AI

Atos SE • Bordeaux

Sur place
EUR 120 000 - 180 000
Staff LLM Inference Engineer — Sovereign AI Platform
Staff LLM Inference Engineer — Sovereign AI Platform

Bull • Bezons

Sur place
EUR 110 000 - 170 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos • Valbonne

Sur place
EUR 120 000 - 190 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos • Bezons

Sur place
EUR 120 000 - 160 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos SE • Bezons

Sur place
EUR 120 000 - 190 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Bull • Bezons

Sur place
EUR 110 000 - 170 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos SE • Bordeaux

Sur place
EUR 120 000 - 180 000
Lead HPC Server Architect for Exascale AI
Lead HPC Server Architect for Exascale AI

Atos SE • Les Clayes-sous-Bois

Sur place
EUR 90 000 - 130 000