Principal LLM Inference Engineer - F/H

Atos

Valbonne

Sur place

EUR 120 000 - 190 000

Plein temps

Il y a 30 heures
Soyez parmi les premiers à postuler
Générateur de candidature

Démarquez-vous pour ce poste — générez un CV et une lettre de motivation personnalisés en environ une minute.

Passez les filtres ATS

Résumé du poste

Bull recherche un Staff / Principal LLM Inference Engineer pour piloter la pile d'inférence BullSequana AI et son intégration avec la plateforme matérielle BullSequana. Vous contribuerez à un serving LLM natif Kubernetes, déployé sur des infrastructures souveraines et hybrides, en collaboration avec Data, IA, et équipes hardware.

Le rôle allie influence architecturale et exécution hands-on, avec un impact direct sur le coût par token et la latence, tout en garantissant la fiabilité et la

Qualifications

  • Expérience 7+ ans en ingénierie ML/AI et serving d'inférences LLM en production.
  • Maîtrise des plateformes de serving natives Kubernetes et d'inférence distribuée (llm-d / Dynamo).
  • Connaissance des architectures open-weight (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma).
  • Compétences en anglais écrite et orale.

Responsabilités

  • Serving et Runtime des modèles : concevoir et optimiser la plateforme de serving basée sur vLLM; configurer le parallélisme et installer llm-d.
  • Cycle de vie et pipelines multimodaux : gérer versioning, déploiement progressif, rollback et services d'embedding/reranking.
  • Fiabilité, observabilité et benchmarking : instrumenter avec Prometheus et Grafana; canary/blue-green et benchmarks pour réduire coût par token et latence.
  • Support Avant-Vente et dimensionnement : fournir données de performance pour appels d'offres et planification.

Connaissances

7+ ans exp ML
Ingénierie ML/AI
Serving de modèles ML
Inférence distribuée
Kubernetes serving
llm-d / Dynamo
Python
Go
FastAPI
Profiling / optimisation
Prometheus / Grafana
KServe
NVIDIA/Docker/Kubernetes
Quantification FP8 / AWQ
Safetensors / MoE / Sparse Attention

Outils

Kubernetes
Docker
Helm
KServe
Prometheus
Grafana

Description du poste

A propos de Bull
Bull c’est une histoire. Un siècle d’innovation Européenne et un environnement de travail où des experts conçoivent des solutions numériques puissantes, durables et souveraines, permettant aux États et aux industries de garder la pleine maîtrise de leurs données et de leur IA.
A propos de Bull
Bull c’est une histoire. Un siècle d’innovation Européenne et un environnement de travail où des experts conçoivent des solutions numériques puissantes, durables et souveraines, permettant aux États et aux industries de garder la pleine maîtrise de leurs données et de leur IA.
Bull c’est aussi des milliers d’ingénieurs, de chercheurs, de passionnés de tech, façonnant l’avenir du calcul de haute performance, de l’IA et des technologies quantiques.
Chaque jour, nos équipes repoussent les limites du possible - des architectures HPC de nouvelle génération aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacités de bout en bout uniques, couvrant la conception matérielle, l’ingénierie logicielle, la data science et la recherche quantique.
Centrés sur l’humain et portés par l’innovation, où la collaboration s’étend à l’Europe, aux Amériques et à l’Inde, nous partageons cette même vision d’une innovation responsable et durable, avec un impact concret pour nos clients.
___________________________________
Bull recherche un(e) Staff / Principal LLM Inference Engineer au sein de l'équipe produit BSQAI pour piloter la pile d'inférence de BullSequana AI (BSQAI) et son intégration avec la plateforme matérielle BullSequana. La pile fournit un serving de LLM natif Kubernetes (modèles multi-nœuds open-weight, embedding, reranking et multimodaux), standardisé sur llm-d pour l'inférence distribuée et désagrégée, déployé sur des infrastructures d'IA souveraines sur site, sur le cloud souverain ou en hybride.
Ce poste à portée "staff-to-principal" combine une influence architecturale transversale et une direction technique concrète délivrée par de l'ingénierie hands-on, en étroite collaboration avec les équipes Data, Services IA, Agents, Foundation, ainsi que le matériel, l'avant-vente et le delivery. L'impact attendu est direct réduction mesurable du coût par token et de la latence de queue, et industrialisation de déploiements fiables et sécurisés (environnements connectés et isolés/air-gapped).
Responsabilités principales
  • Serving et Runtime des modèles Concevoir et optimiser la plateforme de serving basée sur vLLM, configurer le parallélisme selon l'architecture du modèle et l'interconnexion de l'infrastructure cible, et installer/maintenir llm-d pour l'inférence distribuée et désagrégée (préremplissage/décodage désagrégés, routage conscient du cache KV).
  • Cycle de vie et pipelines multimodaux Maîtriser le cycle de vie des modèles en plateforme (versioning, déploiement progressif, rollback) y compris en environnements isolés, et servir des pipelines multimodaux (audio temps réel, STT, TTS, OCR) ainsi que des services d'embedding et de reranking (bases vectorielles comme Milvus).
  • Fiabilité, Observabilité et Benchmarking Instrumenter la couche de serving avec Prometheus et Grafana (métriques GPU et par token, logs structurés, traçabilité), mettre en place des déploiements canary/blue-green avec portes d'évaluation automatisées, et mener des campagnes de benchmarking structurées pour suivre et réduire le coût par token et la latence de queue.
  • Support Avant-Vente et Dimensionnement Fournir des données de dimensionnement et de performance défendables pour appuyer les activités d'avant-vente, les appels d'offres et la planification de capacité.
Compétences Et Qualifications
  • Expérience Solide parcours (généralement 7+ ans d'expérience en ingénierie avec un temps significatif dédié au serving de modèles ML/AI) dans la construction et l'exploitation d'inférences LLM en production.
  • Compétences techniques clés Expérience pratique démontrée des plateformes de serving de modèles natives Kubernetes et de l'inférence distribuée (idéalement llm-d ou une pile équivalente comme Dynamo).
  • Architecture des modèles Compréhension fine des architectures de modèles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA).
  • Soft skills Capacité avérée à communiquer des idées complexes en anglais, à l'écrit comme à l'oral, face à des interlocuteurs techniques et commerciaux.
Compétences techniques et outils principaux
  • Langages et développement Python avancé (profiling, async, FastAPI) et Go.
  • Moteurs et piles d'inférence vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuées/désagrégées (préremplissage/décodage séparés, routage KV-cache).
  • Plateforme et conteneurisation Kubernetes, Docker, Helm, KServe, opérateurs GPU.
  • Matériel et infrastructures Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systèmes type NVL72.
  • Optimisation de modèles Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maîtrise des architectures de modèles (MoE, MTP, Sparse Attention, MLA).
  • Observabilité et Benchmarking Prometheus, Grafana, outils de tracing distribué, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks).
Pourquoi postuler
  • Occuper un rôle central dans la construction de l'infrastructure d'IA souveraine européenne, déployée pour des clients des secteurs public et privé à travers l'Europe.
  • Bénéficier d'un accès hands-on à une infrastructure GPU de grande échelle et de pointe (plateformes NVIDIA et AMD, BullSequana) pour le benchmarking et l'optimisation à échelle réelle.
  • Disposer d'une influence de niveau architecte sur la conception, la spécification et la commercialisation de la plateforme BullSequana AI, tout en conservant l'autonomie nécessaire pour coder et délivrer concrètement.
Pourquoi ne pas postuler ?
Vous ne devriez pas postuler si vous recherchez un poste de développement applicatif généraliste ou de recherche pure, car ce rôle exige une maîtrise technique pointue et quotidienne des contraintes bas-niveau de l'infrastructure d'inférence, de la topologie matérielle (GPU, interconnexions) et du fine-tuning de la performance à grande échelle.
Processus de recrutement
  • Entretiens avec le Talent Acquisition Business Partner (TABP)
  • Entretien avec un de nos opérationnels
  • Entrerien avec notre Head of BL
  • Entretien final avec notre HRBP
Localisation Postes rattachés aux implantations Bull / BSQAI - priorité Sophia Antipolis - La Défense.
Rémunération En ligne avec les standards du profil Staff / Principal.
Date de démarrage Dès que possible.
#Bull
___________________________________
Rejoignez notre communauté !
Ici, vos idées, votre curiosité et votre excellence technique contribuent directement à façonner la prochaine ère du calcul avancé - en créant de la valeur pour les entreprises, en accélérant le progrès scientifique et en générant un impact positif pour la société.
Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez votre fichier ici.
Similar jobs

Postes similaires à comparer

Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos • Bezons

Sur place
EUR 120 000 - 160 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos SE • Bordeaux

Sur place
EUR 120 000 - 180 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos SE • Bezons

Sur place
EUR 120 000 - 190 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Bull • Bezons

Sur place
EUR 110 000 - 170 000
Consultant - Data & AI Transformation - F/H
Consultant - Data & AI Transformation - F/H

Bull • Bezons

Hybride
EUR 45 000 - 50 000
Hybride – 3 jours au bureau
Déplacements internationaux annuels
Principal LLM Inference Engineer Architecting Sovereign AI
Principal LLM Inference Engineer Architecting Sovereign AI

Atos • Valbonne

Sur place
EUR 120 000 - 190 000
Staff LLM Inference Engineer — Sovereign AI Platform
Staff LLM Inference Engineer — Sovereign AI Platform

Bull • Bezons

Sur place
EUR 110 000 - 170 000
Principal LLM Inference Architect for Sovereign AI
Principal LLM Inference Architect for Sovereign AI

Atos SE • Bordeaux

Sur place
EUR 120 000 - 180 000
Senior LLM Inference & Serving Architect
Senior LLM Inference & Serving Architect

Atos • Bezons

Sur place
EUR 120 000 - 160 000
Manager Data & AI - Public sector - F/H
Manager Data & AI - Public sector - F/H

Bull • Bezons

Sur place
EUR 75 000 - 85 000