Senior LLM Inference & Serving Architect

Atos

Bezons

Sur place

EUR 120 000 - 160 000

Plein temps

Il y a 38 heures
Soyez parmi les premiers à postuler
Générateur de candidature

N’envoyez pas un CV générique — générez un CV et une lettre de motivation adaptés à ce poste précis.

Passez les filtres ATS

Résumé du poste

Bull recherche un(e) Staff / Principal LLM Inference Engineer pour piloter la pile d'inférence de BullSequana AI (BSQAI) et son intégration avec la plateforme matérielle. Vous dirigerez l’ingénierie d’inférence LLM en production, en étroite collaboration avec Data, IA Services et le hardware.

Le poste requiert une expertise en serving natif Kubernetes, en architectures distribuées et en pipelines multimodaux, avec un impact direct sur coût par token et latence.

Qualifications

  • Expérience 7+ ans en ingénierie ML/AI et serving d'inférences LLM en production.
  • Connaissance pratique des plateformes de serving natives Kubernetes et d'inférence distribuée.

Responsabilités

  • Serving et Runtime des modèles: concevoir et optimiser la plateforme de serving basée sur vLLM, configurer le parallélisme et installer llm-d pour l'inférence distribuée.
  • Cycle de vie et pipelines multimodaux: gestion du versioning, déploiement progressif et services d'embedding et de reranking.
  • Fiabilité et observabilité: instrumentation Prometheus/Grafana, déploiements canary/blue-green et benchmarking pour coût par token et latence.
  • Support Avant-Vente et dimensionnement: fournir données de performance pour appels d'offres et planification de capacité.

Connaissances

Python avancé
Go
Anglais technique

Formation

Master en informatique/ML

Outils

Kubernetes
llm-d
vLLM
TensorRT-LLM
NVIDIA Dynamo

Description du poste

Bull recherche un(e) Staff / Principal LLM Inference Engineer pour piloter la pile d'inférence de BullSequana AI (BSQAI) et son intégration avec la plateforme matérielle. Vous dirigerez l’ingénierie d’inférence LLM en production, en étroite collaboration avec Data, IA Services et le hardware.

Le poste requiert une expertise en serving natif Kubernetes, en architectures distribuées et en pipelines multimodaux, avec un impact direct sur coût par token et latence.

Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez votre fichier ici.
Similar jobs

Postes similaires à comparer

Senior LLM Inference Engineer – Distributed AI Serving
Senior LLM Inference Engineer – Distributed AI Serving

Atos SE • Bezons

Sur place
EUR 120 000 - 190 000
Principal LLM Inference Engineer Architecting Sovereign AI
Principal LLM Inference Engineer Architecting Sovereign AI

Atos • Valbonne

Sur place
EUR 120 000 - 190 000
Staff LLM Inference Engineer — Sovereign AI Platform
Staff LLM Inference Engineer — Sovereign AI Platform

Bull • Bezons

Sur place
EUR 110 000 - 170 000
Principal LLM Inference Architect for Sovereign AI
Principal LLM Inference Architect for Sovereign AI

Atos SE • Bordeaux

Sur place
EUR 120 000 - 180 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos • Valbonne

Sur place
EUR 120 000 - 190 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos • Bezons

Sur place
EUR 120 000 - 160 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos SE • Bezons

Sur place
EUR 120 000 - 190 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Bull • Bezons

Sur place
EUR 110 000 - 170 000
Principal LLM Inference Engineer - F/H
Principal LLM Inference Engineer - F/H

Atos SE • Bordeaux

Sur place
EUR 120 000 - 180 000
Principal Security Architect - H/F
Principal Security Architect - H/F

Bull • Valbonne

Sur place
EUR 110 000 - 140 000