Une candidature complète en une minute — un CV et une lettre de motivation personnalisés, prêts à être envoyés.
Bull recherche un(e) Staff/Principal LLM Inference Engineer pour piloter la pile d'inférence BullSequana AI et son intégration avec la plateforme matérielle BullSequana. Vous dirigerez techniquement l'ingénierie hands-on, en étroite collaboration avec Data, IA, et les équipes matériel et delivery.
Ce rôle exige une expertise avancée en serving de modèles ML/AI, une forte expérience en architectures distribuées et une capacité à influencer l'architecture produit tout en livrant des résultats
Sélectionnez la fréquence (en jours) de réception d’une alerte:
Bull c’est une histoire. Un siècle d’innovation Européenne et un environnement de travail où des experts conçoivent des solutions numériques puissantes, durables et souveraines, permettant aux États et aux industries de garder la pleine maîtrise de leurs données et de leur IA.
Bull c’est aussi des milliers d’ingénieurs, de chercheurs, de passionnés de tech, façonnant l’avenir du calcul de haute performance, de l’IA et des technologies quantiques.
Chaque jour, nos équipes repoussent les limites du possible - des architectures HPC de nouvelle génération aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacités de bout en bout uniques, couvrant la conception matérielle, l’ingénierie logicielle, la data science et la recherche quantique.
Centrés sur l’humain et portés par l’innovation, où la collaboration s’étend à l’Europe, aux Amériques et à l’Inde, nous partageons cette même vision d’une innovation responsable et durable, avec un impact concret pour nos clients.
Bull recherche un(e) Staff / Principal LLM Inference Engineer au sein de l'équipe produit BSQAI pour piloter la pile d'inférence de BullSequana AI (BSQAI) et son intégration avec la plateforme matérielle BullSequana. La pile fournit un serving de LLM natif Kubernetes (modèles multi-nœuds open-weight, embedding, reranking et multimodaux), standardisé sur llm-d pour l'inférence distribuée et désagrégée, déployé sur des infrastructures d'IA souveraines sur site, sur le cloud souverain ou en hybride.
Ce poste à portée "staff-to-principal" combine une influence architecturale transversale et une direction technique concrète délivrée par de l'ingénierie hands-on, en étroite collaboration avec les équipes Data, Services IA, Agents, Foundation, ainsi que le matériel, l'avant-vente et le delivery. L'impact attendu est direct : réduction mesurable du coût par token et de la latence de queue, et industrialisation de déploiements fiables et sécurisés (environnements connectés et isolés/air-gapped).
Occuper un rôle central dans la construction de l'infrastructure d'IA souveraine européenne, déployée pour des clients des secteurs public et privé à travers l'Europe.
Bénéficier d'un accès hands‑on à une infrastructure GPU de grande échelle et de pointe (plateformes NVIDIA et AMD, BullSequana) pour le benchmarking et l'optimisation à échelle réelle.
Disposer d'une influence de niveau architecte sur la conception, la spécification et la commercialisation de la plateforme BullSequana AI, tout en conservant l'autonomie nécessaire pour coder et délivrer concrètement.
Vous ne devriez pas postuler si vous recherchez un poste de développement applicatif généraliste ou de recherche pure, car ce rôle exige une maîtrise technique pointue et quotidienne des contraintes bas‑niveau de l'infrastructure d'inférence, de la topologie matérielle (GPU, interconnexions) et du fine‑tuning de la performance à grande échelle.
Postes rattachés aux implantations Bull / BSQAI - priorité Sophia Antipolis - La Défense.
En ligne avec les standards du profil Staff / Principal.
Dès que possible.
Ici, vos idées, votre curiosité et votre excellence technique contribuent directement à façonner la prochaine ère du calcul avancé - en créant de la valeur pour les entreprises, en accélérant le progrès scientifique et en générant un impact positif pour la société.