MLOps Engineer (H/F/X)

Shadow

Paris

Sur place

EUR 100 000 - 140 000

Plein temps

Il y a 3 jours
Soyez parmi les premiers à postuler
Générateur de candidature

Démarquez-vous pour ce poste — générez un CV et une lettre de motivation personnalisés en environ une minute.

Passez les filtres ATS

Résumé du poste

Shadow recherche un Senior MLOps Engineer pour concevoir et opérer l'infrastructure qui alimente notre ligne de produits AI managés. Vous assurerez le déploiement, le scaling et l'observabilité des modèles d'inférence sur GPU dans un contexte multi‑tenant.

Vous apportez une expertise MLOps/SRE et serez un acteur clé du bootstrap, avec autonomie et esprit produit pour influencer l'architecture et mentorer l'équipe.

Qualifications

  • Expertise confirmée du serving et des frameworks d'inférence AI (vLLM, TensorRT-LLM, Triton, TGI, SGLang ou équivalents).
  • Solide expérience MLOps/SRE : CI/CD de modèles, registry, déploiement et production à grande échelle.
  • Maîtrise des environnements GPU (CUDA, scheduling, multi-tenancy, MIG/vGPU).
  • Aisance avec Kubernetes et les conteneurs ; connaissance de QEMU/KVM et virtualization.
  • Connaissance de l’Infrastructure as Code et GitOps (Terraform, Ansible, ArgoCD ou équivalents).
  • Capacité à mettre en œuvre l’observabilité (Prometheus, Grafana, tracing, logging) et à définir des SLO/SLA.
  • Maîtrise de Python ; connaissances en Go, Rust ou C++ considérées comme un fort atout.
  • Capacité à coder, debugger, profiler et livrer du hands-on.
  • Connaissance du marché de l’inférence managée et des produits concurrents.
  • Ownership fort : prise en charge de systèmes critiques et fiabilité bout en bout.
  • Esprit produit : prioriser, trancher et faire le pont entre ingénierie et business.
  • Capacité à articuler une réflexion technique et à débattre lors de décisions collectives.
  • Savoir définir des standards techniques et influencer les choix d’architecture.
  • Mentorat et feedback pour faire monter l’équipe en maturité.
  • Autonomie, proactivité et orientation solutions.
  • Confort dans un contexte de bootstrap : passer du code à la stratégie rapidement.
  • Bonne communication orale et écrite.
  • Bonne collaboration avec les équipes Foundations, Engine, Produit et Business.

Responsabilités

  • Concevoir, implémenter et opérer les pipelines de déploiement et de serving des modèles d'inférence (CI/CD, model registry, rollout).
  • Construire et exploiter le moteur de spot inference valorisant la capacité GPU non-utilisée en heures creuses.
  • Mettre en place l'observabilité, le monitoring et l'alerting (latence, débit, saturation GPU, SLO/SLA).
  • Optimiser l'efficience GPU : autoscaling, packing, scheduling et multi-tenancy.
  • Automatiser le provisioning et la configuration de l'infrastructure (IaC, GitOps).
  • Assurer le maintien en condition opérationnelle (MCO), la gestion des incidents et l'amélioration continue de la fiabilité (SRE).
  • Définir les standards MLOps, mentorner les contributeurs et diffuser les meilleures pratiques.
  • Collaborer avec Foundations, Engine, Produit et Business pour livrer la roadmap.

Description du poste

Dans le cadre de la stratégie de l'entreprise, le/la Senior MLOps Engineer construit et opère l'infrastructure et les plateformes qui font tourner notre nouvelle ligne de produits AI managés (l'inférence en tête), en s'appuyant sur les dizaines de milliers de GPU dont dispose Shadow.

Nos heures creuses sont les heures pleines des entreprises B2B : nos GPU, principalement sollicités la nuit par nos gamers, représentent une forte capacité de calcul que nous voulons valoriser pour devenir un leader du spot inference.

Le/la Senior MLOps Engineer est garant(e) de la fiabilité, de la performance et de l'efficience (coût/GPU) des systèmes de mise en production des modèles : pipelines de déploiement, scaling, observabilité, et automatisation de bout en bout. Il/elle apporte une expertise senior sur l'exploitation à grande échelle de charges d'inférence sur GPU en environnement multi-tenant.

Le poste est hands-on et à fort impact : concevoir et implémenter les fondations MLOps, mais aussi établir les standards, mentorer les contributeurs et influencer les choix d'architecture aux côtés du Head of PaaS. Dans un contexte de bootstrap, l'autonomie, le sens de l'ownership et la capacité à trancher techniquement sont déterminants.

Rattaché(e) au Head of PaaS, il/elle veille à la bonne mise en œuvre des processus, des méthodes et des niveaux d'exigence fixés globalement pour toutes les équipes, et participe à la vie de l'Engineering avec les autres contributeurs et équipes.

Dans ce rôle :

  • Vous concevrez, implémenterez et opérerez les pipelines de déploiement et de serving des modèles d'inférence (CI/CD, model registry, rollout).
  • Vous construirez et exploiterez le moteur de spot inference valorisant la capacité GPU non-utilisée en heures creuses.
  • Vous mettrez en place l'observabilité, le monitoring et l'alerting (latence, débit, saturation GPU, SLO/SLA).
  • Vous optimiserez l'efficience GPU : autoscaling, packing, scheduling et multi-tenancy.
  • Vous automatiserez le provisioning et la configuration de l'infrastructure (IaC, GitOps).
  • Vous assurerez le maintien en condition opérationnel (MCO), la gestion des incidents et l'amélioration continue de la fiabilité (SRE).
  • Vous définirez les standards MLOps, mentorerez les contributeurs et diffuserez les bonnes pratiques.
  • Vous collaborerez étroitement avec les équipes Foundations, Engine, Produit et Business pour livrer la roadmap
Profil recherché

Vous ne vous reconnaissez pas à 100 % dans les critères ci-dessous ? Aucun problème, envoyez quand même votre CV ! Tous les critères ne sont pas éliminatoires : votre passion, votre curiosité et votre motivation nous aideront à vous faire grandir

  • Vous disposez d'une expertise confirmée du serving et des frameworks d'inférence AI (vLLM, TensorRT-LLM, Triton, TGI, SGLang ou équivalents).
  • Vous justifiez d'une solide expérience MLOps/SRE : CI/CD de modèles, model registry, déploiement, rollback et gestion de production à grande échelle.
  • Vous maîtrisez en profondeur les environnements GPU (CUDA, scheduling, multi-tenancy, MIG/vGPU).
  • Vous êtes à l'aise avec Kubernetes et les conteneurs ; idéalement QEMU/KVM et des notions de virtualisation.
  • Vous connaissez bien l'Infrastructure as Code et le GitOps (Terraform, Ansible, ArgoCD ou équivalents).
  • Vous savez mettre en œuvre l'observabilité (Prometheus, Grafana, tracing, logging) et définir des SLO/SLA.
  • Vous maîtrisez Python ; la connaissance d'un autre langage système (Go, Rust, C++) est un fort atout.
  • Vous êtes capable de coder, debugger, profiler et livrer concrètement (hands‑on).
  • Vous connaissez le marché de l'inférence managée et des produits concurrents.
  • Vous avez un ownership fort : capable de vous approprier des systèmes critiques et d'en garantir la fiabilité de bout en bout.
  • Vous avez l'esprit produit : vous savez prioriser, trancher et faire le pont entre l'ingénierie et le business.
  • Vous savez articuler une réflexion technique, l'illustrer par des analyses et débattre lors de prises de décision collectives.
  • Vous êtes en mesure de définir des standards techniques et d'influencer les choix d'architecture.
  • Vous aimez mentorer, donner du feedback et accompagner la montée en maturité de l'équipe.
  • Vous êtes autonome, proactif et orienté solutions.
  • Vous êtes à l'aise dans un contexte de bootstrap : capable de passer du code à la stratégie dans la même journée.
  • Vous communiquez avec aisance, à l'oral comme à l'écrit.
  • Vous collaborez fortement avec les autres équipes en position de facilitateur.
Déroulement des entretiens

Nous vous proposons un premier échange téléphonique de 30 minutes avec un membre de l’équipe RH, pour faire connaissance et vous présenter le poste.

Si ce premier échange est concluant, nous organisons ensuite :

  • Un entretien technique et culturel (1h) avec notre Head of PaaS.
  • Un entretien (1h00) - avec deux membres de notre équipe
  • Entretien final dans nos locaux (30 min) - Avec notre CTO et une rencontre
Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez votre fichier ici.
Similar jobs

Postes similaires à comparer

MLOps Engineer (H/F/X)
MLOps Engineer (H/F/X)

Shadow • Paris

Hybride
EUR 90 000 - 130 000
Head of Platform (F/H/X)
Head of Platform (F/H/X)

Shadow • Paris

Sur place
EUR 150 000 - 210 000
Staff Engineer — Data & Cloud Infrastructure
Staff Engineer — Data & Cloud Infrastructure

QuantCube Technology • Paris

Sur place
EUR 70 000 - 90 000
Machine Learning Engineer
Machine Learning Engineer

Arkane Cloud • Lyon

Sur place
EUR 70 000 - 120 000
Mutuelle à 100%
Tickets Restaurant
RTT
Senior Machine Learning Engineer
Senior Machine Learning Engineer

Aive • Paris

Sur place
EUR 90 000 - 130 000
Consultant Senior MLOPS Engineer
Consultant Senior MLOPS Engineer

Talan Group • Paris

Hybride
EUR 50 000 - 70 000
Télétravail jusqu’à 5 jours
Tickets restaurant
Prime vacances
+2
Tech Lead AI H/F/N
Tech Lead AI H/F/N

OVH GmbH • France

Hybride
EUR 75 000 - 110 000
Télétravail hybride
Plan d’actionnariat salarié
Subventions vacances et sport
+4
AI Engineer
AI Engineer

Galadrim • Paris

Sur place
EUR 65 000 - 100 000
Transport
Mutuelle
Tickets restaurant
+2
[HealthTech] Hopia - CDI - Senior Software Engineer
[HealthTech] Hopia - CDI - Senior Software Engineer

Hopia • Paris

Hybride
EUR 60 000 - 80 000
BSPCE
Mac pro
Télétravail flexible
+4
Ingenieur DevOps Plateforme GPU - F/H
Ingenieur DevOps Plateforme GPU - F/H

Groupe Avanista • France

Hybride
EUR 70 000 - 100 000