SRE HPC AI Infrastructure H/F/N

OVHcloud

Lyon

On-site

EUR 90,000 - 150,000

Full time

43 hours ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

OVHcloud recherche un SRE HPC AI Infrastructure H/F/N pour piloter une équipe de 3 ingénieurs et faire évoluer notre plateforme IA interne, dédiée au training et à l’inférence.

Vous assurerez la disponibilité, la sécurité et l’optimisation des coûts, en vous appuyant sur nos datacenters et les pratiques GitOps/IaC. L’anglais est un atout dans ce cadre international et vous collaborerez étroitement avec les équipes OVHcloud en France et à l’international.

Qualifications

  • Expérience significative en conception et exploitation d’infrastructures GPU/HPC ou cloud à grande échelle.
  • Maîtrise des orchestrateurs (Kubernetes, Slurm), et des outils IaC (Terraform, Ansible).
  • Connaissances réseaux haute performance (InfiniBand, RoCE) et stockage distribué (Ceph, Lustre, S3).
  • Langages de scripting/développement: Python, Go et Bash.
  • Autonomie, travail en équipe et accompagnement des utilisateurs.
  • Bonne aisance en anglais et sens du service.

Responsibilities

  • Manager une équipe de 3 ingénieurs pour concevoir et faire évoluer l’infrastructure IA.
  • Point d’entrée unique des équipes internes (besoins, SLO, communication).
  • Gouvernance des données (cycle de vie, conformité RGPD, ISO 27001, SecNumCloud, accès).
  • Définir l’architecture cible et porter les décisions (ADR) et revues de code.
  • Piloter les SLO, capacité, budgets GPU et coûts/efficacité énergétique.
  • Encadrer les ingénieurs et assurer astreinte et escalade en cas d’incident.

Skills

GPU HPC infra
Kubernetes
Slurm
Terraform
Ansible
ArgoCD
Prometheus
Python
Go
Bash
InfiniBand RoCE
Ceph Lustre S3
Anglais

Tools

Kubernetes
Slurm
Terraform
Ansible
ArgoCD
Prometheus
Ceph
Lustre
S3 storage

Job description

SRE HPC AI Infrastructure H/F/N

Au sein de votre équipe #OneTeam
  • Intégrer l’équipe AI Infrastructure & Data au sein de la BU AI. Votre mission sera de manager une équipe de 3 ingénieurs pour concevoir, déployer, superviser, maintenir et faire évoluer notre infrastructure IA de training et d’inférence dédiée aux besoins internes.
  • Fournir aux équipes Data Science, ML Engineering et produits internes une plateforme IA performante, disponible, sécurisée et efficiente en coûts et en énergie, en vous appuyant sur nos datacenters et notre savoir-faire industriel.
  • Ces utilisateurs, vos futurs collègues, exploiteront notre infrastructure GPU, de stockage et réseau afin d’utiliser une plateforme hautement automatisée en self-service, du dataset au modèle en production.
Vos principales responsabilités
  • Manager une équipe de 3 ingénieurs pour concevoir, déployer, superviser, maintenir et faire évoluer notre infrastructure IA
  • Être le point d’entrée unique de nos équipes clientes internes (recueil des besoins, engagements de service SLO, communication)
  • Porter la gouvernance des données de la plateforme (cycle de vie, classification, conformité RGPD, ISO 27001, SecNumCloud, accès)
  • Définir et faire vivre l’architecture cible de la plateforme et porter les décisions structurantes (ADR) ainsi que les revues de code
  • Piloter les SLO, la capacité, les budgets GPU et les indicateurs de coûts et d’efficience énergétique de la plateforme
  • Apporter un leadership technique expérimenté sur les pratiques Infrastructure as Code, GitOps, CI/CD, observabilité et HA
  • Encadrer nos ingénieurs par une gestion personnalisée sur le plan du développement personnel et technique
  • Participer à l’astreinte et assurer le rôle de point d’escalade et d’interlocuteur client en cas d’incident majeur
  • Remettre constamment en question ce qui existe et explorer ce qui doit évoluer pour répondre aux besoins internes
  • Appliquer les aspects de sécurité matériel, logiciel et data sur toute la chaîne de valeur
  • Travailler en étroite collaboration avec les équipes OVHcloud en France et à l’International
Votre futur impact
Dans 6 mois
  • Vous aurez pris vos marques au sein de l’équipe AI Infrastructure & Data et du département IT.
  • Vous comprendrez l’infrastructure existante, les défis actuels liés aux workloads IA et les besoins des équipes internes.
  • Vous aurez participé à la conception des évolutions techniques, apportant votre expertise GPU/HPC et vos idées.
  • Vous aurez peut-être même commencé à prototyper ou à tester certaines solutions d’orchestration ou de stockage.
  • Vous aurez établi des relations avec les utilisateurs internes (Data Scientists, ML Engineers), recueillant leurs besoins et leurs retours sur l’infrastructure actuelle.
  • Vous aurez mis en place des boucles de feedback pour assurer une amélioration continue.
  • Vous aurez exploré les solutions du marché et les meilleures pratiques en matière d’infrastructures IA, afin de recommander des approches adaptées aux besoins d’OVHcloud.
Et dans 1 an
  • Vous aurez joué un rôle clé dans le déploiement et l’automatisation de la nouvelle infrastructure IA.
  • Vous aurez mis en place des outils et des processus (IaC, GitOps) pour assurer son bon fonctionnement, sa sécurité et sa scalabilité.
  • Vous aurez partagé votre expertise en matière d’infrastructure HPC/IA avec les équipes internes, en organisant des formations, des présentations ou des ateliers.
  • Vous aurez peut-être même contribué à des événements ou des conférences.
  • Vous aurez interagi avec la communauté de développeurs, en partageant vos connaissances, en posant des questions et en contribuant à des projets open source.
Compétences requises :
  • Vous possédez une forte expérience technique sur la conception et l’exploitation d’infrastructures GPU/HPC ou cloud à grande échelle
  • Vous maîtrisez les orchestrateurs (Kubernetes, Slurm), l’IaC (Terraform, Ansible) et les outils CI/CD / GitOps (ArgoCD, Prometheus)
  • Vous avez de solides connaissances des réseaux haute performance (InfiniBand, RoCE) et du stockage distribué (Ceph, Lustre, S3)
  • Vous maîtrisez des langages de scripting/développement tels que Python, Go et Bash
  • Vous êtes autonome et capable de travailler main dans la main avec votre équipe ainsi que les utilisateurs des services que vous proposez Vous êtes capable de vous concentrer sur les tâches techniques complexes et de vous adapter à un contexte changeant
  • Avec un grand sens du service, vous souhaitez avoir un impact positif sur vos contacts internes
  • Vous êtes ouvert sur le monde et travailler dans un contexte international en anglais est un aspect important pour vous
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

SRE HPC AI Infrastructure H/F/N
SRE HPC AI Infrastructure H/F/N

OVH GmbH • Lyon

On-site
EUR 110,000 - 140,000
Télétravail hybride
Plan d'actionnariat salarié
Subventions vacances et sport
+1
Site Reliability Engineer (F/H/N)
Site Reliability Engineer (F/H/N)

OVHcloud • Paris

On-site
EUR 70,000 - 110,000
Site Reliability Engineer (F/H/N)
Site Reliability Engineer (F/H/N)

OVH GmbH • Paris

Hybrid
EUR 70,000 - 110,000
Télétravail hybride
Plan d'actionnariat salarié
Reconnaissance ancienneté
+2
Tech Lead AI H/F/N
Tech Lead AI H/F/N

OVH GmbH • France

On-site
EUR 75,000 - 110,000
Télétravail hybride
Plan d’actionnariat salarié
Subventions vacances et sport
+4
SRE Managed Kubernetes H/F/N
SRE Managed Kubernetes H/F/N

OVH GmbH • France

Hybrid
EUR 90,000 - 130,000
Actionnariat salarié
Subventions vacances et sport
Berceau et crèche d'entreprise
+2
AI - Technical Leader H/F/N
AI - Technical Leader H/F/N

OVHcloud • Lyon

On-site
EUR 90,000 - 140,000
Team Leader Network Cloud Functions - H/F/N
Team Leader Network Cloud Functions - H/F/N

OVHcloud • Roubaix

On-site
EUR 90,000 - 130,000
Ingénieur SRE Storage & AIOps H/F/N
Ingénieur SRE Storage & AIOps H/F/N

OVH GmbH • Paris

On-site
EUR 85,000 - 120,000
Télétravail hybride
Plan d'actionnariat salarié
Reconnaissance de l'ancienneté
+6
Data Engineer - F/H/N
Data Engineer - F/H/N

OVH GmbH • Toulouse

Hybrid
EUR 54,000 - 78,000
Télétravail hybride
Actionnariat salarié
Reconnaissance ancienneté
+6
Software Engineer C/C++ - F/H/N
Software Engineer C/C++ - F/H/N

OVH GmbH • Paris

Hybrid
EUR 90,000 - 120,000
Télétravail hybride
Plan d'actionnariat salarié
Subventions vacances et sport
+3