Recevez plus de réponses des employeurs
Envoyez un CV adapté au poste en quelques minutes.
SPIE ICS recherche un Expert Kubernetes / IA à Fontenay-aux-Roses. Le poste couvre la disponibilité, la performance et la stabilité du cluster IA, l’exploitation automatisée et le support, ainsi que la gestion des nœuds GPU/CPU, du stockage et du réseau.
Le candidat doit être certifié Kubernetes et justifier d’au moins 8 ans d'expérience, avec maîtrise Prometheus, Grafana et Ansible. CDI; salaire brut annuel 40 000–70 000 EUR selon profil.
Référenceur / Référenceuse web (H/F) 92 - Fontenay-aux-Roses
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F).Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support.Vos missions :Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des n?uds GPU/CPU, du stockage et du réseau.Administration des systèmes Linux : installation, configuration et optimisation.Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA).Supervision et monitoring des infrastructures à l?aide d?outils tels que Prometheus et Grafana.Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs.Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python.Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités.Pilotage des mises à jour des systèmes d?exploitation, des pilotes NVIDIA et des composants Kubernetes.Gestion des incidents liés à l?infrastructure et coordination des interventions.Rédaction et mise à jour de la documentation d?exploitation pour assurer la traçabilité et la continuité des opérations.Profil recherchéVous êtes certifié Kubernetes, justifiez d?une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants :Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués.Observabilité : Prometheus, GrafanaStockage : systèmes de fichiers distribués, stockage haute performance et stockage objetRéseau : comprendre l?architecture réseau d?un cluster (VLAN, Load balancing...)Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d?exploitation.
Type de contrat CDI
Contrat travail Salaire