Convierte este puesto en una entrevista — un currículum y una carta de presentación creados pensando en lo que quiere el empleador.
NumSpot recherche un Senior SRE pour piloter la fiabilité et l'évolution d'une plateforme cloud souveraine en production. Vous travaillerez en binôme avec le Head of IT Operations et gérerez le design, le run et l’amélioration continue des services.
Vous opérez des systèmes distribués natifs cloud, avec Kubernetes, IaC et GitOps, en assurant haute disponibilité, sécurité et performance. Poste basé en Île-de-France, proche Courbevoie.
Senior SRE de la squad et bras droit technique du Head of IT Operations : vous concevez, vous déployez, vous diagnostiquez en production et décidez des standards qui font tenir les services. Numspot est la plateforme cloud souveraine française portée par Banque des Territoires, Docaposte, Dassault Systèmes et Bouygues Telecom. Vous évoluez dans une squad de 6 à 8 ingénieurs, autonome de bout en bout sur un portefeuille de services cloud managés : design, build, run, support N3. Pas de transfert vers une équipe ops ni de ticket vers une équipe infra externe : la squad possède le cycle complet. L'environnement est distribué, conteneurisé, orchestré avec Kubernetes, et soumis à des exigences de résilience et de sécurité élevées (ISO 27001 acquis, HDS et SecNumCloud en cours). Vous travaillez en binôme étroit avec votre manager, le Head of IT Operations, profil expert et très opérationnel, sur les décisions techniques structurantes. Ce n'est pas une relation hiérarchique distante : c'est une collaboration entre deux ingénieurs seniors, l'un portant la responsabilité managériale, l'autre l'exécution et l'expertise terrain.
Vous êtes sur le terrain : vous intervenez sur les incidents, vous construisez l'infrastructure, vous passez en revue l'architecture, et vous prenez les décisions techniques quand elles comptent.
On call et incidents. Vous êtes dans la rotation et vous gérez les incidents P0/P1 de bout en bout, sans passer la main. SLO/SLA. Vous définissez les objectifs de niveau de service, vous calibrez les alertes sur l'impact réel et vous pilotez l'error budget comme un outil de décision. Observabilité actionnable. Vous construisez et maintenez les dashboards, les corrélations métriques, logs et traces, et les runbooks qui permettent de diagnostiquer en moins de 5 minutes. MCO/MCS. Vous garantissez le maintien en conditions opérationnelles et de sécurité : durcissement de configuration, mises à jour, gestion des vulnérabilités. Post mortems. Vous conduisez les analyses post incident et vous transformez les conclusions en actions concrètes dans le backlog.
IaC et GitOps. Vous écrivez et maintenez l'infrastructure as code (Terraform, Ansible, Helm, ArgoCD) : tout ce qui est déployé est reproductible et versionné. CI/CD. Vous concevez et fiabilisez les pipelines de déploiement (GitLab CI, FluxCD) : stratégies canary, blue/green, rollback automatisé. Automatisation. Toute opération manuelle récurrente devient un script, toute intervention répétée devient un service. Vous réduisez la toil systématiquement. Sécurité intégrée. IAM, gestion des secrets (Vault, Sealed Secrets), RBAC et politiques de sécurité sont intégrés dès la conception.
Conception des services. Vous êtes dans la boucle dès le design : résilience, observabilité et opérabilité sont des contraintes de premier ordre. Choix technologiques. Vous pesez sur les décisions de la squad avec des arguments factuels, des mesures et une vision à moyen terme. Standards d'exploitation. Vous définissez les pratiques de la squad (conventions IaC, patterns de résilience, politiques d'alerting) et vous les faites vivre au quotidien.
Dogfooding. Vous consommez les services de platform engineering (observabilité, CI/CD, secrets) pour valider leur qualité et remonter des retours concrets à la communauté de pratiques. Communauté de pratiques. Vous contribuez au partage de pratiques Platform Engineering et DevOps au-delà de votre squad. Mentoring opérationnel. Vous faites monter les profils junior et médior sur des cas concrets : incidents, revue IaC, diagnostic de production.
Vous avez opéré des systèmes distribués en production à grande échelle. Vous êtes aussi à l'aise sur un incident Kubernetes à 2h du matin que sur une revue d'architecture le lendemain. Vous cherchez un poste où vous agissez, pas où vous coordonnez.
Vous documentez pour que la connaissance survive à votre départ. Vous savez quand corriger vite et quand corriger bien, et vous ne laissez pas la correction rapide devenir permanente. Vous challengez les décisions techniques avec des faits, même hors de votre périmètre direct. Vous expliquez un incident P0 à un interlocuteur non technique sans perdre en précision.
Maîtrise de l'architecture des services de la squad : dépendances, flux critiques, points de fragilité. Cartographie des angles morts d'observabilité, des alertes non actionnables et de la dette d'exploitation. Premières actions concrètes : dashboards, alerting amélioré, runbooks mis à jour. Première rotation on call, avec intervention sur des incidents réels.
SLO définis et pilotés sur le périmètre de la squad, alerting calibré, error budget actif. Réduction mesurable du bruit d'alerting et amélioration du MTTR. Standards IaC et GitOps durcis et adoptés dans la squad. Incidents P0/P1 gérés de bout en bout avec post mortems structurés.
Référent technique fiabilité de la squad. Chantiers structurants pilotés : résilience, capacity planning, sécurité opérationnelle. Contribution active à la communauté de pratiques au-delà de la squad. Binôme opérationnel établi avec le Head of IT Operations : vous assurez la continuité des décisions techniques en son absence et vous co-pilotez les chantiers structurants.
Vous opérez une infrastructure critique pour la souveraineté numérique européenne : les problèmes sont réels, les enjeux aussi. Votre squad possède le cycle complet du design au run : pas de silo ops, pas de ticket vers une équipe externe. Vous construisez ce que vous opérez. Organisation jeune (créée en 2023, environ 80 personnes) : vos décisions techniques ont un impact immédiat et visible sur le produit. Le contexte de certification (HDS, SecNumCloud en cours) développe une expertise rare et valorisée sur le marché. Stack cloud native open source sur des environnements hybrides et bare metal.