Senior Site Reliability Engineer (SRE) - Cloud - Remote - F/H

Scalingo

France

À distance

EUR 45 000 - 60 000

Plein temps

14 jours+

Recevez plus de réponses des employeurs

Envoyez un CV adapté au poste en quelques minutes.

Avantages offerts par ce poste

Full remote avec 1 déplacement par trimestre
Prime de télétravail
Tickets Restaurant
Mutuelle prise en charge à 100 %
Horaires flexibles

Résumé du poste

Une startup technologique en forte croissance recrute un Senior Site Reliability Engineer pour garantir la fiabilité et la performance de sa plateforme cloud. Vous serez responsable de l'encadrement de l'équipe SRE et de l'automatisation de l'exploitation. Le candidat idéal a une expertise dans les environnements cloud, des compétences en observabilité et en gestion des incidents. La position est en full remote avec des avantages tels que des primes de télétravail et des tickets restaurant.

Qualifications

  • Solide expertise des environnements cloud et infrastructures distribuées.
  • Maîtrise des pratiques d’observabilité (logs, métriques, alerting).
  • Compétences en bases de données en production : fiabilité et restauration.

Responsabilités

  • Assurer la stabilité et la résilience des systèmes en production.
  • Encadrer et former l’équipe SRE.
  • Analyser les performances et proposer des améliorations.

Connaissances

Expertise en environnements cloud
Pratiques d'observabilité
Gestion des incidents
Automatisation des environnements
Connaissance des bases de données en production

Description du poste

À propos de Scalingo

Scalingo est une startup technologique en forte croissance. Notre plateforme cloud européenne, robuste et souveraine, libère les équipes techniques des contraintes d’infrastructure, pour leur permettre de se concentrer sur ce qui compte vraiment : créer, innover et délivrer.

Notre PaaS permet de déployer et d’héberger facilement des applications web et des bases de données, sans avoir à gérer l’administration système ou l’infrastructure sous-jacente.

Nous accompagnons une grande diversité de clients — startups, scale-ups, grands groupes et institutions publiques — parmi lesquels le Ministère de l’Intérieur ou ENGIE, avec une exigence élevée en matière de fiabilité, de sécurité et de qualité de service.

Ton rôle chez Scalingo

En tant que Senior Site Reliability Engineer, tu occupes une position clé à l’interface des équipes développement, infrastructure, sécurité et support.

A terme, nous envisageons une évolution vers un rôle managérial.

Ton rôle est à la fois :

  • technique, avec un fort impact sur la fiabilité et la performance de la plateforme,
  • structurant, en faisant évoluer les pratiques et les outils SRE et al.,
  • fédérateur, en accompagnant et faisant monter en compétence une équipe SRE de 2 personnes.

Tu interviens aussi bien sur le fonctionnement quotidien de l’activité SRE que sur les projets stratégiques liés à la croissance de la plateforme. Référent ou référente technique, tu incarnes les bonnes pratiques SRE et contribues à diffuser une culture de la fiabilité, de l’automatisation et de l’excellence opérationnelle au sein de Scalingo.

Pourquoi ce rôle est essentiel
  • Garantir la stabilité, la disponibilité et la résilience des systèmes en production.
  • Anticiper les défaillances et structurer des réponses efficaces aux incidents.
  • Industrialiser et automatiser l’exploitation de la plateforme.
  • Maintenir un haut niveau de qualité de service vis-à-vis de nos clients et de nos engagements contractuels (SLA).
Leadership technique et animation de l’équipe SRE
  • Encadrer techniquement l’équipe SRE au quotidien : accompagnement, priorisation, revue des choix techniques et des implémentations.
  • Guider, former et faire monter en compétence les membres de l’équipe, en favorisant l’autonomie et la prise d’initiative.
  • Transmettre les bonnes pratiques SRE (fiabilité, observabilité, gestion d’incidents, automatisation).
  • Être moteur dans l’organisation du travail de l’équipe (processus, rituels, documentation).
  • Porter la vision technique SRE et la décliner dans les projets structurants.
Fiabilisation et amélioration continue des services
  • Analyser les performances, identifier les points de contention et proposer des améliorations pour optimiser l’utilisation des ressources et la montée en charge.
  • Définir, mettre en place et améliorer les outils d’observabilité (monitoring, métriques, logs, alerting), avec une approche proactive de la détection d’incidents.
  • Rédiger des processus d’exploitation, les maintenir et les faire évoluer.
  • Assurer une veille technologique continue afin de proposer des évolutions pertinentes de l’infrastructure.
Gestion des incidents et support
  • Assurer en partie le support client de niveau 3, en lien avec les équipes support et selon les SLA.
  • Participer activement à la gestion des incidents, ainsi qu'aux cycles d’astreintes (environ une demi‑semaine toutes les trois semaines).
  • Intervenir rapidement lors des incidents critiques afin d’en limiter l’impact et d’assurer la continuité des services.
  • Piloter et animer les rétrospectives d’incidents (post‑mortems), en identifiant les causes racines et en définissant des actions correctives durables.
  • Rédiger et publier les rapports post‑mortem à la suite des incidents majeurs.
  • Assurer la coordination et la communication de crise, en interne comme auprès des clients.
Sécurité, conformité et continuité d’activité
  • Veiller au respect des engagements de service (SLA, RPO, RTO) sur le périmètre SRE.
  • Mettre en place des indicateurs de mesure de la qualité des services (SLO).
  • Contribuer activement à la conformité ISO 27001 et HDS : respect des processus, participation aux audits internes et externes.
  • Planifier, exécuter et analyser les tests réguliers des dispositifs de continuité et de reprise d’activité (PCA/PRA).
  • Collaborer étroitement avec les équipes de développement afin d’intégrer les exigences d’exploitabilité (fiabilité, performance, sécurité opérationnelle) dès la conception.
  • Être force de proposition auprès des équipes produit et techniques sur les sujets de fiabilité, d’expérience client et des outils d’administration.
  • Contribuer à la rédaction, à la structuration et au maintien d’une documentation opérationnelle claire et à jour.
Collaboration interne et contribution transverse
  • Collaborer étroitement avec les équipes de développement afin d’intégrer les exigences d’exploitabilité dès la conception.
  • Être force de proposition auprès des équipes produit et techniques sur les sujets de fiabilité, d’expérience client et des outils d’administration.
  • Contribuer à la rédaction, à la structuration et au maintien d’une documentation opérationnelle claire et à jour.
Vos compétences

🔎 Ce que tu sais faire en arrivant :

  • Une solide expertise des environnements cloud et infrastructures distribuées, avec une culture forte de la haute disponibilité et de la fiabilité en production.
  • Une maîtrise des pratiques d’observabilité (logs, métriques, alerting) et une capacité de diagnostic structurée sur des incidents complexes.
  • Une bonne compréhension des environnements conteneurisés et de leurs enjeux opérationnels.
  • Des compétences confirmées en bases de données en production : fiabilité, sauvegardes, restauration, réplication et montée en charge.
  • Une pratique de l’Infrastructure as Code et de l’automatisation des environnements.
  • Une sensibilité aux enjeux de sécurité opérationnelle.
  • Une aisance dans l’utilisation des outils d’Intelligence Artificielle pour gagner en efficacité au quotidien.
  • Une capacité à évoluer dans des contextes complexes, changeants ou incertains, avec rigueur et fiabilité.
  • Une aisance dans la priorisation, y compris en situation d’incident.
  • Une communication claire et structurée, un goût pour la collaboration transverse et le partage des connaissances.
  • Une posture blameless, de la curiosité technique, du sang‑froid et une attention portée à l’impact utilisateur.
  • Une capacité à exercer un leadership technique, à transmettre et à faire progresser les pratiques collectives.
Avantages
  • Full remote avec 1 déplacement par trimestre (Strasbourg ou autre ville)
  • Événements d’entreprise : 1 Offsite annuel et des afterworks réguliers
  • Prime de télétravail (57,60€)
  • Ticket Restaurant (11,52 € par unité) et carte Swile avec ses avantages
  • Mutuelle prise en charge à 100 % par Scalingo (BENEFIZ)
  • Horaires flexibles en convention de forfait horaires (RTT)
  • Ordinateur portable sous Linux
  • Budget d’équipements complémentaires (participation)
Processus de recrutement
  • Call de pré‑qualification (30 min) : nous t’appelons pour te présenter l’offre et la clarifier si besoin. C’est toi qui décides si tu souhaites poursuivre l’étape suivante.
  • Test de pré‑screening (30 min) : un test standardisé de type QCM, à passer en ligne. Il nous permet d’évaluer les candidatures de manière objective, en limitant les biais de recrutement. Une note minimale est requise pour passer cette étape.
  • Test hard‑skill (quelques heures sur 7 jours) : un test technique à réaliser et à nous restituer à la date de ton choix, après avoir pris connaissance des consignes. L’objectif est d’évaluer tes compétences, tes habitudes et tes bonnes pratiques en lien avec le poste. Nous t’encouragerons à démontrer que tu sais utiliser le meilleur de l’I.A.
  • Premier entretien structuré – skill & aptitude fit (1h30) : un échange avec les membres de l’équipe impliqués dans le recrutement, pour discuter de tes compétences et de ton expérience, et évaluer leur adéquation avec le poste.
  • Second entretien structuré – culture fit & confirmation mutuelle (1h30) : un entretien avec un co‑fondateur ou un autre membre de l’équipe, afin de vérifier des deux côtés que nous avons envie de travailler ensemble.
La vie chez Scalingo

Chez Scalingo, nous sommes un acteur technologique exigeant, au service aussi bien de startups que de grandes entreprises et d’institutions publiques, sans être une méga‑corporation. Cette position nous permet de conjuguer haut niveau d’exigence technique, impact concret et environnement de travail à taille humaine.

Nous cultivons une culture du no bullshit : nous faisons ce que nous disons, nous prenons la responsabilité de nos succès comme de nos échecs, et nous privilégions des échanges honnêtes et directs. L’amélioration continue fait partie de notre ADN : nous questionnons régulièrement nos produits, nos pratiques et notre organisation pour progresser durablement.

Chez Scalingo, nous avançons ensemble. La collaboration, la confiance et le soutien mutuel sont au cœur de notre manière de travailler. Nous évitons les silos et favorisons la transparence par défaut, afin que chacun puisse comprendre les enjeux, les décisions et le travail des autres.

Nous accordons une grande importance à l’autonomie et à la responsabilité. Chacun est encouragé à prendre des initiatives, à faire des choix éclairés et à contribuer activement à l’évolution de l’entreprise, avec un cadre managérial présent et un suivi régulier.

Enfin, nous croyons fermement à l’égalité des opportunités. Nous recrutons des personnes avant des CV, valorisons la découverte des parcours et veillons à créer un environnement respectueux, inclusif et équitable pour toutes et tous.

Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez votre fichier ici.
Similar jobs

Postes similaires à comparer

Lead Site Reliability Engineer - Cloud - Remote - F/H
Lead Site Reliability Engineer - Cloud - Remote - F/H

Scalingo • France

Sur place
EUR 90 000 - 140 000
Full remote avec déplacement trimestr
Prime de télétravail
Ticket Restaurant et Swile
+2
Lead Tech Cloud / DevOps - CDI - 44
Lead Tech Cloud / DevOps - CDI - 44

Sigma Informatique • Nantes

Hybride
EUR 53 000 - 58 000
Télétravail 10 jours/mois
Remboursement transport 70%
Formation et certifications Microsoft
Responsable Data RH et Reporting Social
Responsable Data RH et Reporting Social

Scaleway • Paris

Sur place
EUR 50 000 - 70 000
Télétravail (jusqu'à 3 jours/semaine)
Repas sains disponibles sur site
Accès à une salle de sport
+1
Site Reliability Engineer (SRE) F/H
Site Reliability Engineer (SRE) F/H

NUMSPOT • Courbevoie

Sur place
EUR 55 000 - 80 000
Ingénieur / Ingénieure Infrastructures - CDI - 44
Ingénieur / Ingénieure Infrastructures - CDI - 44

Sigma Informatique • Nantes

Hybride
EUR 40 000 - 46 000
Télétravail 2 à 3 jours/semaine
RTT 12 par an
Localisation La Chapelle-sur-Erdre
+1
Site Reliability Engineer (SRE) - Network Products
Site Reliability Engineer (SRE) - Network Products

Scaleway • Bordeaux

Sur place
EUR 75 000 - 95 000
Chargé.e de Formation / Trainer - Tech
Chargé.e de Formation / Trainer - Tech

Scaleway • Paris

Sur place
EUR 40 000 - 80 000
Télétravail 3 jours par semaine
Locaux immersifs
Repas équilibrés
+5
Ingénieur / Ingénieure Infrastructures - CDI - 44
Ingénieur / Ingénieure Infrastructures - CDI - 44

Groupe Sigma • La Chapelle-sur-Erdre

Hybride
EUR 40 000 - 46 000
Télétravail 2-3 jours/semaine
RTT et cadre en heures
Remboursement transports 70%
+1
Full Stack Engineer — AI Augmented
Full Stack Engineer — AI Augmented

WeScale • Paris

Sur place
EUR 60 000 - 78 000
25 jours de congés + RTT
Mutuelle d’entreprise
Transport pris en charge 50%
+3
Software Engineer - Compute Marketplace
Software Engineer - Compute Marketplace

Scaleway • Paris

Sur place
EUR 45 000 - 65 000
Télétravail hybride
Bureaux modernes
Restauration saine
+3