Ingénieur Observabilité / SRE H/F

Devoteam

Occitanie

Sur place

EUR 60 000 - 90 000

Plein temps

14 jours+
Générateur de candidature

N’envoyez pas un CV générique — générez un CV et une lettre de motivation adaptés à ce poste précis.

Passez les filtres ATS

Résumé du poste

Devoteam recherche un ingénieur SRE/DevOps pour assurer la fiabilité et l’évolutivité des systèmes en production. Vous collaborerez avec les équipes de développement et d’opérations, et contribuerez à la mise en place d’infrastructures en tant que code et de pipelines GitOps.

Le candidat idéal maîtrise les clouds publics (AWS/GCP/Azure), les outils d’observabilité (Prometheus, Grafana, ELK, Datadog) et les pratiques CI/CD, avec une forte orientation qualité et incident management.

Qualifications

  • Expérience en administration système et DevOps/architecture orientée SRE.
  • Maîtrise des clouds publics (AWS/GCP/Azure).
  • Connaissance des pratiques IaC et automation (Terraform/Ansible).
  • Maîtrise des outils CI/CD et GitOps (GitLab, GitHub, FluxCD, ArgoCD).
  • Solides compétences en observabilité (Prometheus, Grafana, ELK, Datadog).
  • Scripting (Python, Bash, NodeJS).
  • Connaissance DBA Oracle et gestion de version Git.

Responsabilités

  • Assurer fiabilité, performance et évolutivité des systèmes de production.
  • Surveiller les services et définir SLOs; gérer incidents et RCA/post-mortems.
  • Automatiser les tâches et maintenir l'infrastructure en tant que code (IaC).
  • Mettre en œuvre pipelines CI/CD et pratiques GitOps.
  • Mettre en place et gérer les outils de surveillance et d'observabilité.
  • Collaborer étroitement avec les équipes développement et opérations; promouvoir une culture blameless.

Connaissances

Linux admin
Cloud platforms
Terraform
Ansible
CI/CD
GitOps
Prometheus
Grafana
ELK
Datadog
Oracle DB
Python
Bash
NodeJS
SRE concepts
Incident management

Description du poste

Vos missions
Vos objectifs
  • Assurer la fiabilité, la performance et l'évolutivité des systèmes de production.
  • Collaborer étroitement avec les équipes de développement et d'opérations pour mettre en œuvre les meilleures pratiques SRE et réduire le \"toil\" (travail manuel répétitif).
Fiabilité des Systèmes
  • Surveiller et gérer la fiabilité des services et applications en production.
  • Définir et maintenir les indicateurs clés de performance (KPIs) et les objectifs de niveau de service (SLOs).
  • Répondre aux incidents, mener des analyses de causes profondes (RCA) et rédiger des post-mortems.
Automatisation et Infrastructure
  • Automatiser les tâches manuelles et répétitives pour réduire le \"toil\".
  • Développer et maintenir l'infrastructure en tant que code (IaC) avec des outils comme Terraform et Ansible.
  • Mettre en œuvre et gérer des pipelines CI/CD et des pratiques GitOps.
Observabilité et Surveillance
  • Mettre en place des outils de surveillance et d'observabilité (par exemple, Prometheus, Grafana, ELK, Datadog).
  • Surveiller les \"quatre signaux d'or\" : latence, trafic, erreurs et saturation.
  • Configurer des alertes et des notifications pour les incidents potentiels.
Collaboration et Communication
  • Travailler en étroite collaboration avec les équipes de développement et d'opérations.
  • Promouvoir une culture \"blameless\" (sans culpabilité) pour l'analyse des incidents et l'apprentissage.
  • Communiquer efficacement avec les parties prenantes sur les questions de fiabilité et de performance.
Vos atouts pour nous rejoindre
  • Expérience en administration système (SysAdmin/SysOps) avec une orientation vers l'architecture.
  • Expérience en développement ou DevOps avec une orientation vers l'architecture.
  • Expérience en production.
Compétences Techniques
  • Systèmes d'Exploitation: Linux (administration).
  • Cloud Computing: AWS, GCP, Azure.
  • Automatisation et Configuration: Ansible, Terraform, Puppet, Chef, SaltStack.
  • Scripting: Python, Bash, NodeJS.
  • CI/CD et GitOps: GitLab, GitHub, FluxCD, ArgoCD.
  • Observabilité et Surveillance: Prometheus, Grafana, ELK, DataDog.
  • Bases de Données: Connaissance de DBA Oracle.
  • Versioning: GIT.
Compétences Fonctionnelles
  • Compréhension des principes et pratiques SRE.
  • Connaissance des différences entre SRE et DevOps.
  • Capacité à mesurer et gérer la performance et la fiabilité des services.
  • Expérience dans la gestion des incidents et la rédaction de post-mortems.
  • Aptitude à identifier et réduire le \"toil\".
  • Esprit d'équipe et capacité à collaborer efficacement.
  • Ouverture d'esprit et volonté d'apprendre de nouvelles technologies et méthodes.
  • Force de persuasion.
  • Mentalité axée sur la qualité de service (QoS).
  • Esprit d'équipe et responsabilité collective.

Le Groupe Devoteam oeuvre pour l'égalité des chances, pour la promotion de ses collaboratrices et de ses collaborateurs au mérite et lutte activement contre toute forme de discrimination. Nous sommes convaincus que la diversité contribue à la créativité, au dynamisme et à l'excellence de notre organisation. Chaque candidature est donc considérée indépendamment de tout critère discriminatoire

Obtenez votre examen gratuit et confidentiel de votre CV.

ou faites glisser et déposez votre fichier ici.

Similar jobs

Postes similaires à comparer

Ingénieur Observabilité / SRE H/F
Ingénieur Observabilité / SRE H/F

Devoteam • Toulouse

Sur place
EUR 70 000 - 100 000
Ingénieur Observabilité / SRE - H/F
Ingénieur Observabilité / SRE - H/F

Devoteam • Levallois-Perret

Sur place
EUR 65 000 - 90 000
AI-Driven Company
Learning Company
50 Tribes d'expertise
SRE (Site Reliability Engineer) - H/F
SRE (Site Reliability Engineer) - H/F

Devoteam • Île-de-France

Sur place
EUR 80 000 - 120 000
Site Reliability Engineer & AI SRE (F/H)
Site Reliability Engineer & AI SRE (F/H)

SmartRecruiters, Inc. • Levallois-Perret

Sur place
EUR 90 000 - 130 000
Site Reliability Engineer & AI SRE (F/H)
Site Reliability Engineer & AI SRE (F/H)

Devoteam • Levallois-Perret

Sur place
EUR 90 000 - 130 000
Site Reliability Engineer (SRE) F/H
Site Reliability Engineer (SRE) F/H

NUMSPOT • Courbevoie

Sur place
EUR 55 000 - 80 000
SRE / Observability Engineer F/H
SRE / Observability Engineer F/H

Meilleurtaux SA • France

Hybride
EUR 70 000 - 110 000
Primes individuelles et collectives
Mutuelle ALAN
Carte SWILE
+3
Ingénieur(e) DevOps/SRE - Digital Platform Services - Nantes
Ingénieur(e) DevOps/SRE - Digital Platform Services - Nantes

Sopra Steria USA • Saint-Herblain

Sur place
EUR 65 000 - 90 000
Mutuelle
CSE
Titres-restaurants
+3
Ingénieur(e) DevOps/SRE - Digital Platform Services - Nantes
Ingénieur(e) DevOps/SRE - Digital Platform Services - Nantes

Sopra Steria • Saint-Herblain

Hybride
EUR 70 000 - 100 000
Mutuelle
CSE
Tickets restaurants
+3
Ingénieur – Fiabilité des Sites (SRE)
Ingénieur – Fiabilité des Sites (SRE)

Jobtailor • Toulouse

Sur place
EUR 70 000 - 95 000