Transformez ce poste en entretien — un CV et une lettre de motivation conçus selon ce que cet employeur recherche.
Onyx-Conseil recherche un Ingénieur Production & SRE pour reprendre en main la chaîne d’observabilité critique et améliorer la résilience des services. Vous assurerez le maintien opérationnel de la stack Elastic, définirez les SLO/SLI et contribuerez à la réduction des escalades N3.
Vous interviendrez sur l’APM/OpenTelemetry, les dashboards et les runbooks, avec une montée en autonomie des développeurs et une approche orientée fiabilité et performance.
Pour l'un de nos clients, nous recherchons un(e) Ingénieur(e) Production & SRE afin de reprendre en main la chaîne d'observabilité existante sur un périmètre applicatif critique, l'améliorer et réduire le RUN. L'objectif est de rendre les équipes dev et support autonomes et de faire baisser durablement les escalades N3.
Maintien en conditions opérationnelles de la stack Elastic (Elasticsearch, Kibana, Logstash, Filebeat) sur tous les environnements : utilisateurs et rôles, index et ILM, upgrades, pipelines d'ingestion, alerting
Observabilité applicative : APM / OpenTelemetry, dashboards et alerting préventifs par composant critique, définition et suivi des SLO / SLI, tests de performance JMeter
Analyse de production : lecture et corrélation des logs, détection des patterns récurrents et signaux faibles (saturation, dérives de performance, capacity) pour traiter les causes avant l'incident
Post-mortems et recherche de causes racines sur les incidents majeurs, plans d'action trackés, alimentation du Problem Management
Shift-left avec le support : runbooks avec le N2, dashboards exploitables par le N1 / N2
Montée en autonomie des développeurs : pairing (lecture de logs, diagnostic), kit d'autonomie dev
Pilotage par la mesure : baseline et indicateurs (heures de support N3, taux d'escalade, MTTR, SLA applicatives, couverture d'alerting)
Contribution à la roadmap technique fiabilité et observabilité, portée en PI Planning