Une candidature complète en une minute — un CV et une lettre de motivation personnalisés, prêts à être envoyés.
Onyx-Conseil recherche un expert en incidents N2/N3 pour assurer la stabilité et la disponibilité des applications. Vous diagnostiquerez les dysfonctionnements via logs et code, proposerez et parfois implémenterez des correctifs, et collaborerez étroitement avec les équipes métiers et de développement.
Vous optimiserez l'observabilité, participerez à la réduction de la dette technique et maintiendrez la documentation des résolutions dans la Knowledge Base.
L'objectif principal de ce rôle est d'assurer la stabilité et la disponibilité des applications en intervenant sur les incidents de niveau 2 et 3. Vous serez le pont entre les équipes métiers/utilisateurs et les équipes de développement. Votre mission sera de diagnostiquer l'origine des dysfonctionnements en analysant le code et les logs, et de proposer (ou implémenter) des correctifs.
Analyse et résolution d'incidents
Diagnostic technique : analyse des remontées d'incidents, reproduction des bugs et identification de la cause racine (Root Cause Analysis).
Analyse de logs : exploration des fichiers de logs, des traces d'erreurs et des outils de monitoring pour l'isolation du composant défaillant.
Débogage : analyse du code source pour la compréhension des comportements anormaux.
Résolution : application de correctifs d'urgence (hotfixes) et élaboration de spécifications techniques destinées à l'équipe de développement pour la correction des bugs.
Maintenance et amélioration
Optimisation : identification des erreurs récurrentes et proposition d'améliorations de code pour la réduction de la dette technique et du nombre d'incidents.
Observabilité : amélioration de la stratégie de logging (ajout de logs pertinents) pour la facilitation des diagnostics futurs.
Documentation : rédaction et mise à jour de la base de connaissances (Knowledge Base) pour la capitalisation des résolutions d'incidents.
Coordination
Interface technique : communication avec les équipes de développement pour le déploiement des correctifs.
Suivi : suivi des tickets d'incidents jusqu'à leur clôture complète.