Ce que vous ferez
Vous rejoindrez l'équipe monitoring et CMDB d'une organisation publique belge qui fournit des services IT aux administrations publiques. Votre rôle consiste à administrer, opérer et faire évoluer l'outillage de monitoring et d'observabilité, en assurant la visibilité sur l'infrastructure, les applications et les services métier.
Administration et opérations Zabbix
- Maîtriser l'environnement Zabbix : créer et maintenir les dashboards, network maps, triggers, items et templates
- Configurer et ajuster les seuils d'alerte (triggers) selon les besoins métier et techniques, y compris les user macros et dependent triggers pour réduire le bruit
- Créer et maintenir des templates de supervision réutilisables (items, macros, low-level discovery)
- Concevoir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon le cas d'usage
- Développer des scripts de découverte personnalisés (LLD) pour l'auto-découverte d'équipements et de services
- Diagnostiquer les faux positifs, alertes bruyantes et anomalies de collecte (proxy, pollers, timeouts) en collaboration avec les équipes techniques
- Assurer le suivi quotidien des alertes actives et leur qualification (incident réel versus bruit)
- Configurer et maintenir les intégrations Zabbix avec ServiceNow (création automatique d'incidents) et les outils de notification
- Administrer l'architecture Zabbix distribuée (proxies, serveurs, haute disponibilité) et assurer la performance
- Participer à l'évolution de l'architecture de supervision (proxies, intégrations SNMP v2/v3, VMware API, NetFlow, etc.)
- Réaliser des analyses de cause racine (RCA) sur des incidents complexes multi-couches (réseau, système, application, stockage) à la demande des équipes techniques
- Maîtriser le module Zabbix Services (Business Service Monitoring) : construire des arbres de services hiérarchiques, agréger les états (SLA/SLO) à partir des triggers, calculer et suivre les taux de disponibilité par service métier
- Modéliser les services applicatifs end-to-end en liant les composants techniques (hosts, triggers) aux services métier pertinents, pour une vue orientée utilisateur/métier plutôt que purement infrastructure
- Configurer les problem tags et les règles de propagation d'état pour un mapping précis entre incidents techniques et impact sur les services
- Utiliser les rapports SLA générés par le module Services pour alimenter le reporting mensuel et les revues de disponibilité
Surveillance web avec Oh Dear
- Mettre en place et maintenir la surveillance technique des sites web sur Oh Dear (disponibilité, certificats SSL, performance, uptime, broken links, mixed content)
- Configurer les alertes (email, webhooks, intégrations tierces) et vérifier quotidiennement le statut des sites surveillés
- Utiliser l'API REST Oh Dear pour l'extraction de données et l'intégration avec les outils de reporting (Power BI est un plus)
- Suivre les incidents détectés et les escalader vers les équipes concernées, avec analyse d'impact
Gestion des incidents et tickets ServiceNow
- Vérifier quotidiennement les incidents créés dans ServiceNow liés au monitoring et assurer leur qualification technique
- Traiter toutes les demandes des équipes IT arrivant via le catalogue de demandes ServiceNow et par email
- Qualifier, prioriser (selon impact/urgence) et traiter les demandes liées au monitoring reçues via ServiceNow ou email
- Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte (VMware, réseau) et la résolution des conflits d'identification
- Assurer un suivi rigoureux jusqu'à la clôture des tickets, avec documentation des actions menées
Observabilité
- Participer à l'amélioration continue de l'observabilité des services IT en combinant les informations issues du monitoring, des logs, des événements et des outils de supervision
- Contribuer à la définition et à l'évolution des indicateurs de santé, disponibilité et performance des services métier
- Corréler alertes, métriques, événements et données techniques pour faciliter l'identification rapide des causes d'incidents
- Participer à la réduction du bruit opérationnel en améliorant les règles de supervision, les seuils d'alerte et les mécanismes de corrélation
- Collaborer avec les équipes infrastructure, réseau, application et intégration pour améliorer la visibilité end-to-end des services critiques
Reporting
- Identifier les incidents récurrents et les tendances observées via les outils de monitoring et les rapports opérationnels
- Produire un rapport de monitoring mensuel (disponibilité, incidents, tendances, actions correctives, KPI/SLA) pour les parties prenantes et la direction, et sur demande
- Automatiser la production de rapports via des scripts et des API (Zabbix API, Oh Dear API, ServiceNow API) pour rendre le reporting plus fiable et plus rapide
- Construire et maintenir des tableaux de bord de gestion (Power BI est un plus, ou équivalent) pour la direction et les équipes techniques si nécessaire
Réseau, API et automatisation
- Diagnostiquer les incidents de connectivité et de collecte (SNMP, syslog, NetFlow, routage, ACL, VLAN, firewall)
- Développer et maintenir des scripts d'automatisation (Python/Bash) pour les contrôles de supervision, les scripts de découverte LLD et le traitement de données (ex. export/traitement CSV/Excel)
- Consommer et intégrer des API REST entre les différents outils de l'écosystème (Zabbix, ServiceNow, Oh Dear, Power BI si nécessaire)
- Contribuer à l'intégration applicative entre systèmes (flux de données, formats JSON/XML) pour fiabiliser la chaîne de supervision de bout en bout
- Documenter les procédures techniques et les diagnostics (diagrammes, guides opérationnels)
Culture DevOps
- Appliquer les bonnes pratiques CI/CD pour le versionnage et le déploiement des configurations de supervision (templates, tableaux de bord)
- Utiliser Git pour la gestion de versions des scripts et configurations
- Contribuer à l'automatisation de l'infrastructure de supervision via des approches Infrastructure as Code (Ansible, Terraform)
- Participer à la conteneurisation des outils de supervision (Docker) le cas échéant
- Maintenir la documentation technique et opérationnelle (wiki) et les articles de base de connaissances (KB)
- Assurer le transfert de connaissances vers les équipes de support et d'exploitation
Ce que nous recherchons
- Maîtrise de niveau expert de Zabbix (tableaux de bord, cartes, triggers, templates, LLD, macros, items)
- Expérience confirmée avec Elasticsearch (indexation, requêtes, exploitation de données de log/métriques)
- Expérience confirmée avec ServiceNow (gestion de tickets/incidents, idéalement connaissance de la CMDB)
- Expérience confirmée avec la consommation d'API et l'intégration d'API REST (authentification, tokens/Bearer, pagination, webhooks) pour interconnecter les outils de supervision
- Expérience confirmée avec le scripting et l'automatisation : maîtrise de Python et/ou Bash pour automatiser les contrôles, rapports et tâches récurrentes, capacité à écrire des scripts de diagnostic et des scripts de découverte LLD
- Expérience confirmée avec le réseau : maîtrise solide des protocoles et architectures (SNMP v2/v3, syslog, NetFlow, TCP/IP, routage, VLAN, firewall), capacité à diagnostiquer les problèmes de connectivité et de collecte (ACL, ACI, SD-WAN, VPN)
- Compréhension confirmée de l'intégration ESB/applicative : bonne compréhension des architectures d'intégration orientées services et des mécanismes d'échange de données (REST API, webhooks, JSON/XML, bus d'intégration)
- L'expérience avec Oh Dear ou un outil de surveillance web équivalent est un plus
- L'expérience avec l'automatisation des workflows de supervision (auto-remédiation, génération automatique de rapports, intégrations API entre outils) est un plus
- Français natif ou courant
- Connaissance passive du néerlandais
- L'anglais est un plus
Le contexte
Cette mission s'étend du 15 octobre 2026 au 13 décembre 2028 (26 mois). Vous travaillerez en mode hybride avec un minimum de 50% de présence sur site à Bruxelles. La mission se déroule exclusivement en français.
Vous pouvez réaliser cette mission en freelance ou en tant que salarié de HumanInTech. Même rôle, même équipe. Si vous nous rejoignez en tant que salarié, votre contrat de travail se poursuit au-delà de cette mission. À son terme, nous chercherons ensemble votre prochaine mission.
Lieu: Bruxelles, hybride
Employeur / cocontractant: HumanInTech
Candidatures avant (heure de Bruxelles): 30 septembre 2026 à 02:00
Statut: Freelance ou salarié chez HumanInTech
Temps de travail: Temps plein
Expérience: 3–5 ans ou plus
Formation: Bachelier ou plus
Publiée le: septembre 2026