Data Center Operations Engineer

Covestic Inc

Saint-Jérôme

On-site

CAD 70,000 - 90,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Assurance santé
Congés payés

Job summary

Covestic Inc recherche un ingénieur senior en opérations de centre de données pour soutenir le déploiement et l'exploitation de notre environnement de centre de données haute performance. Le candidat idéal doit avoir plus de 5 ans d'expérience en dépannage matériel et en systèmes Linux dans des environnements critiques.

Cette position exige une solide expertise technique, de l'autonomie et un excellent niveau de communication en anglais pour collaborer avec des équipes interfonctionnelles internationales.

Qualifications

  • Minimum 5 ans d'expérience en opérations de centre de données.
  • Expertise approfondie en dépannage de matériel serveur.
  • Minimum 2 ans d'expérience avec des systèmes Linux en production.

Responsibilities

  • Diagnostiquer et résoudre des défaillances matérielles complexes.
  • Effectuer des réparations au niveau des composants.
  • Supporter le déploiement et la configuration de serveurs Linux.

Skills

Dépannage matériel
Systèmes Linux
Analyse de cause racine
Communication en anglais

Education

Baccalauréat en ingénierie ou domaine équivalent

Tools

ServiceNow
Jira

Job description

Le Québécois:
Ingénieur senior en opérations de centre de données
Aperçu du poste:

L’ingénieur senior en opérations de centre de données joue un rôle clé et très pratique dans le déploiement et l’exploitation à long terme d’un environnement de centre de données haute performance à grande échelle, supportant du calcul avancé et des infrastructures complexes.

Ce poste s’adresse à un ingénieur expérimenté possédant une expertise approfondie en matériel serveur, systèmes Linux et opérations de centre de données, dans des environnements qui exigent une haute disponibilité, de la précision et de la performance. Tu contribueras dès la phase initiale de déploiement, en supportant la mise en service de l’infrastructure, la validation et la préparation du matériel. Par la suite, lorsque l’environnement sera en mode stable, tu prendras en charge la fiabilité continue, le dépannage avancé et les initiatives d’amélioration continue.

Ce rôle demande un solide esprit d’opération — quelqu’un qui s’épanouit dans des environnements complexes et critiques pour la production et qui met l’accent sur la résolution des problèmes à la source. Tu agiras comme principal point d’escalade technique et travailleras en étroite collaboration avec les équipes d’ingénierie et d’infrastructure pour assurer la stabilité et la performance des systèmes.

Ce poste s’exerce principalement en anglais, en raison des interactions fréquentes avec des équipes interfonctionnelles globales et de l’utilisation de documentation technique en anglais.

Ce rôle permet de couvrir à la fois les phases de déploiement et d’opérations, offrant une exposition à des environnements d’infrastructure modernes à grande échelle, ainsi qu’un chemin clair vers des rôles techniques avancés ou en ingénierie.

Responsabilités principales:
Dépannage avancé du matériel et réparations:
  • Diagnostiquer et résoudre des défaillances matérielles complexes sur différentes plateformes serveurs (cartes mères, CPU, mémoire, stockage)
  • Effectuer des réparations et remplacements au niveau des composantes
  • Exécuter les processus break/fix en minimisant les temps d’arrêt et en respectant les SLA
  • Réaliser des analyses de cause racine (RCA) et proposer des améliorations préventives
  • Identifier les tendances de défaillance et contribuer à l’amélioration des outils, de l’automatisation et des processus
Systèmes Linux et support des plateformes:
  • Utiliser les outils en ligne de commande Linux pour le monitoring, le diagnostic et le troubleshooting
  • Supporter le déploiement et la configuration de serveurs sous différentes distributions Linux (RHEL, Ubuntu, etc.)
  • Diagnostiquer les problèmes au niveau du démarrage (boot) et du système d’exploitation en environnement de production
  • Collaborer avec les équipes d’ingénierie pour résoudre des problèmes complexes matériel/logiciel
Opérations de centre de données:
  • Supporter l’installation d’équipements, le câblage structuré et la validation de l’infrastructure
  • Maintenir un inventaire précis des pièces, des actifs et des équipements retirés
  • Documenter les réparations, changements et configurations dans les outils ITSM/DCIM
  • Assurer le respect des normes de sécurité, sûreté et opérations
  • Agir comme point d’escalade principal pour les incidents complexes
  • Participer à une rotation de garde (on-call) pour un environnement 24/7
Collaboration et mentorat:
  • Offrir du coaching et du mentorat aux techniciens sur le troubleshooting matériel et les meilleures pratiques
  • Collaborer avec les équipes réseau, stockage et infrastructure pour résoudre des enjeux interfonctionnels
  • Contribuer au partage de connaissances, à la documentation et à l’excellence opérationnelle
  • Participer aux initiatives d’amélioration continue (processus, outils, pratiques opérationnelles)
Compétences requises:
  • Maîtrise de l’anglais (oral et écrit) requise afin de communiquer efficacement avec des équipes interfonctionnelles globales et de consulter de la documentation technique principalement en anglais
  • Expertise avancée en architecture matérielle serveur et dépannage au niveau des composantes
  • Excellente maîtrise des systèmes Linux et des outils de diagnostic en ligne de commande
  • Bonne compréhension des bases en réseautique et des composantes d’infrastructure
  • Expérience dans des environnements opérationnels structurés (SOP, SLA, systèmes de billets)
  • Familiarité avec les outils ITSM/DCIM (ServiceNow, Jira ou équivalent)
  • Expérience en câblage structuré et connectivité fibre optique
  • Excellentes capacités d’analyse et de résolution de problèmes, avec souci du détail
  • Capacité à performer dans des environnements critiques et sous pression
  • Fortes compétences organisationnelles et en documentation
Expérience requise:
  • 5+ ans d’expérience en opérations de centre de données ou environnement d’infrastructure similaire
  • Expérience significative en dépannage et réparation de matériel serveur
  • Minimum 2 ans d’expérience avec des systèmes Linux en environnement de production
  • Expérience avec des plateformes serveurs d’entreprise et des environnements d’infrastructure
  • Expérience démontrée en analyse de cause racine (RCA) et résolution de problèmes complexes
  • Expérience avec des systèmes de billets et des processus opérationnels
  • Expérience en déploiement ou mise à niveau d’infrastructure de centres de données (un atout)
Certifications (un atout)
  • CompTIA A+, Server+ ou Linux+
  • Certification LPI ou équivalent
  • Certifications spécifiques aux fournisseurs de matériel
Exigences physiques:
  • Capacité de soulever et déplacer des équipements jusqu’à 50 lb
  • Capacité de travailler dans un environnement à température contrôlée avec un niveau de bruit modéré
  • Capacité d’effectuer des tâches physiques (debout, marche, flexion, position à genoux) pendant de longues périodes
English:
Senior Data Center Operations Engineer
Job Overview:

The Senior Data Center Operations Engineer plays a critical, hands‑on role in supporting the build‑out and long‑term operation of a high‑performance, enterprise‑scale data center environment supporting advanced compute and large‑scale infrastructure deployments.

This position is designed for an experienced engineer with deep expertise in server hardware, Linux systems, and data center operations, operating within environments that demand high availability, precision, and performance. You will contribute during the initial deployment phase, supporting infrastructure bring‑up, validation, and hardware readiness. As the environment transitions into steady‑state operations, you will take ownership of ongoing reliability, advanced troubleshooting, and continuous improvement initiatives.

This role requires a strong operator mindset—someone who thrives in complex, production‑critical environments and takes pride in resolving issues at their root. You will serve as a primary technical escalation point, working closely with engineering and infrastructure teams to maintain system stability and performance.

You will collaborate with cross‑functional teams, making clear and professional communication in English (written and verbal) essential for success in this role.

This role offers continuity across both deployment and operational phases and provides exposure to large‑scale, modern infrastructure environments, with a clear path for progression into advanced technical or engineering roles.

Key Responsibilities:
Advanced Hardware Troubleshooting & Repair
  • Diagnose and resolve complex hardware failures across server platforms (motherboards, CPUs, memory, storage)
  • Perform component‑level repairs and replacements on servers and data center hardware
  • Execute break/fix processes with a focus on minimizing downtime and meeting SLAs
  • Conduct root cause analysis (RCA) of hardware failures and implement preventative improvements
  • Identify recurring failure trends and contribute to tooling, automation, and process enhancements
Linux Systems & Platform Support
  • Utilize Linux command‑line tools for system monitoring, diagnostics, and troubleshooting
  • Support provisioning and deployment of servers across Linux distributions (RHEL, Ubuntu, etc.)
  • Troubleshoot boot‑level and OS‑level issues in production environments
  • Collaborate with engineering teams to resolve complex hardware/software interaction issues
Data Center Operations
  • Support hardware installation, structured cabling, and infrastructure validation
  • Maintain accurate inventory of spare parts, assets, and retired equipment
  • Document repairs, changes, and configurations in ITSM/DCIM systems
  • Ensure adherence to safety, security, and operational protocols
  • Serve as a primary escalation point for complex infrastructure issues
  • Participate in on‑call rotation supporting 24x7 operations
Collaboration & Mentorship
  • Provide guidance and mentorship to technicians on hardware troubleshooting and best practices
  • Collaborate with network, storage, and infrastructure teams to resolve cross‑functional issues
  • Contribute to knowledge sharing, documentation, and operational excellence initiatives
  • Support continuous improvement efforts across processes, tooling, and operational workflows
Required Skills:
  • Strong English communication skills (written and verbal) are required for coordination with cross‑functional teams
  • Expert‑level knowledge of server hardware architecture and component‑level troubleshooting
  • Strong proficiency with Linux systems and command‑line diagnostics
  • Solid understanding of networking fundamentals and infrastructure components
  • Experience working within structured operational environments (SOPs, SLAs, ticketing systems)
  • Familiarity with ITSM/DCIM tools (ServiceNow, Jira, or similar)
  • Experience with structured cabling and fiber optic connectivity
  • Strong analytical and problem‑solving skills with attention to detail
  • Ability to operate effectively in high‑pressure, high‑availability environments
  • Strong organizational and documentation skills
Required Experience:
  • 5+ years of experience in data center operations or similar infrastructure environments
  • Significant hands‑on experience with server hardware troubleshooting and repair
  • Minimum of 2 years of experience working with Linux operating systems in production environments
  • Experience supporting enterprise server platforms and infrastructure environments
  • Demonstrated experience performing root cause analysis and resolving complex hardware issues
  • Experience working within ticketing systems and operational workflows
  • Exposure to data center build‑outs, deployments, or infrastructure upgrades (preferred)
Preferred Certifications:
  • CompTIA A+, Server+, or Linux+
  • LPI certification or equivalent
  • Vendor‑specific hardware certifications
Physical Requirements:
  • Ability to lift and move equipment up to 50 lbs
  • Ability to work in a temperature‑controlled environment with moderate noise levels
  • Ability to perform physical tasks such as standing, walking, bending, and kneeling for extended periods
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

System Administrator – Infrastructure
System Administrator – Infrastructure

IT Unlock • Montreal (administrative region)

On-site
CAD 80,000 - 120,000
Opérateur.ice de Centre de Données | Data Center Operator
Opérateur.ice de Centre de Données | Data Center Operator

eStruxture Data Centers • Montreal

On-site
CAD 48,000 - 72,000
Administrateur Système Linux (Senior)
Administrateur Système Linux (Senior)

SII Canada • Montreal (administrative region)

On-site
CAD 70,000 - 90,000
Opérateur.ice de Centre de Données | Data Center Operator
Opérateur.ice de Centre de Données | Data Center Operator

eStruxture Data Centers • Montreal (administrative region)

On-site
CAD 60,000 - 80,000
Opérateur.ice de Centre de Données | Data Center Operator
Opérateur.ice de Centre de Données | Data Center Operator

eStruxture • Montreal (administrative region)

On-site
CAD 55,000 - 75,000
Technicien en installations critiques / Critical Facility Technician
Technicien en installations critiques / Critical Facility Technician

Visa Hunt • Montreal (administrative region)

On-site
CAD 90,000 - 120,000
Bonus annuel
REER collectif
5 jours mobiles/année
+7
Data Center Technician - Canada - Longueuil - On-site
Data Center Technician - Canada - Longueuil - On-site

Rebootmonkey • Longueuil

On-site
CAD 55,000 - 70,000
Health, dental, and vision insurance
Paid time off and holidays
Professional development allowance
+1
VAN-3 Data Center Operator - Relocation Assistance Possible | Opérateur de centre de données - [...]
VAN-3 Data Center Operator - Relocation Assistance Possible | Opérateur de centre de données - [...]

eStruxture Data Centers • Burnaby

On-site
CAD 65,000 - 85,000
Avantages de sécurité
Formation continue
Administrateur Stockage (Senior)
Administrateur Stockage (Senior)

SII Canada • Montreal (administrative region)

On-site
CAD 80,000 - 100,000
Ingénieur Operations | Operations Field Engineer
Ingénieur Operations | Operations Field Engineer

eStruxture Data Centers • Montreal (administrative region)

On-site
CAD 70,000 - 90,000