Analyste - Fiabilité des systèmes (SRE)

RPMGlobal

Montreal (administrative region)

Hybrid

CAD 90,000 - 120,000

Full time

12 days ago
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Opus card gratuite
Assurances collectives
Régime de retraite
Congés généreux
Congés fériés
Congés maladie et personnels
Aide aux employés
Télémédecine gratuite
Club social

Job summary

exo, le réseau de transport métropolitain de Montréal, recherche un Analyste en fiabilité des systèmes pour assurer la fiabilité et la performance des applications en production dans un environnement cloud Azure.

Vous serez le gardien de la disponibilité des services et serez le premier répondant lors d’incidents critiques, en collaboration avec les équipes infra et DevSecOps. Poste hybride basé à Montréal.

Qualifications

  • Diplôme exigé en informatique ou domaine pertinent, type Baccalauréat.
  • 5 à 8 ans d'expérience en TI avec expérience opérationnelle ou SRE.
  • Maîtrise des environnements infonuagiques, surtout Azure, et des outils d'observabilité.
  • Bonnes capacités de résolution de problèmes et sens des responsabilités.
  • Maîtrise du français; connaissance fonctionnelle de l'anglais.

Responsibilities

  • Fiabilité et culture SRE : définir et suivre les indicateurs de performance (SLI/SLO) et budgets d'erreur.
  • Observabilité : maintenir et optimiser tableaux de bord et alertes.
  • Opérations et Infrastructure : exécuter les scripts IaC pour production.
  • Réponse aux incidents : premier répondant 24/7 en rotation.
  • Sécurité et Accès : gérer les accès et secrets des environnements production.
  • Automatisation : automatiser tâches manuelles pour améliorer la livraison logicielle.
  • Collaborer avec les développeurs pour garantir le respect des standards de fiabilité.

Skills

Azure (cloud)
Scripting
Observabilité
Troubleshooting
Français courant
Anglais technique
Docker
Kubernetes
Terraform/Bicep
Agile
Databricks ecosystem

Education

Baccalauréat en informatique ou génie logiciel

Tools

Docker
Kubernetes
Terraform/Bicep
Azure Monitor
Prometheus

Job description

Introduction

Deuxième plus important réseau de transport collectif dans la région métropolitaine de Montréal, exo exploite les services de train, d’autobus et de transport adapté des couronnes nord et sud de Montréal.

Chez exo vous retrouverez une organisation à dimension humaine, tournée vers l’avenir et l’innovation, au service des communautés. Un milieu de travail où, selon la nature de l’emploi, la flexibilité des horaires et le télétravail en mode hybride sont favorisés, facilitant la conciliation travail-vie personnelle.

Travailler chez exo c’est aussi bénéficier d’une foule d’avantages, tels que: carte Opus gratuite, assurances collectives, régime de retraite, vacances généreuses, congés fériés, congés maladie et personnels, programme d’aide aux employés, service gratuit de télémédecine pour vous et votre famille et un club social des plus dynamiques. Faites le saut chez exo!

Sous la responsabilité du Chef - Services de solutions d'entreprises, l’Analyste en fiabilité des systèmes fera le pont entre les plateformes technologiques et les opérations TI. Sa mission principale sera de garantir la fiabilité, la performance et la stabilité des applications en production au sein d'un environnement infonuagique Azure. Vous serez le gardien de la disponibilité des services et l’un des premiers points de contact lors des incidents critiques.


Responsabilités principales
  • Fiabilité et culture SRE : Agir à titre d’expert SRE, afin de définir, mesurer et faire le suivi des indicateurs de performance de fiabilité tels que les SLI (Service Level Indicators), SLO (Service Level Objectives) et gérer les budgets d'erreur (Error Budgets) ;

  • Observabilité : Maintenir, améliorer et optimiser les tableaux de bord et les alertes de la pile d'observabilité pour une détection proactive des anomalies ;

  • Opérations et Infrastructure : Exécuter et appliquer de façon sécuritaire les scripts d'Infrastructure as Code (IaC) créés par l'équipe DevSecOps en production ;

  • Réponse aux incidents : Agir à titre de premier répondant (Niveau 2/3) lors des pannes en production, en prenant le relais du Centre de services TI (CSTI) lors de votre rotation de garde 24/7. Coordonner avec les experts d'infrastructure (DBA, réseaux) au besoin ;

  • Sécurité et Accès : Gérer les accès aux environnements de production et assurer la gestion sécuritaire des secrets de l'application ;

  • Automatisation : Identifier et automatiser les tâches opérationnelles manuelles et répétitives à l'aide de scripts pour améliorer la fluidité de la livraison logicielle ;

  • Participer activement à la livraison logicielle en collaborant avec les développeurs pour s'assurer que le code déployé respecte les standards de fiabilité.

La liste des responsabilités et tâches énumérées précédemment est sommaire et indicative. Il ne s’agit pas d’une liste complète et détaillée des responsabilités et tâches susceptibles d’être effectuées par le titulaire du poste.

Exigences normales du poste

Scolarité

  • Baccalauréat en informatique, en génie logiciel, ou tout autre domaine pertinent;

Expérience

  • 5 à 8 ans d'expérience en TI, avec une solide expérience en opérations, administration de systèmes ou SRE.

Compétences et aptitudes

  • Écosystème Cloud : Excellente maîtrise des environnements infonuagiques, particulièrement Microsoft Azure (Microservices, API) ;

  • Scripting : Solides compétences dans au moins un langage de script (Python, Bash, et/ou PowerShell) ;

  • Observabilité : Expérience démontrée avec la maintenance d'outils comme Grafana, ElasticSearch ou équivalent ;

  • Aptitudes : Rigueur exceptionnelle, grand sens des responsabilités, capacité à garder son calme sous pression, et excellente capacité de résolution de problèmes complexes (troubleshooting) ;

  • Maîtrise du français, connaissance fonctionnelle de l’anglais, à l’oral et à l’écrit ;

  • Atouts : Connaissances des conteneurs (Docker, Kubernetes) et compréhension de la syntaxe Terraform/Bicep. Connaissance de la méthodologie Agile, constitue un atout important.

Connaissances du domaine

  • Connaissance approfondie de la plateforme Databricks et de son écosystème (workspaces, clusters, jobs) ;

  • Compréhension de l’architecture Apache Spark et de ses impacts sur la performance, la stabilité et la scalabilité ;

  • Connaissance des pratiques de surveillance, journalisation et observabilité des environnements Databricks ;

  • Sensibilité aux enjeux de sécurité, gouvernance et protection des données dans Databricks (incluant Unity Catalog) ;

  • Connaissance de l’intégration de Databricks avec les services cloud :

    • Stockage (Data Lake, Object Storage)

    • Réseau et sécurité.

  • Compréhension des dépendances entre Databricks et l'infrastructure cloud sous=jacente ;

  • Sensibilité à l’optimisation des coûts liés à l’utilisation de la plateforme ;

  • Connaissance des mécanismes de monitoring Databricks :

    • Logs Spark

    • Métriques de clusters

    • Historique des jobs

  • Capacité à intéger Databricks avec des outils d'observabilité (ex. Azure Monitor, Log Analytics, Prometheus, Frafana).

Conditions de travail

Période d’emploi et horaire

  • Emploi régulier à temps plein, soit 37.5 heures par semaine

  • Être disponible pour offrir du service 24/7 à travers une rotation de garde, selon les besoins et les priorités.

Lieu

Siège social, 1001 boulevard Robert-Bourassa, 26e étage, Montréal, Québec, H3B 4L4

Le masculin est utilisé de façon générique afin d’alléger le texte. Seules les personnes retenues à la suite de l'analyse des candidatures seront contactées.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Analyste - Fiabilité des systèmes (SRE)
Analyste - Fiabilité des systèmes (SRE)

Exo – Réseau de transport métropolitain • Montreal (administrative region)

Hybrid
CAD 90,000 - 130,000
Carte Opus gratuite
Assurances collectives
Régime de retraite
+7
Analyste en systèmes TI
Analyste en systèmes TI

Exo – Réseau de transport métropolitain • Montreal (administrative region)

On-site
CAD 70,000 - 110,000
Carte Opus gratuite
Assurances collectives
Régime de retraite
+5
Analyste système - Infrastructure
Analyste système - Infrastructure

Exo – Réseau de transport métropolitain • Montreal (administrative region)

On-site
CAD 85,000 - 120,000
Opus card gratuite
Assurances collectives
Régime de retraite
+6
Analyste système - Bureautique
Analyste système - Bureautique

Exo – Réseau de transport métropolitain • Montreal (administrative region)

On-site
CAD 70,000 - 100,000
Carte Opus gratuite
Assurances collectives
Régime de retraite
+6
Analyste système - Bureautique
Analyste système - Bureautique

RPMGlobal • Montreal (administrative region)

On-site
CAD 85,000 - 110,000
Carte Opus gratuite
Assurances collectives
Régime de retraite
+5
Analyste système - Infonuagique
Analyste système - Infonuagique

Exo – Réseau de transport métropolitain • Montreal (administrative region)

On-site
CAD 85,000 - 120,000
carte Opus gratuite
assurances collectives
régime de retraite
+6
Conseiller(ère) - Architecture de solutions
Conseiller(ère) - Architecture de solutions

Exo – Réseau de transport métropolitain • Montreal (administrative region)

On-site
CAD 110,000 - 160,000
Carte Opus gratuite
Assurances collectives
Régime de retraite
+5
Technicien(ne) administratif(ive) - Performance opérationnelle
Technicien(ne) administratif(ive) - Performance opérationnelle

RPMGlobal • Montreal (administrative region)

Hybrid
CAD 65,000 - 85,000
Carte Opus gratuite
Assurances collectives
Régime de retraite
+6
Technicien(ne) administratif(ive) - Performance opérationnelle
Technicien(ne) administratif(ive) - Performance opérationnelle

exo - Réseau de Transport Métropolitain • Montreal (administrative region)

Hybrid
CAD 65,000 - 90,000
Carte Opus gratuite
Assurances collectives
Régime de retraite
+3
ADMINISTRATEUR SYSTÈMES ET AZURE
ADMINISTRATEUR SYSTÈMES ET AZURE

Soprema Inc. • Drummondville

On-site
CAD 70,000 - 100,000
Fonds de pension compétitif
Service de télémédecine
Congés payés pendant les Fêtes
+6