Site Reliability Engineer

Agap2 Italia

Teramo

Ibrido

EUR 65.000 - 90.000

Tempo pieno

3 giorni fa
Candidati tra i primi
Generatore di candidature

Trasforma questo ruolo in un colloquio — un curriculum e una lettera di presentazione creati in base a ciò che questo datore di lavoro cerca.

Supera i filtri ATS

Vantaggi offerti da questo lavoro

Remote friendly

Descrizione del lavoro

Agap2 Italia è alla ricerca di un Site Reliability Engineer per potenziare un’infrastruttura cloud in produzione su Azure. Il ruolo copre AKS, PostgreSQL e MongoDB Atlas, Kafka e monitoraggio in tempo reale, con focus su resilienza, sicurezza e scalabilità.

Si lavora in contesto internazionale, con on-call remunerato e formazione continua; necessaria esperienza in Linux, IaC (Python/Bash/Terraform) e inglese fluente.

Competenze

  • Laurea in Informatica o ingegneria o equivalente.
  • 3+ anni di esperienza con infrastrutture cloud, preferibilmente Azure.
  • Esperienza con sistemi distribuiti e alta scalabilità.
  • Buona conoscenza dell'inglese scritto/parlato.

Mansioni

  • Migliorare la resilienza ed ottimizzare il cluster Kubernetes (AKS su Azure).
  • Configurare ed ottimizzare database relazionali e non relazionali (PostgreSQL, MongoDB).
  • Gestire Apache Kafka in AKS per dati in tempo reale.
  • Automatizzare processi operativi per ridurre il toil.
  • Partecipare all'on-call per incidenti fuori orario.
  • Sviluppare pipeline di monitoraggio e alerting.
  • Identificare e documentare la root cause di problemi.
  • Collaborare con lo sviluppo per il SDLC e DevOps/GitOps.

Conoscenze

Kubernetes
Azure
Networking
DevOps
SRE principles
Python

Formazione

Laurea in Informatica o Ingegneria o equivalente

Strumenti

AKS
PostgreSQL
MongoDB Atlas
Apache Kafka
Prometheus
Grafana
Terraform
Jenkins
GitLab

Descrizione del lavoro

Siamo alla ricerca di un Site Reliability Engineer motivato a contribuire alla scalabilità e all'ottimizzazione di una complessa infrastruttura Cloud in produzione su Azure.

Si tratta di un sistema distribuito progettato per raccogliere, gestire e distribuire grosse moli di dati in tempo reale. Include componenti connessi "at the edge" che devono essere in grado di operare in scenari "offline" e garantire "eventual consistency" dei dati. La lingua di lavoro principale è l'inglese, dato che il sistema è utilizzato da clienti internazionali.

Il ruolo richiede un forte focus sull'affidabilità, la scalabilità, la sicurezza e la resilienza dell'infrastruttura, con un utilizzo intensivo di Azure Kubernetes Service (AKS), Azure Database for PostgreSQL, MongoDB Atlas ed Apache Kafka.

Il candidato deve inoltre essere disponibile a partecipare alla turnazione on-call, ovviamente remunerata e concordata per essere distribuita equamente nel mese, per la gestione di emergenze e incidenti fuori orario lavorativo standard.

Non è necessario avere esperienza approfondita su tutti i tool utilizzati: siamo pronti a offrire formazione tramite corsi e "training on the job" per colmare eventuali lacune e supportare la crescita professionale.

Responsabilità principali

  • Migliorare la resilienza ed ottimizzare il cluster Kubernetes (AKS su Azure), assicurando performance, scalabilità, sicurezza ed alta affidabilità dei servizi deployati
  • Configurare ed ottimizzare i database relazionali (PostgreSQL su Azure) e non relazionali (MongoDB Atlas) per garantire performance, affidabilità e sicurezza dei dati
  • Gestire e ottimizzare Apache Kafka (su AKS) per la raccolta e distribuzione di dati in tempo reale
  • Automatizzare processi operativi per ridurre il "toil" e migliorare l'efficacia dei team (Platform team e Product team)
  • Partecipare alla turnazione on-call per garantire una rapida risposta agli incidenti e alle emergenze
  • Sviluppare pipeline di monitoraggio e alerting per identificare e debuggare rapidamente problemi operativi
  • Identificare prontamente la "root cause" di problemi bloccanti, sviluppando documentazione tecnica dettagliata ed automazioni per evitare che problemi noti si verifichino nuovamente
  • Collaborare con il team di sviluppo per il miglioramento continuo del ciclo di vita dello sviluppo software (SDLC), garantendo pratiche solide e coerenti
  • Laurea in Informatica, Ingegneria o esperienza equivalente
  • 3+ anni di esperienza con infrastrutture Cloud, preferibilmente Azure
  • Esperienza con sistemi distribuiti e principi di alta scalabilità e resilienza per applicazioni cloud-native
  • Esperienza consolidata in ambienti Linux, inclusa la gestione e il debugging di problemi di networking (DNS, Load Balancer, firewall e VPN)
  • Esperienza con tool di monitoraggio e logging (Prometheus, Grafana, Azure Monitor, etc.)
  • Esperienza nella creazione di automazioni (Python, Bash, Terraform) per migliorare i processi operativi, secondo il paradigma Infrastructure-as-Code (IaC)
  • Familiarità con i principi di Site Reliability Engineering, inclusi SLO, SLA ed "error budgets"
  • Disponibilità a partecipare alla turnazione on-call in reperibilità
  • Buona conoscenza della lingua inglese, scritta e parlata, obbligatoria per l'interazione con clienti internazionali
  • Esperienza nell'implementazione delle best practices di sicurezza su sistemi distribuiti, dalla configurazione di rete alla gestione dei segreti, fino alla scansione automatica per l'identificazione di vulnerabilità note
  • Esperienza con database relazionali (PostgreSQL) e non relazionali (MongoDB)
  • Esperienza con Apache Kafka e conoscenza dei concetti base di stream processing distribuito
  • Esperienza con CI/CD (Jenkins, Gitlab, etc.)
  • Familiarità con architetture di microservizi e metodologie DevOps/GitOps
  • Esperienza di progettazione e sviluppo di sistemi distribuiti real-time e fault-tolerant
  • Opportunità di lavorare su infrastrutture cloud-native moderne, resilienti e scalabili, in un contesto di stream processing ed edge computing
  • Forte attenzione alla cura delle persone, guidata dai nostri valori aziendali di intraprendenza, curiosità, cura e onestà
  • Ambiente collaborativo e stimolante, "remote friendly", orientato alla crescita professionale e personale
Ottieni la revisione del curriculum gratis e riservata.

o trascina qui il file.

Similar jobs

Offerte di lavoro simili che vale la pena confrontare

Site Reliability Engineer
Site Reliability Engineer

Agap2 Italia • Rovigo

Ibrido
EUR 70.000 - 110.000
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance

Cosmico Italia • Monza

In loco
EUR 37.000 - 48.000
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance

Cosmico Italia • Trentino-Alto Adige

In loco
EUR 37.000 - 48.000
Senior Cloud Engineer
Senior Cloud Engineer

Cosmico • Spoleto

In loco
EUR 37.000 - 48.000
Retribuzione giornaliera €230
Sede Nord Italia
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance

Cosmico Italia • Spoleto

In loco
EUR 36.000 - 49.000
Full stack software engineer
Full stack software engineer

3A INFORMATICA SRL • Roma

In loco
EUR 55.000 - 75.000
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance

Cosmico Italia • Bardi

In loco
EUR 60.000 - 72.000
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance
Site Reliability Engineer (Sre) / Devops Cloud Engineer Freelance

Cosmico Italia • Varese

Ibrido
EUR 42.000 - 52.000
Reperibilità settimanale pagata
Platform Engineer / DevOps Specialist
Platform Engineer / DevOps Specialist

Hunters Group Srl • Arezzo

Ibrido
EUR 30.000 - 40.000
Smart working 2 giorni a settimana
Progetti internazionali ITA/Germania
DevOps & Cloud Engineer | Laurea STEM ≥ 102/110 (Mandatory)
DevOps & Cloud Engineer | Laurea STEM ≥ 102/110 (Mandatory)

LHH • Roma

In loco
EUR 55.000 - 75.000