Staff Site Reliability Engineer

Stellar Cyber

Banyoles

Presencial

EUR 90.000 - 130.000

Jornada completa

14 días+
Generador de candidaturas

Destaca para este puesto: genera un currículum y una carta de presentación adaptados en cuestión de un minuto.

Supera los filtros ATS

Ventajas ofrecidas por este puesto de trabajo

Pre-IPO Stock Options
Medical, Dental & Vision care
401(k)
Employee Assistance Program
Employee Discount Program
Life Insurance
Paid time off
Referral Program
Rewards and Recognition Program

Descripción de la vacante

Stellar Cyber is seeking a highly skilled Staff Site Reliability Engineer to drive reliability, scalability, and efficiency across our production systems. The ideal candidate has deep expertise in cloud infrastructure, Kubernetes administration, observability, and incident management, with a proven track record of building highly available platforms.

As a senior member of the SRE team, you will influence architecture, tooling, and best practices to ensure operational excellence.

Formación

  • Bachelor’s degree in Computer Science, Engineering, or related technical field.
  • 5+ years of SRE/DevOps or Platform Engineering experience.
  • Strong knowledge of distributed systems, databases, and networking.
  • Deep Kubernetes administration and troubleshooting skills.
  • Experience with IaC and cloud infrastructure across providers.
  • Proficiency in Python and Bash for automation.
  • Familiarity with observability tools and incident management.

Responsabilidades

  • Administer and maintain container orchestration platforms and containerized workloads.
  • Monitor and troubleshoot production systems with on-call rotations.
  • Drive observability improvements through monitoring, logging, and alerting.
  • Manage cloud environments across AWS, GCP, Azure, or OCI.
  • Develop and maintain CI/CD pipelines for reliable deployments.
  • Own infrastructure as code practices for consistency and scalability.
  • Automate infrastructure using Python and Bash.
  • Collaborate with engineers across time zones and stakeholders.

Conocimientos

Distributed systems
Databases
Networking
Linux administration
Kubernetes administration
Python
Bash
Automation
Cloud platforms (AWS/Azure/GCP/OCI)
CI/CD tooling
Observability stack (Prometheus/Grafan
Terraform/Helm
ArgoCD
GitHub Actions/Bitbucket
Elasticsearch/MongoDB/Kafka/Redis

Educación

Bachelor's degree in Computer Science, Engineering, or a related technical field

Herramientas

Kubernetes
Terraform
Helm
ArgoCD
GitHub Actions
Bitbucket
Prometheus
Grafana
Loki
Alertmanager
AWS
GCP
Azure
OCI
Elasticsearch
MongoDB
Spark
Kafka
Redis

Descripción del empleo

  • We are seeking a highly skilled Staff Site Reliability Engineer (SRE) to join our team and drive reliability, scalability, and efficiency across our production systems.
  • The ideal candidate will have deep expertise in cloud infrastructure, Kubernetes administration, observability, and incident management, with a proven track record of building and maintaining highly available and resilient platforms.
  • As a senior member of the SRE team, you will not only operate complex distributed systems but also influence architecture, tooling, and best practices to ensure operational excellence
  • Administer and maintain container orchestration platforms and containerized workloads
  • Monitor and troubleshoot production systems, participating in on-call rotations to ensure reliability
  • Drive observability improvements by enhancing monitoring, logging, and alerting capabilities across systems and data platforms
  • Administer and optimize cloud-based environments across multiple providers
  • Manage and support distributed data platforms and real-time processing systems
  • Develop and maintain continuous integration and delivery pipelines for efficient and reliable deployments
  • Own and implement Infrastructure as Code (IaC) practices to ensure consistency and scalability
  • Automate and orchestrate infrastructure using programming and scripting languages
  • Perform system administration and networking tasks to support internal and external environments
  • Collaborate effectively with engineers and stakeholders across different time zones
Benefits
  • Pre-IPO Stock Options
  • Medical, Dental & Vision care
  • 401(k)
  • Employee Assistance Program
  • Employee Discount Program
  • Life Insurance
  • Paid time off
  • Referral Program
  • Rewards and Recognition Program
  • Strong technical background in distributed systems, databases, networking, and Linux administration
  • Deep understanding of Infrastructure as Code (Terraform, Helm)
  • Proven success leading large-scale production systems in cloud environments (AWS, GCP, Azure, or OCI)
  • Strong experience with production on-call operations and incident management
  • Strong programming and automation skills in Python and Bash
  • 5+ years of experience in Site Reliability Engineering, DevOps, or Platform Engineering roles
  • Expertise in operating data platforms (Elasticsearch, MongoDB, Spark, Kafka, Redis)
  • Advanced proficiency in Kubernetes administration and troubleshooting
  • Knowledge in chat-based operations interfaces and/or auto-remediation controllers using AI agentic framework
  • Bachelor’s degree in Computer Science, Engineering, or a related technical field
  • Excellent problem-solving, communication, and leadership abilities
  • Understanding of AI agents for Auto-triaging alerts, correlate signals and suggest/root-cause hypotheses
  • Demonstrated leadership in driving incident response, on-call best practices, and reliability-focused culture
  • Proficiency with public cloud services (AWS, Azure, GCP, or OCI)
  • Experience with CI/CD pipelines (GitHub Actions, Bitbucket, ArgoCD)
  • Hands-on experience with observability tools: Prometheus, Grafana, Loki, and Alertmanager
  • Certifications in AWS, GCP, Observability, Linux or Kubernetes are a plus
Consigue la evaluación confidencial y gratuita de tu currículum.
o arrastra y suelta tu archivo aquí
Similar jobs

Puestos de trabajo similares que vale la pena comparar

Site Reliability Engineer ID53670
Site Reliability Engineer ID53670

AgileEngine • Ribarroja del Turia

Híbrido
EUR 40.000 - 70.000
Professional growth: Mentorship, TechTalks, and personalized growth roadmaps
Competitive compensation: USD-based pay with education, fitness, and team activity budgets
Exciting projects: Modern solutions with Fortune 500 and top product companies
+1
Site Reliability Engineer ID53670
Site Reliability Engineer ID53670

AgileEngine • Madrid

Híbrido
EUR 45.000 - 60.000
Professional growth
Competitive compensation
Exciting projects
+1
Staff Site Reliability Engineer
Staff Site Reliability Engineer

Hydrolix • España

Presencial
EUR 70.000 - 90.000
Senior SRE: Cloud, Kubernetes & Observability
Senior SRE: Cloud, Kubernetes & Observability

Stellar Cyber • España

Presencial
EUR 90.000 - 130.000
Pre-IPO Stock Options
Medical, Dental & Vision care
401(k)
+6
Sre Monitoring Engineer
Sre Monitoring Engineer

Optiwisers • Valladolid

Híbrido
EUR 62.000 - 103.000
Site Reliability Engineer
Site Reliability Engineer

Optiwisers • Madrid

Híbrido
EUR 83.000 - 111.000
Senior SRE Engineer
Senior SRE Engineer

Dempo • España

Presencial
PHP 6.531.000 - 10.160.000
Remote-first culture
Granada office option
Private health insurance
+4
Site Reliability Engineer (Sre)
Site Reliability Engineer (Sre)

Optiwisers • Arbo

Presencial
EUR 65.000 - 101.000
Senior Site Reliability Engineer - Cloud & DevOps
Senior Site Reliability Engineer - Cloud & DevOps

ThunderSoft • Madrid

Presencial
EUR 52.000 - 76.000
Site Reliability Engineer
Site Reliability Engineer

Optiwisers • Vitoria

Híbrido
EUR 70.000 - 110.000