Senior SRE: Cloud Reliability & Observability

MPS Group LLC

Bogotá

Presencial

COP 120.000.000 - 180.000.000

Jornada completa

hace 27 horas
Sé de los primeros/as/es en solicitar esta vacante
Generador de candidaturas

Una candidatura completa en un minuto: currículum y carta de presentación adaptados, listos para enviar.

Supera los filtros ATS

Descripción de la vacante

MPS Group LLC in Bogotá seeks a Senior Site Reliability Engineer to build, operate, and evolve scalable cloud platforms. You will partner with Engineering, DevOps, Platform, and Security to establish reliability practices, meet performance and availability targets, and guide architectural decisions.

The role demands hands-on leadership, experience with AWS and GCP migrations, Kubernetes (EKS/GKE), observability tooling, incident management, and automation to reduce toil.

Formación

  • 7+ years of experience in Site Reliability Engineering, Cloud Engineering, DevOps, or Platform Engineering.
  • Strong experience supporting production systems in AWS and/or GCP environments.
  • Deep understanding of SRE principles, including SLIs, SLOs, error budgets, and operational excellence.
  • Experience operating and troubleshooting Kubernetes platforms such as EKS and/or GKE.
  • Strong knowledge of observability tools such as Prometheus, Grafana, CloudWatch, Cloud Monitoring, Datadog, Splunk, or similar.
  • Experience with Infrastructure as Code tools such as Terraform.
  • Strong scripting and automation skills using Python, Bash, or comparable languages.
  • Solid understanding of networking, distributed systems, cloud security, and performance optimization.
  • Experience supporting large-scale cloud migration or modernization programs (preferred).
  • Expertise in incident management and production operations for high-availability systems (preferred).
  • Experience implementing chaos engineering or resilience testing practices (preferred).
  • Knowledge of service mesh technologies such as Istio (preferred).
  • AWS and/or GCP certifications (preferred).
  • Experience working in Agile, DevOps, or DevSecOps environments (preferred).

Responsabilidades

  • Design and implement reliability strategies for distributed systems running across AWS and GCP.
  • Define and measure Service Level Indicators (SLIs), Service Level Objectives (SLOs), and reliability metrics.
  • Build and enhance observability solutions using monitoring, logging, tracing, and alerting platforms.
  • Lead incident response, root cause analysis, and postmortem processes to improve system reliability.
  • Collaborate with engineering teams to improve system performance, resiliency, scalability, and operational readiness.
  • Automate operational processes and reduce toil through engineering solutions.
  • Guide teams on reliability-focused architecture decisions, capacity planning, and non-functional requirements.

Conocimientos

SRE principles
Cloud engineering
DevOps
Automation scripting
Incident management

Herramientas

Kubernetes (EKS/GKE)
Terraform
Prometheus
Grafana
CloudWatch / Cloud Monitoring
Datadog
Splunk
Python
Bash
Istio

Descripción del empleo

MPS Group LLC in Bogotá seeks a Senior Site Reliability Engineer to build, operate, and evolve scalable cloud platforms. You will partner with Engineering, DevOps, Platform, and Security to establish reliability practices, meet performance and availability targets, and guide architectural decisions.

The role demands hands-on leadership, experience with AWS and GCP migrations, Kubernetes (EKS/GKE), observability tooling, incident management, and automation to reduce toil.

Consigue la evaluación confidencial y gratuita de tu currículum.
o arrastra y suelta tu archivo aquí
Similar jobs

Puestos de trabajo similares que vale la pena comparar

Senior Site Reliability Engineer
Senior Site Reliability Engineer

MPS Group LLC • Bogotá

Presencial
COP 120.000.000 - 180.000.000
Senior Cloud SRE Manager - Terraform, Kubernetes, GCP
Senior Cloud SRE Manager - Terraform, Kubernetes, GCP

ScotiaTech • Bogotá

Presencial
COP 180.000.000 - 240.000.000
Senior Site Reliability Engineer - Cloud & Observability
Senior Site Reliability Engineer - Cloud & Observability

cobre.co • Colombia

A distancia
Hybrid SRE: Reliability, Automation & Observability
Hybrid SRE: Reliability, Automation & Observability

T-mapp Jobs • Bogotá

Híbrido
COP 120.000.000 - 180.000.000
Hybrid work model in Bogotá
Health benefits
Learning & development programs
+1
Senior SRE: Live Production Reliability & Automation
Senior SRE: Live Production Reliability & Automation

LanceSoft, Inc. • Colombia

Presencial
COP 90.000.000 - 150.000.000
Global SRE Engineer - Reliability, Automation & Observability
Global SRE Engineer - Reliability, Automation & Observability

1083 Amadeus IT Group Colombia, S.A.S. • Bogotá

Híbrido
COP 182.089.000 - 254.926.000
Competitive remuneration
Vacation and holiday paid time off
Health insurances
+3
Service Reliability Engineer
Service Reliability Engineer

1083 Amadeus IT Group Colombia, S.A.S. • Colombia

Presencial
COP 182.089.000 - 254.926.000
Competitive remuneration
Vacation and holiday paid time off
Health insurances
+3
Site Reliability Engineer – Cloud, CI/CD & Automation
Site Reliability Engineer – Cloud, CI/CD & Automation

Intraway • Bogotá

Presencial
COP 96.000.000 - 140.000.000
Unlimited PTO
Training access
English classes
+2
Site Reliability Engineer - Cloud Reliability (Remote/Flex)
Site Reliability Engineer - Cloud Reliability (Remote/Flex)

AgileEngine • Metropolitana

Híbrido
COP 142.369.000 - 213.554.000
SRE: Cloud Reliability & Observability Engineer
SRE: Cloud Reliability & Observability Engineer

FashionUnited Group • Bogotá ciudad

Híbrido
COP 144.000.000 - 216.000.000