Líder de Observabilidad y SER

Stefanini-Latam

Lima (OH)

On-site

USD 120,000 - 180,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Stefanini-Latam busca un líder de Observabilidad y SRE para definir la estrategia corporativa, liderar la confiabilidad y coordinar incidentes críticos. El rol implica diseñar modelos de observabilidad, estandares de logs y métricas, y promover DevOps a escala organizacional.

Se requiere experiencia en entornos con alta criticidad, liderazgo de equipos multidisciplinarios y dominio de herramientas como Dynatrace, Datadog, Grafana y Prometheus.

Qualifications

  • Más de 7 años de experiencia profesional en tecnología, operaciones, infraestructura, Cloud, DevOps, observabilidad o confiabilidad.
  • Experiencia en entornos de alta criticidad y alta disponibilidad.

Responsibilities

  • Definir la estrategia corporativa de Observabilidad.
  • Diseñar y mantener el modelo de observabilidad tecnológica.
  • Establecer estándares para la gestión de registros, eventos e instrumentación.
  • Asegurar la visibilidad de servicios críticos, APIs, infraestructura y nube.
  • Promover una visión integral de observabilidad desde la experiencia del usuario hasta la infraestructura.
  • Definir SLI, SLO y presupuestos de error; liderar la mejora continua de confiabilidad.
  • Gestionar incidentes críticos y coordinar equipos de soporte, Desarrollo e Infraestructura.
  • Diseñar tableros y alertas accionables; reducir ruido y duplicidad de alertas.

Skills

Liderazgo SRE
Observabilidad
Gestión de incidentes
Automatización
Monitoreo de apps
OpenTelemetry
Dynatrace
Grafana
Prometheus
Cloud (AWS/Azure)

Tools

Dynatrace
Datadog
Grafana
Prometheus
ELK
Splunk
Azure Monitor
Azure Log Analytics

Job description

En Stefanini somos más de 30.000 genios, conectados desde 41 países, haciendo lo que les apasiona y co‑creando un futuro mejor.

Estrategia de observabilidad
  • Definir la estrategia corporativa de Observabilidad.
  • Diseñar y mantener el modelo de observabilidad tecnológica.
  • Establecer estándares para la gestión de:
  • Registros.
  • Eventos.
  • Definir lineamientos para la instrumentación de aplicaciones y plataformas.
  • Asegurar la visibilidad de servicios críticos, aplicaciones, APIs, infraestructura y componentes Cloud.
  • Establecer criterios de monitoreo para ambientes productivos y no productivos.
  • Promover una visión integral de observabilidad desde la experiencia del usuario hasta la infraestructura.
SRE y confiabilidad
  • Definir y gobernar prácticas de Ingeniería de Confiabilidad del Sitio.
  • Establecer SLI, SLO y Presupuestos de Error.
  • Definir objetivos de disponibilidad, rendimiento y confiabilidad.
  • Liderar la identificación y reducción de riesgos operativos.
  • Promover la automatización de tareas repetitivas y manuales.
  • Diseñar prácticas para mejorar la resiliencia de las aplicaciones.
  • Gestionar la capacidad, disponibilidad y rendimiento de los servicios.
  • Definir estándares para la operación de aplicaciones críticas.
  • Trabaje con los equipos de desarrollo para incorporar confiabilidad desde el diseño.
  • Impulsar la adopción de principios de ingeniería de confiabilidad en la organización.
Gestión de incidentes y problemas
  • Liderar la gestión técnica de incidentes críticos.
  • Coordinar la atención de incidentes de alto impacto.
  • Participar en el Manejo de Incidentes.
  • Gestionar postmortems sin enfoque punitivo.
  • Liderar el Manejo de Problemas Técnico.
  • Identificar problemas recurrentes y definir planes de eliminación.
  • Dar seguimiento a las acciones correctivas y preventivas.
  • Evaluar tendencias de incidentes, degradaciones y fallas.
  • Coordinador con Mesa de Ayuda, Operaciones, Desarrollo, Infraestructura, Cloud y proveedores.
  • Participar en el Emergency Change Gate.
  • Asegurar la documentación y trazabilidad de los incidentes relevantes.
Monitoreo y gestion de alertas
  • Diseñar y gobernar tableros operativos y ejecutivos.
  • Definir alertas inteligentes y accionables.
  • Reduzca el ruido y la duplicidad de alertas.
  • Establecer niveles de criticidad y prioridades.
  • Definir procedimientos de respuesta ante eventos.
  • Monitorear disponibilidad, latencia, errores, capacidad y rendimiento.
  • Implementar prácticas de monitoreo proactivo.
  • Promover el uso de automatización para detección y resolución.
  • Asegurar que las alertas estén vinculadas con procedimientos operativos claros.
Plataformas y herramientas
  • Liderar la evolución de las plataformas de observabilidad.
  • Definir estándares de uso para Dynatrace, Datadog, Grafana y Prometheus.
  • Promover la adopción de OpenTelemetry.
  • Establecer criterios de gestión de logs mediante ELK, Splunk, Azure Monitor y Azure Log Analytics.
  • Integrar herramientas de observabilidad con plataformas Cloud, Kubernetes y DevOps.
  • Coordinador de instrumentación de aplicaciones y servicios.
  • Definir la estrategia de almacenamiento, retención y consulta de registros.
  • Evaluar nuevas herramientas y tecnologías de monitoreo.
  • Asegurar la interoperabilidad entre las diferentes herramientas de observabilidad.
Liderazgo y mejora continua
  • Liderar el equipo de Observabilidad y SRE.
  • Definir objetivos, prioridades y planes de trabajo del equipo.
  • Desarrollar capacidades técnicas y metodológicas.
  • Impulsar una cultura DevOps y SRE.
  • Promover la colaboración entre desarrollo, operaciones y soporte.
  • Establecer prácticas de mejora continua.
  • Presentar resultados, riesgos y oportunidades a la dirección.
  • Definir planos para mejorar la madurez de observabilidad y confiabilidad.
  • Identificar oportunidades de automatización y reducción de esfuerzo operativo.
Experiencia general
  • Más de 7 años de experiencia profesional en tecnología, operaciones, infraestructura, Cloud, DevOps, observabilidad o confiabilidad.
  • Experiencia en ambientes de alta criticidad y alta disponibilidad.
Experiencia específica
  • Más de 3 años liderando equipos o iniciativas SRE.
  • Experiencia comprobada en:
  • Alta disponibilidad.
  • Gestión de incidentes.
  • Gestión de problemas.
  • Análisis de la causa raíz.
  • Observabilidad.
  • Monitoreo de aplicaciones y plataformas.
  • Gestión de capacidad.
  • Gestión de rendimiento.
  • Definición de SLI, SLO y Presupuesto de errores.
  • Gestión de postmortems.
  • Diseño de tableros y métricas operativas.
  • Gestión de incidentes críticos.
  • Experiencia liderando equipos multidisciplinarios.
  • Experiencia coordinando con desarrollo, infraestructura, soporte, seguridad, Cloud y proveedores.
  • Experiencia en organizaciones de banca, fintech, telecomunicaciones o sectores con servicios digitales críticos, preferentemente.
Competencias y habilidades blandas
  • Capacidad de resolución de problemas.
  • Pensamiento analítico.
  • Mejora continúa.
  • Influencia transversal.
  • Capacidad para trabajar bajo presión.
  • Toma de decisiones en situaciones críticas.
  • Orientación a resultados.
  • Capacidad de priorización.
  • Capacidad de negociación.
  • Comunicación con áreas técnicas y ejecutivas.
  • Orientación a la prevención.
  • Cultura de aprendizaje a partir de incidentes.
Indicadores de éxito del puesto
  • Disponibilidad de las aplicaciones y servicios críticos.
  • Cumplimiento de los SLO definidos.
  • Reducción del número de incidentes críticos.
  • Reducción del tiempo medio de detección —MTTD—.
  • Reducción del tiempo medio de recuperación —MTTR—.
  • Reducción del número de incidentes recurrentes.
  • Porcentaje de servicios con SLI y SLO definidos.
  • Porcentaje de servicios con monitoreo completo de métricas, logs y trazas.
  • Cumplimiento de Presupuestos Error.
  • Reducción del ruido y falsas alertas.
  • Porcentaje de autopsias ejecutadas en el tiempo.
  • Cumplimiento de acciones correctivas derivadas de RCA.
  • Nivel de automatización de tareas operativas.
  • Reducción de intervenciones manuales.
  • Porcentaje de aplicaciones críticas instrumentadas.
  • Cobertura de observabilidad en ambientes productivos.
  • Cumplimiento de los objetivos de capacidad y rendimiento.
  • Nivel de madurez de las prácticas SRE y DevOps.
  • Estrategia corporativa de Observabilidad.
  • Catálogo de servicios críticos.
  • Estándares de métricas, logs y trazas.
  • Catálogo de SLI y SLO.
  • Cuadros de mando operativos y ejecutivos.
  • Matriz de criticidad de servicios.
  • Modelo de alertamiento.
  • Procedimientos de respuesta ante incidentes.
  • Informes de disponibilidad y confiabilidad.
  • Análisis de capacidad y rendimiento.
  • Informes de incidentes críticos.
  • Post mortems y planos de acción.
  • Informes de Gestión de Problemas.
  • Hoja de ruta de automatización.
  • Plan de evolución de la plataforma de observabilidad.
  • Indicadores de madurez SRE y DevOps.
Competencias y habilidades blandas
  • Capacidad de resolución de problemas.
  • Pensamiento analítico.
  • Mejora continúa.
  • Influencia transversal.
  • Capacidad para trabajar bajo presión.
  • Toma de decisiones en situaciones críticas.
  • Orientación a resultados.
  • Capacidad de priorización.
  • Capacidad de negociación.
  • Comunicación con áreas técnicas y ejecutivas.
  • Orientación a la prevención.
  • Cultura de aprendizaje a partir de incidentes.
Creer para co-crear

¿Buscas un lugar donde tus ideas brillen?

Con más de 38 años y una presencia global, en Stefanini transformamos el mañana juntos. Aquí, cada acción cuenta y cada idea puede marcar la diferencia. Únete a un equipo que valora la innovación, el respeto y el compromiso.

Si eres una persona disruptiva, te mantienes en aprendizaje continuo y la innovación está en tu ADN, entonces somos lo que buscas. ¡Ven y construyamos juntos un futuro mejor!

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Arquitecto FinOps
Arquitecto FinOps

Stefanini-Latam • Lima (OH)

On-site
USD 100,000 - 130,000
Coordinador Soporte de Microinformática OnSite Surquillo - LM
Coordinador Soporte de Microinformática OnSite Surquillo - LM

Stefanini • Peru (IL)

On-site
USD 60,000 - 90,000
Product Owner Sr
Product Owner Sr

Stefanini-Latam • Peru (IL)

On-site
USD 70,000 - 110,000
Product Owner Sr
Product Owner Sr

Stefanini Latam • Peru (IL)

On-site
USD 40,000 - 70,000
Ingeniero DevOps JR - Integratel
Ingeniero DevOps JR - Integratel

Stefanini Latam • Peru (IL)

On-site
USD 65,000 - 90,000
FullStack Developer JR - Integratel
FullStack Developer JR - Integratel

Stefanini Latam • Peru (IL)

On-site
USD 70,000 - 110,000
FullStack Developer JR - Integratel
FullStack Developer JR - Integratel

Stefanini-Latam • Peru (IN)

On-site
USD 90,000 - 120,000
Líder de Observabilidad y SRE
Líder de Observabilidad y SRE

Stefanini-Latam • Lima (OH)

On-site
USD 120,000 - 180,000
FullStack Developer - Super App
FullStack Developer - Super App

Stefanini Latam • Peru (IL)

On-site
USD 90,000 - 130,000
Analista monitoreo y mantenimiento ATM San Isidro - LM Full-time employee
Analista monitoreo y mantenimiento ATM San Isidro - LM Full-time employee

Stefanini • Peru (IL)

On-site
USD 45,000 - 67,000