PLATFORM OWNER

Nova Solutions

Ciudad de México

Presencial

MXN 600.000 - 900.000

Jornada completa

14 días+
Generador de candidaturas

A complete application in a minute — tailored resume and cover letter, ready to send.

Supera los filtros ATS

Descripción de la vacante

Nova Solutions está buscando un ingeniero de observabilidad/recuperación de incidentes en CDMX para liderar la reconstrucción de flujos de petición y detectar fallas en capas de la pila.

Se requiere experiencia con Grafana, Kubernetes (nivel operador), Kafka, Redis y SQL Server. Se valoran conocimientos en Camel, API Gateway de Sensedia y patrones Saga para transacciones distribuidas.

Formación

  • Observabilidad avanzada con trazabilidad y métricas en Grafana.
  • Experiencia con Kubernetes a nivel operador: pods, eventos, reinicios y reversión de despliegues.
  • Kafka y Redis para procesamiento, sesión y caché.
  • Resilience4j: lectura de estado de circuit breakers, timeouts y reintentos.
  • SQL Server: consulta de logs y datos replicados.

Responsabilidades

  • Reconstruir el recorrido de la petición con trazas y matrices para identificar la capa que falla.
  • Determinar si la causa es dato, configuración, tercero o código.
  • Restablecer servicio mediante parámetros, catálogos, banderas de funcionalidad o reinicio y reversión de despliegues.
  • Armar evidencia y caso con logs, respuestas y timestamps para proveedores.
  • Ejecutar y mantener runbooks de restauración.

Conocimientos

Observabilidad
Grafana
Tracing
Kubernetes
Kafka
Redis
Resilience4j
SQL Server

Herramientas

HashiCorp Vault
Sensedia API Gateway
Apache Camel
Saga pattern

Descripción del empleo

PROPÓSITO DEL PUESTO

Segundo nivel de diagnóstico y restauración. Toma los casos que el primer nivel no resolvió con runbook, determina en qué capa está la causa y devuelve el servicio sin necesidad de modificar código.

RESPONSABILIDADES
  • Reconstruir el recorrido de la petición con la traza distribuida e identificar la capa donde se rompió.
  • Determinar si la causa es dato, configuración, un tercero o código.
  • Restablecer el servicio mediante parámetros, catálogos, banderas de funcionalidad, compensación de operaciones colgadas, o reinicio y reversión de despliegues.
  • Armar el caso con evidencia — mensaje enviado, respuesta, marcas de tiempo y código del proveedor — cuando la causa está fuera del perímetro del servicio.
  • Ejecutar y mantener los runbooks de restauración.
FUERA DE SU RESPONSABILIDAD
  • No corrige código: escala a desarrollo con el diagnóstico probado.
  • No administra la plataforma de contenedores, la red ni las bases de datos.
REQUISITOS TÉCNICOS
  • Observabilidad: consulta y correlación entre trazas, bitácoras y métricas desde Grafana.
  • Kubernetes a nivel operador: estado de pods, eventos, bitácoras, reinicio y reversión de despliegues.
  • Kafka: retraso de consumidor, reequilibrios y mensajes atorados.
  • Redis en modo Sentinel: identificar un failover y revisar el estado de sesión y caché.
  • Resilience4j: leer el estado de los circuit breakers, timeouts y reintentos.
  • SQL Server: consulta de bitácora y de datos replicados del core.
DESEABLES O FORMABLES DURANTE LA TRANSICIÓN
  • Diagnóstico de rutas de Apache Camel y del patrón Saga: compensaciones no ejecutadas y sagas sin cerrar.
  • Sensedia API Gateway: políticas, control de tráfico y enrutamiento.
  • HashiCorp Vault: diagnóstico de fallas por secreto vencido o rotado.
  • Interpretación de códigos de respuesta de plataformas de identidad y de token.
Consigue la evaluación confidencial y gratuita de tu currículum.

o arrastra y suelta tu archivo aquí

Similar jobs

Puestos de trabajo similares que vale la pena comparar

INCIDENT MANAGER
INCIDENT MANAGER

Nova Solutions • Ciudad de México

Presencial
MXN 420.000 - 540.000
Platform Recovery & Runbook Engineer
Platform Recovery & Runbook Engineer

Nova Solutions • Ciudad de México

Presencial
MXN 600.000 - 900.000
Head of IT Operations
Head of IT Operations

Chubb Ltd. • México

A distancia
MXN 900.000 - 1.300.000
Head of IT Operations
Head of IT Operations

Chubb Life Fund • México

A distancia
MXN 900.000 - 1.400.000
Head of IT Operations
Head of IT Operations

Chubb • Monterrey

Presencial
MXN 600.000 - 1.000.000
Ingeniero de Automatización de Plataformas (Splunk / Linux)
Ingeniero de Automatización de Plataformas (Splunk / Linux)

Qualtop • Toluca

Presencial
MXN 334.800 - 502.200
Oportunidades de crecimiento profesional
System Engineer II
System Engineer II

O'Reilly Autopartes México • Región Centro

Presencial
MXN 420.000 - 540.000
Middleware y Modernización de Plataformas
Middleware y Modernización de Plataformas

D4 Consultores • México

A distancia
MXN 800.000 - 1.600.000
Trabajo 100% remoto
Sueldo competitivo
Prestaciones superiores
+1
Tech Lead
Tech Lead

Axity • Culiacán

Presencial
MXN 1.200.000 - 2.000.000
Líder Técnico
Líder Técnico

Coppel • Culiacán

Presencial
MXN 900.000 - 1.300.000
Sueldo base
Fondo de Ahorro
Descuentos en muebles
+9