Data Engineer - Streaming & Batch Pipelines

Getnet Platforms

Madrid

Presencial

EUR 65.000 - 90.000

Jornada completa

hace 33 horas
Sé de los primeros/as/es en solicitar esta vacante
Generador de candidaturas

Consigue una respuesta de este empleador — un currículum y una carta de presentación adaptados exactamente a lo que busca para contratar.

Supera los filtros ATS

Descripción de la vacante

Getnet Platforms busca un Data Engineer senior para diseñar, construir y operar pipelines de datos en una plataforma AWS nativa basada en Spark y Delta Lake. El rol exige experiencia en Spark Structured Streaming, procesamiento batch, Kafka/Confluent y governance de datos.

Se valorará dominio de AWS Glue, SageMaker y SQL avanzado, así como experiencia en entornos regulados. Ubicación en Madrid con posible horario híbrido. Se ofrece entorno técnico desafiante y oportunidades de crecimiento.

Formación

  • Se requiere experiencia sólida como Data Engineer en entornos productivos de gran volumen.
  • Formación técnica universitaria en ingeniería, ciencias o afines.
  • Conocimiento profundo de Spark (batch y Structured Streaming) y Delta Lake.
  • Experiencia con Kafka/Confluent y ecosistema AWS para data-lake y ETL.

Responsabilidades

  • Diseñar, construir y operar pipelines de datos en tiempo real y por lotes en AWS.
  • Implementar CDC, joins de enriquecimiento y gestión de checkpoints/offsets.
  • Integrar Confluent Kafka, Schema Registry y optimizar throughput.
  • Construir y optimizar tablas Delta Lake y gestionar esquemas.
  • Desarrollar jobs en AWS Glue y orquestación con Lambda; soporte a SageMaker.

Conocimientos

Apache Spark
PySpark/Scala
Delta Lake
Kafka/Confluent
AWS Data Lake/Glue
SageMaker
SQL avanzado
CDC & SCD
Git/CI-CD

Educación

Licenciatura en Ingeniería o similar

Herramientas

Glue
Data Catalog
EMR
EMR Serverless
S3
Lambda
Delta Lake
Schema Registry
Debezium
Terraform / CloudFormation

Descripción del empleo

SE REQUIERE

Experiencia

  • 3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala.
Estudios
  • Technical degree-level education: Bachelor's degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar.
Technical skills
  • Apache Spark con PySpark o Scala: batch y Spark Structured Streaming.
  • Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas.
  • Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium.
  • Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless.
  • AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso.
  • Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning.
  • SQL avanzado y modelado de datos dimensional.
  • Change Data Capture y Slowly Changing Dimensions.
  • Git, CI/CD y buenas prácticas de testing en proyectos de datos.
Otras informaciones

Se valorará:

  • Experiencia con Kafka Streams o ksqlDB.
  • Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters.
  • Conocimientos de Terraform o CloudFormation para infraestructura como código.
  • Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago.
  • Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.
  • Buscamos un perfil con capacidad para realizar debugging profundo en sistemas distribuidos, autonomía y mentalidad \"you build it, you run it\".
RESPONSABILIDADES CLAVE
  • Diseñar, construir y operar pipelines de ingesta y transformación de datos en tiempo real y por lotes sobre una plataforma AWS nativa de streaming basada en Kafka/Confluent, Spark Structured Streaming y Delta Lake, con foco en fiabilidad, rendimiento y escalabilidad.
Actividades principales
  • Diseñar, desarrollar y mantener pipelines de streaming con Spark Structured Streaming y procesos batch sobre AWS.
  • Implementar lógica CDC, joins de enriquecimiento, gestión de checkpoints y offsets, y tratamiento de DLQ.
  • Integrar y mantener conectores y componentes de Confluent Kafka, incluyendo topics, Schema Registry, particionado y optimización del throughput.
  • Construir y optimizar tablas Delta Lake mediante particionado, Z-Ordering o Liquid Clustering, compactación, operaciones MERGE/upsert y gestión de esquemas.
  • Desarrollar y mantener jobs en AWS Glue, incluyendo crawlers, catálogo y procesos ETL, así como funciones AWS Lambda para orquestación y procesamiento event-driven.
  • Operar y optimizar cargas Spark en EMR y EMR Serverless mediante tuning de memoria, particionado, shuffle, Adaptive Query Execution y resolución de cuellos de botella.
  • Colaborar con los equipos de Data Science y Machine Learning en la preparación de datasets y pipelines de features para SageMaker.
  • Diseñar estrategias para gestionar tablas de referencia o lookup a gran escala, utilizando point lookup, caching y particionado para realizar joins de enriquecimiento eficientes.
  • Implementar monitorización, alertado y mecanismos de resiliencia para pipelines 24/7, incluyendo heartbeats, reintentos y checkpointing.
  • Evolucionar el framework interno de ETL basado en YAML y Spark, aplicando CI/CD, testing e infraestructura como código.
Consigue la evaluación confidencial y gratuita de tu currículum.
o arrastra y suelta tu archivo aquí
Similar jobs

Puestos de trabajo similares que vale la pena comparar

Data Engineer (Databricks)
Data Engineer (Databricks)

Capitole • Zaragoza

Presencial
EUR 70.000 - 100.000
Senior Data Engineer: Real-Time & Batch Pipelines on AWS
Senior Data Engineer: Real-Time & Batch Pipelines on AWS

Getnet Platforms • Madrid

Presencial
EUR 65.000 - 90.000
Data Governance Engineer
Data Governance Engineer

Getnet Platforms • Madrid

Presencial
EUR 70.000 - 100.000
Data Engineer (Databricks)
Data Engineer (Databricks)

Capitole • Badajoz

Presencial
EUR 60.000 - 90.000
Data Engineer (Databricks)
Data Engineer (Databricks)

Capitole • Tarragona

Presencial
EUR 70.000 - 95.000
Data Engineer (Databricks)
Data Engineer (Databricks)

Capitole • España

Presencial
EUR 70.000 - 110.000
Data Engineer (Databricks)
Data Engineer (Databricks)

Capitole • Almería

Presencial
EUR 60.000 - 80.000
Data Engineer (Databricks)
Data Engineer (Databricks)

Capitole • Santiago de Compostela

Presencial
EUR 60.000 - 90.000
Data Engineer (Databricks)
Data Engineer (Databricks)

Capitole • Alicante

Presencial
EUR 70.000 - 110.000
Big Data Developer
Big Data Developer

WeHunt España • Málaga

Presencial
EUR 45.000 - 60.000