Ai Data Engineer

Pst.Ag

Barcelona

Presencial

EUR 45.000 - 75.000

Jornada completa

Hace 7 días
Sé de los primeros/as/es en solicitar esta vacante

Recibe más respuestas de empleadores

Envía un currículum específico para el puesto de trabajo en cuestión de minutos.

Descripción de la vacante

Pst.Ag busca un Ingeniero de Extracción con enfoque en especificaciones para diseñar, implementar y mantener pipelines de extracción de datos avanzados. Trabajará con Python y herramientas de IA para reducir fricción entre definición y estructura de la página.

El rol exige experiencia en Scrapy LLM y Playwright, con foco en técnicas robustas de validación de datos y seguridad. Ubicación en Barcelona, con enfoque en cumplimiento de normativas y escalabilidad de plataformas.

Formación

  • Se requiere grado formativo en Ciencias de la Computación.
  • Experiencia mínima de 3 años en web scraping o extracción de datos.
  • Conocimientos sólidos de Python y estructuras de extracción basadas en especificaciones.

Responsabilidades

  • Diseñar y mantener especificaciones de extracción declarativas y validarlas.
  • Construir pipelines que traduzcan especificaciones en planes de extracción ejecutables.
  • Desarrollar bibliotecas de especificaciones reutilizables para tipos de datos.
  • Diseñar agentes de extracción autónomos y manejos de anti-bot.

Conocimientos

Python
Especificación-Driven Extraction
LangChain
LangGraph
LlamaIndex
AutoGen
Scrapy LLM
Scrapy MCP Server
Playwright + MCP
BMAD/TEA
Desarrollo web scraping
Validación de datos
SQL/NoSQL
APIs
HTML / CSS / XPath

Educación

Bachelor’s degree in Computer Science

Herramientas

Docker

Descripción del empleo

Descripción del trabajo

Key Responsibilities Specification-Driven Extraction Engineering
  • Design and maintain declarative extraction specifications—using Pydantic models, JSON schemas, or domain-specific languages—that describe exactly which fields to capture, their types, and validation rules.
  • Implement pipelines that translate these specifications into executable extraction plans, leveraging both classical (Scrapy, Playwright) and AI-augmented (LLM-based semantic parsing) backends.
  • Build reusable specification libraries for recurring data types (product prices, tariff codes, regulatory texts) to accelerate onboarding of new sources.
  • Design and implement autonomous data extraction agents that can make decisions about source selection, retry logic, and parsing strategies
Autonomous & Self-Healing Systems
  • Deploy self-healing spiders that automatically detect website layout changes and repair themselves using Model Context Protocol (MCP) servers (e.g., Scrapy MCP Server, Playwright MCP).
  • Integrate semantic extraction (Scrapy-LLM, custom LLM pipelines) to eliminate selector brittleness—spiders rely on field descriptions, not fragile XPaths.
  • Hands-on experience building AI agents and orchestration systems.
  • Orchestrate complex, multi-step browsing workflows with agentic frameworks (BMAD/TEA, AutoGPT-like agents) that reason about page state, adapt to anti-bot measures, and correct their own behaviour in real time.
Platform Thinking & Reusability
  • Move beyond one-off scrapers: build a component-based extraction platform where selectors, login handlers, and pagination logic are shared, versioned, and tested.
  • Implement monitoring, alerting, and automatic rollback for failed extraction runs.
  • Champion ethical crawling by design—rate limiting, robots.txt respect, and compliance with GDPR/CCPA are built into the specification layer, not retrofitted.
Collaboration & Continuous Innovation
  • Partner with data scientists and domain experts to refine extraction specifications for complex, unstructured domains (e.g., legal texts, tariff classifications).
  • Evaluate and pilot emerging tools to push automation coverage beyond 90%.
  • Document and evangelise specification-driven best practices across the engineering organisation.
Qualification
  • Bachelor’s degree in Computer Science
  • 3+ years of experience in web scraping or data extraction
Required Skills
  • Proficiency with Python
  • Experience with specification-Driven Extraction
  • Experience with LangChain, LangGraph, LlamaIndex, AutoGen
  • Hands on use of Scrapy LLM, Scrapy MCP Server, or similar systems that decouple field definitions from page structure
  • Familiarity with frameworks that give LLMs browser control (Playwright + MCP, BMAD/TEA) to handle complex, non deterministic crawling tasks.
  • Classical Scraping Fundamentals
  • Data Validation & Storage – Ability to define validation rules within specifications and land clean data into SQL/NoSQL databases or data lake
  • Basic API integration and authentication flows.
  • HTTP, DOM, XPath, CSS.
Nice to Haves
  • Contributions to open-source scraping or AI-automation projects.
  • Contributions to open-source scraping or AI-automation projects.
  • Familiarity with data privacy engineering (GDPR, CCPA) baked into specification design.
  • DevOps light – Docker, CI/CD for testing extraction specifications.
Ofertas similares

Diseñar, implementar y mantener pipelines de datos eficientes y escalables que den soporte a reporting, BI, IA y ML.Garantizar la calidad, integridad, disponibilidad y seguridad de los datos median...

Crear una alerta de empleo para esta búsqueda

Last month, haddock users consumed.This isn't AI hype, it's our AI workforce, running 24/7 for thousands of restaurants across Spain.And we're just getting started.We're looking for an AI Engineer ...

Consigue la evaluación confidencial y gratuita de tu currículum.
o arrastra y suelta tu archivo aquí
Similar jobs

Puestos de trabajo similares que vale la pena comparar

AI Data Engineer: Spec-Driven Extraction & Autonomous Bots
AI Data Engineer: Spec-Driven Extraction & Autonomous Bots

Pst.Ag • Barcelona

Presencial
EUR 45.000 - 75.000
Data Ops Engineer - AI Enablement
Data Ops Engineer - AI Enablement

BCNC GROUP • Madrid

Presencial
EUR 45.000 - 65.000
Ai/Ml Engineer
Ai/Ml Engineer

Datadope • Chantada

Híbrido
EUR 55.000 - 85.000
Remote/hybrid Madrid
Flexible schedule
25 días de vacaciones + cumpleaños
+4
AI & Data Engineer
AI & Data Engineer

CAF Group • Beasáin

Presencial
EUR 45.000 - 70.000
AI Engineer
AI Engineer

Visiotech España • Madrid

Híbrido
EUR 35.000 - 55.000
Clases de idiomas
Seguro médico privado
Tarjeta de retribución flexible
+1
Data Scientist | Híbrido
Data Scientist | Híbrido

Slashmobility • Barcelona

Híbrido
EUR 50.000 - 75.000
Data Engineer
Data Engineer

dentsu • Madrid

Híbrido
EUR 40.000 - 60.000
Vacaciones: 26 días laborales
3 Wellness Days
Horario flexible
+3
Data Ops Engineer + GenAI
Data Ops Engineer + GenAI

BCNC GROUP • España

Híbrido
EUR 60.000 - 90.000
Retribución flexible
Plan de referidos
Modelo híbrido Madrid
Expert Agentic AI Sector Consultant
Expert Agentic AI Sector Consultant

NTT DATA Europe & Latam • Vigo

Híbrido
EUR 65.000 - 100.000
Contrato indefinido
Ayuda al teletrabajo
Plan de beneficios
AI Engineer - Freelance - Madrid
AI Engineer - Freelance - Madrid

Galadrim • Madrid

Presencial
EUR 60.000 - 90.000