Une candidature complète en une minute — un CV et une lettre de motivation personnalisés, prêts à être envoyés.
Conseil d’État, direction des systèmes d’information, recherche un Data Engineer confirmé(e) axé IA et RAG pour concevoir et opérer les architectures de données des projets d’intelligence artificielle. Vous garantissez des données fiables, traçables et sécurisées, en collaboration avec les Data Scientists et les équipes métiers.
Vous piloterez des pipelines, l’indexation et la vectorisation, et contribuerez à l’industrialisation des traitements tout en assurant la qualité, la gouvernance et la
La direction des systèmes d'information recherche un / une Data Engineer confirmé(e) - Intelligence Artificielle.
Sous la responsabilité du responsable de la cellule IA & Innovation, vous concevez et exploitez les architectures de données nécessaires aux projets d’intelligence artificielle du Conseil d’État et des juridictions administratives.
Vous garantissez la mise à disposition de données fiables, disponibles, traçables et sécurisées, et contribue à l’industrialisation des traitements associés. En collaboration avec les Data Scientists, les équipes projets et les experts métiers, vous intervenez notamment sur les bases documentaires Ariane, ArianeWeb, ConsiliaWeb, Légifrance et l’Open data.
Vous avez une formation d'ingénieur d’ingénieur ou master spécialisé en informatique, intelligence artificielle, cloud computing ou data engineering). Une expérience professionnelle équivalente pourra également être prise en compte.
Vous avez au moins 5 ans d’expérience en data engineering, notamment dans la conception et l’exploitation de pipelines de données mais aussi :
Concevoir et industrialiser des pipelines d’ingestion, de transformation et d’indexation de données documentaires ; Préparer des documents, notamment juridiques, pour leur exploitation par des LLM : extraction des contenus et métadonnées, nettoyage, chunking, enrichissement et vectorisation ;
Mettre en œuvre et optimiser des chaînes d’indexation et de recherche sémantique ou hybride reposant sur les embeddings, les moteurs de recherche et les bases vectorielles ; Assurer l’orchestration, la supervision, la traçabilité, le versionnement et la reprise sur erreur des traitements ; Garantir la qualité et la gouvernance des données, métadonnées et index ; Maîtriser les principes des LLM, de l’IA générative et des architectures RAG ; Contribuer, avec les Data Scientists et les développeurs, à la constitution des jeux de test et à l’évaluation des systèmes RAG : pertinence de la recherche, fiabilité des réponses, sources et performances.
Excellente maîtrise de Python et SQL ; Expérience des outils de traitement et d’orchestration des données : Pandas, PySpark, Airflow ou équivalents ; Expérience des moteurs de recherche et bases vectorielles : OpenSearch, Elasticsearch, Qdrant, Weaviate ou équivalent ; Connaissance d’un framework RAG : LangChain, LlamaIndex ou équivalent ; Maîtrise des API REST et des formats JSON, Parquet et CSV ; Pratique de Git, GitLab CI/CD et Docker ; Kubernetes est un atout.
Connaissance des principes de protection, de traçabilité et de gestion des accès aux données. Une connaissance des exigences de sécurité applicables aux administrations publiques est appréciée.
Intégrer et fiabiliser des sources de données hétérogènes. Analyser et optimiser les performances des pipelines et des systèmes d’indexation ;
Rigueur, esprit d'analyse, autonomie, curiosité, force de proposition, sens du collectif et capacité à vulgariser.
Nous nous engageons à promouvoir la diversité et l'inclusivité dans notre environnement de travail.