Data Scientist Expert – IA

AlgoviA

Lyon

Sur place

EUR 70 000 - 95 000

Plein temps

Il y a 5 jours
Soyez parmi les premiers à postuler

Recevez plus de réponses des employeurs

Envoyez un CV adapté au poste en quelques minutes.

Avantages offerts par ce poste

Présence sur site 2-3J Lyon

Résumé du poste

AlgoviA recherche un Data Scientist Expert pour accompagner un client du secteur nucléaire, en présentiel à Lyon. Le poste implique l’analyse des besoins métier, le développement d’applications IA/ML/DL et l’évaluation de la pertinence de l’IA pour répondre aux problématiques client.

Vous effectuerez des POC, collecterez et nettoierez les données, réaliserez des transformations et des features, puis déploierez des modèles et des API pour des solutions complexes type RAG.

Qualifications

  • Maîtrise des principales bibliothèques Python d’analyse de données et d’IA.
  • Manipulation de données avec Pandas et Polars, Dask et/ou PySpark.
  • Expérience en traitement du langage naturel (NLTK/Spacy).
  • Maîtrise de ML/DL avec Scikit-Learn, XGBoost, LightGBM et PyTorch.
  • Expérience en IA générative: Ollama, Transformers, Langchain/LlamaIndex.

Responsabilités

  • Instancier et déployer des modèles ML/DL et des solutions IA génératives.
  • Évaluer l’utilité de l’IA selon les cas d’usage métiers et réaliser des POC.
  • Collecte, nettoyage et préparation des données, ingestion et intégration dans les pipelines.
  • Conception et développement d’API pour accéder aux modèles et les mettre en production.
  • Réaliser l’EDA et décrire les résultats, communiquer avec le client et les équipes.

Connaissances

Python
Pandas/Polars
NLTK/Spacy
Scikit-Learn/XGBoost/LightGBM
PyTorch
Transformers/Langchain
RAG
API development

Outils

Pandas
Polars
Dask
PySpark
NLTK
Spacy
Scikit-Learn
XGBoost
LightGBM
PyTorch
Ollama
Transformers
SentenceTransformers
Langchain
LlamaIndex

Description du poste

Description du poste
Mission Data Scientist Expert pour client secteur nucléaire
L’objet de cette consultation est pour s’entourer de data scientists externes permettant l’analyse de besoin métier et le développement d’application IA (Intelligence Artificielle), ML (Machine Learning), DL (Deep Learning), IA GEN (Intelligence Artificielle Générative).

  • Périmètre de la consultation
  • Prestations attendues
  • Activités principales de data scientist
  • Comprendre les cas d’usage
  • Participer aux réunions de cadrage des besoins, avec le chef de projet DPIT
  • Apporter son expertise, évaluer la pertinence de l’IA pour répondre au besoin
  • Effectuer une première évaluation de l’effort nécessaire au développement d’une solution
  • Réaliser des POC pour démontrer la faisabilité et la performance
  • Collecte de Données
  • Identification des Sources de Données : Reconnaître et identifier les sources de données pertinentes (internes et externes) pour les problèmes à résoudre.
  • Extraction des Données : Récupérer les données à partir de diverses bases de données, API, fichiers texte, documents Word et PDF, web scraping, fichiers de données semi-structurées, etc.
  • Préparation et Nettoyage des Données
  • Nettoyage des Données : Corriger ou supprimer les données corrompues ou incorrectes, traiter les valeurs manquantes, éliminer les doublons.
  • Transformation des Données : Convertir et normaliser les données pour rendre les formats compatibles, et effectuer des transformations telles que la mise à l’échelle et la codification catégorielle.
  • Ingénierie des Caractéristiques : Extraire, créer et sélectionner des caractéristiques pertinentes (features) à partir des données brutes.
  • Traitement du Langage Naturel : Extraire, nettoyer et transformer des verbatims issus de documentations non structurées
  • Exploration et Visualisation des Données
  • Analyse Exploratoire des Données (EDA) : Utiliser des techniques statistiques et des outils de visualisation pour comprendre les distributions, les relations et les anomalies dans les données.
  • Détection de Motifs et de Tendances : Identifier des modèles récurrents, des corrélations et des tendances pour formuler des hypothèses et des relations causales potentielles.
  • Modélisation, Développement et Utilisation de Modèles
  • Utilisation du langage python pour développer les applications nécessaires, ainsi que des interfaces utilisateur de premier niveau
  • Sélection d’Algorithmes : Choisir les algorithmes d’apprentissage machine (Machine Learning) ou d’apprentissage profond (Deep Learning) les plus appropriés pour le problème.
  • Entraînement des Modèles : Former les modèles en utilisant des ensembles de données d’entraînement et ajuster les paramètres pour optimiser les performances
  • Validation des Modèles : Utiliser des techniques de validation croisée pour évaluer la robustesse des modèles et éviter le surajustement (overfitting).
  • Instancier des modèles de langages pré-entraînés (LLMs, embeddings, Rerankers…) et les intégrer dans des solutions complexes type RAG (Retrieval Augmented Generation).
  • Maitrise des principales bibliothèques Python d’analyse de données et d’IA :
  • Manipulation de données : Pandas et Polars, Dask et/ou PySpark
  • Traitement du Langage Naturel : NLTK et/ou Spacy
  • Machine Learning : Scikit-Learn, XGBoost, LightGBM
  • Deep Learning : PyTorch
  • IA générative : Ollama, Transformers, SentenceTransformers et Langchain et/ou LlamaIndex
  • Évaluation des Modèles
  • Métriques de Performance : Évaluer les performances des modèles à l’aide de diverses métriques comme la précision, le rappel, le score F1, l’AUC-ROC, Matthews, RMSE, MAE, R2-Score, MAPE, Silhouette etc.
  • Analyse des Erreurs : Analyser les erreurs de prédiction pour comprendre les faiblesses des modèles et identifier des pistes d’amélioration.
  • Déploiement des Modèles
  • Intégration des Modèles : Collaborer avec les équipes d’ingénierie et de développement pour intégrer les modèles dans les systèmes de production.
  • Automatisation des Flux de Travail : Créer et automatiser des pipelines de données pour assurer un flux continu de données du stockage à l’inférence.
  • Développement d’API : Créer des interfaces de programmation d’applications (API) pour permettre l’accès aux modèles par d’autres systèmes ou utilisateurs.
  • Surveillance et Maintenance des Modèles
  • Surveillance des Performances : Mettre en place des mécanismes pour surveiller les performances des modèles en production et détecter toute dégradation.
  • Réentraînement des Modèles : Effectuer des mises à jour et réentraîner les modèles régulièrement pour maintenir leur performance face à des nouvelles données et des changements dans les patterns des données.
  • Documentation et Communication
  • Documentation Technique : Documenter les processus, les méthodologies, les décisions de conception et les résultats des modèles.
  • Communication des Résultats : Présenter les insights et les résultats aux parties prenantes, en utilisant des visualisations claires et des mots accessibles aux non-experts.
  • Rapports et Présentations : Rédiger des rapports et préparer des présentations pour partager les découvertes et les recommandations.
  • Recherche et Développement
  • Veille Technologique : Rester informé des dernières avancées en matière d’algorithmes, de techniques d’apprentissage machine et d’outils.
  • Prototypage et Expérimentation : Concevoir et tester de nouveaux modèles et approches pour résoudre des problèmes complexes ou améliorer les performances.
  • Collaboration
  • Collaboration Interdisciplinaire : Travailler avec des experts de domaine, des analystes métier et d’autres parties prenantes pour comprendre les besoins et les contraintes spécifiques.
Présence sur site 2-3J Lyon
Démarrage Septembre
Profil recherché
  • Instancier des modèles de langages pré-entraînés (LLMs, embeddings, Rerankers…) et les intégrer dans des solutions complexes type RAG (Retrieval Augmented Generation).
  • Maitrise des principales bibliothèques Python d’analyse de données et d’IA :
  • Manipulation de données : Pandas et Polars, Dask et/ou PySpark
  • Traitement du Langage Naturel : NLTK et/ou Spacy
  • Machine Learning : Scikit-Learn, XGBoost, LightGBM
  • Deep Learning : PyTorch
  • IA générative : Ollama, Transformers, SentenceTransformers et Langchain et/ou LlamaIndex
Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez votre fichier ici.
Similar jobs

Postes similaires à comparer

AI Engineer Python Senior - IA Générative (H/F)
AI Engineer Python Senior - IA Générative (H/F)

DGTL Performance • Massy

Sur place
EUR 90 000 - 130 000
Data Scientist IA
Data Scientist IA

Free-Work • Montrouge

Sur place
EUR 60 000 - 85 000
Expert IA & Data Enginer (F/H)
Expert IA & Data Enginer (F/H)

CELAD • Paris

Sur place
EUR 60 000 - 90 000
Ingénieur en science des données Intelligence Artificielle expérimenté H/F - IBM Client Innovat[...]
Ingénieur en science des données Intelligence Artificielle expérimenté H/F - IBM Client Innovat[...]

IBM • Bois-Colombes

Sur place
EUR 70 000 - 110 000
Data scientist (H/F)
Data scientist (H/F)

VISIAN • France

Sur place
EUR 60 000 - 90 000
AI Engineer / GenAI – Supply Chain H/F
AI Engineer / GenAI – Supply Chain H/F

MP DATA • Balma

Sur place
EUR 70 000 - 100 000
Data Scientist / AI Engineer
Data Scientist / AI Engineer

Global Experts Consulting • Paris

Hybride
EUR 45 000 - 60 000
Data Scientist IA (IT) / Freelance
Data Scientist IA (IT) / Freelance

Onyx-Conseil • Paris

Sur place
EUR 70 000 - 110 000
Data Scientists Experts en Intelligence Artificielle F/H
Data Scientists Experts en Intelligence Artificielle F/H

EDF • Lyon

Sur place
EUR 90 000 - 130 000
Data Scientist Senior
Data Scientist Senior

LittleBigCode SAS • Paris, Lyon

Sur place
EUR 45 000 - 65 000