Des projets représentatifs, anonymisés. Ce que je retiens de ma formation de chercheuse : on ne livre pas sans mesurer.
Industrie · BTP · Immobilier
Assistant documentaire intelligent
- Contexte
- Des conseillers métier surchargés par les questions de faisabilité technique, et un catalogue de plus d’un millier de références. L'objectif : automatiser les réponses aux commerciaux et aux clients finaux, en s'appuyant sur plusieurs milliers de documents techniques complexes (PDF natifs et scannés).
- Solution
- Architecture RAG multi-agents : des agents spécialisés orchestrés pour la recherche, l'extraction et la synthèse, couplés à une stratégie de reranking sémantique. Intégration de LLM open source déployés sur une infrastructure européenne pour garantir la confidentialité des données.
- Évaluation
- Benchmarking rigoureux de plusieurs stratégies de chunking, de modèles d'embeddings et de génération. Optimisation fine du compromis entre précision factuelle (mesure des hallucinations) et coût d'inférence, sur un jeu de test validé avec les experts métier.
- Résultat
- Solution intégrée à la plateforme client et déployée en production chez plusieurs clients : accès à l'information nettement accéléré, charge de l'équipe technique fortement réduite et service client plus réactif.
Technologies · LangGraph, Qdrant, Cohere Rerank, LLM open-source (Europe), Docker
Sécurité des bâtiments
Extraction d'informations sur rapports techniques
- Contexte
- Dépouillement manuel fastidieux de rapports denses et volumineux (observations de sécurité des bâtiments et rapports de commission) pour en extraire des entités très précises : bâtiment, équipement, nature et criticité de chaque constat.
- Solution
- À une époque où les fenêtres de contexte des LLM imposaient de fortes contraintes, conception d'un pipeline hybride : découpage intelligent pour localiser précisément les sections utiles dans des PDF volumineux, puis extraction structurée par prompt engineering avancé et typage des sorties (JSON structuré).
- Évaluation
- Validation des performances (précision / rappel) sur un échantillon représentatif de documents complexes, annotés à la main par les équipes métier.
- Résultat
- Plus de 90 % des informations critiques correctement extraites automatiquement ; temps de traitement manuel fortement réduit ; intégration transparente du flux de données dans les outils existants du client.
Technologies · LLM APIs, Pydantic (sorties structurées), pdfminer, Python
Vision par ordinateur · Plans 2D
Segmentation d'instances sur plans architecturaux 2D
- Contexte
- Automatisation du traçage manuel de polygones sur des plans 2D complexes. Le client exigeait une précision élevée pour que l'humain n'ait plus qu'à valider ou corriger les cas limites (murs inclinés, intersections). Contrainte majeure : très peu de données annotées au départ.
- Solution
- Pipeline de vision par ordinateur de bout en bout : stratégies agressives de data augmentation pour pallier le manque de données, évaluation de la qualité des annotations par lots, et fine-tuning d'un modèle de segmentation d'instances robuste (type Mask R-CNN / Detectron2). Algorithme de post-traitement géométrique pour redresser les polygones et lisser les murs.
- Évaluation
- Benchmarking de plusieurs architectures, mesuré via l'IoU (Intersection over Union), calculé avant et après la phase de post-traitement.
- Résultat
- Score d'IoU supérieur à 80 % après post-traitement. Détection entièrement automatisée et intégrée aux outils opérationnels des dessinateurs.
Technologies · Detectron2, Mask R-CNN, OpenCV, PyTorch
Recrutement · Immobilier
Matching candidats–offres
- Contexte
- Identification automatisée des profils les plus pertinents pour une offre donnée, avec une contrainte de démarrage à froid (cold start) : aucun jeu de données labellisé disponible pour entraîner un classifieur.
- Solution
- Approche évolutive en deux phases. Phase 1 : matching non supervisé par similarité sémantique (embeddings de texte) combinée à des heuristiques métier (compétences clés, contraintes géographiques), avec un POC de bout en bout (back-end IA + interface web légère). Phase 2 : transition vers un modèle de classification supervisé à mesure que l'usage du POC permettait de collecter et d'annoter une base de CV réelle.
- Évaluation
- Évaluation qualitative de la pertinence des classements, validée avec les recruteurs sur des offres réelles.
- Résultat
- POC validé, démontrant la viabilité de l'approche sémantique. Transition réussie vers un modèle de production plus stable et scalable, fondé sur les données collectées.
Technologies · scikit-learn, Sentence-Transformers, FastAPI, Python
Automatisation · Production
Analyse structurelle & comparateur de fichiers Excel complexes
- Contexte
- Un client manipulait des fichiers Excel volumineux (jusqu'à des centaines de milliers de lignes) et hautement hétérogènes : plusieurs tableaux imbriqués par feuille, en-têtes multiples et interdépendances complexes entre les onglets. Les modifications humaines rendaient impossible l'usage des comparateurs de fichiers classiques.
- Solution
- Un pipeline capable de comprendre le layout (la structure) des feuilles de calcul : il identifie et segmente automatiquement les différents tableaux au sein d'une même feuille, réassocie les en-têtes correspondants, et détecte les correspondances logiques entre onglets pour aligner et comparer ce qui est comparable.
- Évaluation
- Validation de la robustesse de la segmentation de layout sur des structures Excel « anarchiques » réelles, et tests de montée en charge sur des fichiers de plusieurs centaines de milliers de lignes.
- Résultat
- Génération d'un rapport Excel annoté mettant en évidence les modifications au niveau cellule (cellules modifiées, lignes ou colonnes ajoutées/supprimées) avec un contexte sémantique. Solution en production, faisant gagner un temps critique aux équipes métier.
Technologies · Python, pandas, openpyxl, scikit-learn
Vision par ordinateur · Détection open-vocabulary
Reconnaissance de produits industriels par l'image
- Contexte
- Identifier, à partir d'une simple photo terrain, la référence exacte et la marque d'un produit (outillage électroportatif, quincaillerie…) parmi un catalogue industriel de plusieurs dizaines de milliers d’images multi-marques. Défi : la discrimination fine à grande échelle, entre produits très similaires visuellement.
- Solution
- Recherche visuelle en deux temps : un modèle de détection open-vocabulary (VLM) localise et isole l'objet décrit en langage naturel, puis une projection dans un espace d'embeddings permet une recherche par similarité visuelle (index vectoriel FAISS) face au catalogue de référence.
- Évaluation
- Taux de reconnaissance (Top-1 et Top-5) mesuré autour de 90 % sur un jeu de test représentatif des conditions réelles (flou, variations de lumière).
- Résultat
- POC techniquement validé et industrialisable, démontrant la faisabilité d'un moteur de recherche visuel sur catalogue massif. En attente de validation budgétaire pour le déploiement.
Technologies · VLM (open-vocabulary), FAISS, PyTorch, Hugging Face