Réalisations

Quelques réalisations.

Des projets représentatifs, anonymisés. Ce que je retiens de ma formation de chercheuse : on ne livre pas sans mesurer.

Industrie · BTP · Immobilier

Assistant documentaire intelligent

Contexte
Des conseillers métier surchargés par les questions de faisabilité technique, et un catalogue de plus d’un millier de références. L'objectif : automatiser les réponses aux commerciaux et aux clients finaux, en s'appuyant sur plusieurs milliers de documents techniques complexes (PDF natifs et scannés).
Solution
Architecture RAG multi-agents : des agents spécialisés orchestrés pour la recherche, l'extraction et la synthèse, couplés à une stratégie de reranking sémantique. Intégration de LLM open source déployés sur une infrastructure européenne pour garantir la confidentialité des données.
Évaluation
Benchmarking rigoureux de plusieurs stratégies de chunking, de modèles d'embeddings et de génération. Optimisation fine du compromis entre précision factuelle (mesure des hallucinations) et coût d'inférence, sur un jeu de test validé avec les experts métier.
Résultat
Solution intégrée à la plateforme client et déployée en production chez plusieurs clients : accès à l'information nettement accéléré, charge de l'équipe technique fortement réduite et service client plus réactif.

Technologies · LangGraph, Qdrant, Cohere Rerank, LLM open-source (Europe), Docker

Sécurité des bâtiments

Extraction d'informations sur rapports techniques

Contexte
Dépouillement manuel fastidieux de rapports denses et volumineux (observations de sécurité des bâtiments et rapports de commission) pour en extraire des entités très précises : bâtiment, équipement, nature et criticité de chaque constat.
Solution
À une époque où les fenêtres de contexte des LLM imposaient de fortes contraintes, conception d'un pipeline hybride : découpage intelligent pour localiser précisément les sections utiles dans des PDF volumineux, puis extraction structurée par prompt engineering avancé et typage des sorties (JSON structuré).
Évaluation
Validation des performances (précision / rappel) sur un échantillon représentatif de documents complexes, annotés à la main par les équipes métier.
Résultat
Plus de 90 % des informations critiques correctement extraites automatiquement ; temps de traitement manuel fortement réduit ; intégration transparente du flux de données dans les outils existants du client.

Technologies · LLM APIs, Pydantic (sorties structurées), pdfminer, Python

Vision par ordinateur · Plans 2D

Segmentation d'instances sur plans architecturaux 2D

Contexte
Automatisation du traçage manuel de polygones sur des plans 2D complexes. Le client exigeait une précision élevée pour que l'humain n'ait plus qu'à valider ou corriger les cas limites (murs inclinés, intersections). Contrainte majeure : très peu de données annotées au départ.
Solution
Pipeline de vision par ordinateur de bout en bout : stratégies agressives de data augmentation pour pallier le manque de données, évaluation de la qualité des annotations par lots, et fine-tuning d'un modèle de segmentation d'instances robuste (type Mask R-CNN / Detectron2). Algorithme de post-traitement géométrique pour redresser les polygones et lisser les murs.
Évaluation
Benchmarking de plusieurs architectures, mesuré via l'IoU (Intersection over Union), calculé avant et après la phase de post-traitement.
Résultat
Score d'IoU supérieur à 80 % après post-traitement. Détection entièrement automatisée et intégrée aux outils opérationnels des dessinateurs.

Technologies · Detectron2, Mask R-CNN, OpenCV, PyTorch

Recrutement · Immobilier

Matching candidats–offres

Contexte
Identification automatisée des profils les plus pertinents pour une offre donnée, avec une contrainte de démarrage à froid (cold start) : aucun jeu de données labellisé disponible pour entraîner un classifieur.
Solution
Approche évolutive en deux phases. Phase 1 : matching non supervisé par similarité sémantique (embeddings de texte) combinée à des heuristiques métier (compétences clés, contraintes géographiques), avec un POC de bout en bout (back-end IA + interface web légère). Phase 2 : transition vers un modèle de classification supervisé à mesure que l'usage du POC permettait de collecter et d'annoter une base de CV réelle.
Évaluation
Évaluation qualitative de la pertinence des classements, validée avec les recruteurs sur des offres réelles.
Résultat
POC validé, démontrant la viabilité de l'approche sémantique. Transition réussie vers un modèle de production plus stable et scalable, fondé sur les données collectées.

Technologies · scikit-learn, Sentence-Transformers, FastAPI, Python

Automatisation · Production

Analyse structurelle & comparateur de fichiers Excel complexes

Contexte
Un client manipulait des fichiers Excel volumineux (jusqu'à des centaines de milliers de lignes) et hautement hétérogènes : plusieurs tableaux imbriqués par feuille, en-têtes multiples et interdépendances complexes entre les onglets. Les modifications humaines rendaient impossible l'usage des comparateurs de fichiers classiques.
Solution
Un pipeline capable de comprendre le layout (la structure) des feuilles de calcul : il identifie et segmente automatiquement les différents tableaux au sein d'une même feuille, réassocie les en-têtes correspondants, et détecte les correspondances logiques entre onglets pour aligner et comparer ce qui est comparable.
Évaluation
Validation de la robustesse de la segmentation de layout sur des structures Excel « anarchiques » réelles, et tests de montée en charge sur des fichiers de plusieurs centaines de milliers de lignes.
Résultat
Génération d'un rapport Excel annoté mettant en évidence les modifications au niveau cellule (cellules modifiées, lignes ou colonnes ajoutées/supprimées) avec un contexte sémantique. Solution en production, faisant gagner un temps critique aux équipes métier.

Technologies · Python, pandas, openpyxl, scikit-learn

Vision par ordinateur · Détection open-vocabulary

Reconnaissance de produits industriels par l'image

Contexte
Identifier, à partir d'une simple photo terrain, la référence exacte et la marque d'un produit (outillage électroportatif, quincaillerie…) parmi un catalogue industriel de plusieurs dizaines de milliers d’images multi-marques. Défi : la discrimination fine à grande échelle, entre produits très similaires visuellement.
Solution
Recherche visuelle en deux temps : un modèle de détection open-vocabulary (VLM) localise et isole l'objet décrit en langage naturel, puis une projection dans un espace d'embeddings permet une recherche par similarité visuelle (index vectoriel FAISS) face au catalogue de référence.
Évaluation
Taux de reconnaissance (Top-1 et Top-5) mesuré autour de 90 % sur un jeu de test représentatif des conditions réelles (flou, variations de lumière).
Résultat
POC techniquement validé et industrialisable, démontrant la faisabilité d'un moteur de recherche visuel sur catalogue massif. En attente de validation budgétaire pour le déploiement.

Technologies · VLM (open-vocabulary), FAISS, PyTorch, Hugging Face