Mémoire de bachelor, TUM
Recherche en IA / IA digne de confiance · 2025
Echo : Atténuer le potentiel d'hallucination dans les prompts utilisateur
Mon mémoire de bachelor. Une approche shift-left de l'atténuation des hallucinations des LLM, qui s'attaque au problème au niveau du prompt plutôt qu'après la génération.
Contexte
Point de départ et environnement
La recherche actuelle sur les hallucinations se concentre très majoritairement sur les facteurs du côté du LLM : qualité des données d'entraînement, architecture du modèle, stratégies de décodage. Pourtant, le prompt de l'utilisateur est une surface d'entrée contrôlable qui influence significativement le risque d'hallucination, une dimension encore largement sous-étudiée.
Défi
Contrainte principale à résoudre
Concevoir un système qui analyse les prompts avant la génération par le LLM afin d'identifier et d'atténuer les schémas propices aux hallucinations. Développer une nouvelle taxonomie des risques d'hallucination côté utilisateur ainsi qu'une métrique quantitative pour évaluer le risque d'un prompt.
Solution
Démarche de conception et de mise en œuvre
A construit un pipeline multi-agents (Analyzer, Initiator, Conversation, Preparator) avec une nouvelle taxonomie distinguant le Prompt Risk (ambiguïté au niveau des tokens) du Meta Risk (problèmes structurels). A introduit la Prompt Risk Density (PRD), une métrique pondérée permettant de quantifier le potentiel d'hallucination. A mis en œuvre un raffinement itératif avec supervision humaine, des sorties XML structurées et une visualisation des risques par code couleur.
Résultat
Impact mesurable et résultat de la livraison
A démontré que l'analyse shift-left des prompts réduit le risque d'hallucination en aval. A contribué au discours scientifique sur l'IA digne de confiance dans des domaines à forts enjeux (droit, santé, finance). A prouvé que de meilleurs prompts peuvent réduire l'écart d'accessibilité entre les modèles closed-source coûteux et les modèles open-source plus petits.
Point clé
“Les hallucinations sont autant un problème de prompt qu'un problème de modèle. Détecter le risque avant la génération coûte moins cher que de corriger de mauvaises sorties après coup, et une taxonomie claire a rendu le risque mesurable.”

Vous travaillez sur quelque chose de similaire ? Je prends en charge un nombre restreint de missions de conseil et de freelance en IA agentique, systèmes RAG et fiabilité des LLM.