La plupart des travaux sur les hallucinations des LLM ciblent le modèle : de meilleures données d'entraînement, des architectures améliorées, un décodage contraint. Tout cela compte, mais suppose implicitement que le prompt est une entrée fixe sur laquelle on ne peut rien faire.
Cette hypothèse est fausse. Chaque sortie de LLM implique deux acteurs : le modèle et l'utilisateur. Le prompt est la seule surface d'entrée entièrement contrôlée par l'utilisateur, et elle a une réelle influence sur le fait que le modèle finisse par inventer ou non. C'est le point de départ de mon mémoire de bachelor à la TUM, Echo, et c'est ce que signifie « shift-left » dans ce contexte : détecter le risque avant la génération, pas après.
Deux types de risque cachés dans un prompt
La première chose dont Echo avait besoin était un vocabulaire. Quand on examine les prompts qui produisent des hallucinations de façon fiable, les problèmes se répartissent en deux catégories distinctes :
Prompt Risk se situe au niveau du token : formulations ambiguës, références vagues, présuppositions qui glissent des affirmations non vérifiées. L'exemple classique est une question qui affirme au passage quelque chose de faux (« Pourquoi X a-t-il racheté Y en 2021 ? ») et invite le modèle à construire dessus.
Meta Risk est de nature structurelle : questions multi-hop qui enchaînent plusieurs inférences, surcharge de périmètre où un seul prompt demande cinq livrables, contraintes qui entrent silencieusement en conflit entre elles. Rien de tout cela n'est faux au niveau du mot. Le prompt est simplement construit d'une manière qui pousse le modèle au-delà de ce qu'il peut répondre de façon fiable.
Cette distinction compte parce que les correctifs diffèrent. Le Prompt Risk se résout en clarifiant les tokens. Le Meta Risk se résout en restructurant ou en scindant la requête.
En faire un chiffre
Une taxonomie est utile, mais « ce prompt me semble risqué » ne passe pas à l'échelle. Echo introduit donc la Prompt Risk Density (PRD) : un score pondéré à travers les catégories de risque, normalisé par la complexité du prompt, qui quantifie le potentiel d'hallucination avant même que la génération ne commence.
La normalisation est l'élément essentiel. Un prompt long et détaillé contient naturellement plus de segments signalables qu'un prompt court ; ce qui importe, c'est la densité du risque par rapport à ce que le prompt cherche à accomplir, pas le nombre brut.
Le pipeline
Echo met cela en œuvre sous la forme d'un pipeline multi-agents à quatre rôles : un Analyzer qui détecte et classe les risques, un Initiator et un agent Conversation qui pilotent le raffinement itératif avec l'utilisateur, et un Preparator qui assemble le prompt amélioré. Les sorties sont du XML structuré, et l'interface affiche le risque directement sur le texte du prompt avec un code couleur, afin de voir exactement quels segments posent problème, plutôt que de recevoir un générique « votre prompt n'est pas clair ».
Le human-in-the-loop était un choix délibéré. La réécriture entièrement automatique modifie ce que l'utilisateur voulait dire suffisamment souvent pour être dangereuse ; la boucle de raffinement laisse à l'utilisateur le contrôle de l'intention pendant que le système gère la détection des risques.
Ce que j'en ai retenu
Deux choses me sont restées, au-delà du mémoire lui-même.
D'abord, détecter le risque avant la génération coûte moins cher que corriger de mauvaises sorties après coup. La vérification post-hoc d'une réponse hallucinée signifie que la génération est déjà payée, et qu'il faut désormais un second système pour la vérifier. L'analyse côté prompt s'exécute sur une entrée bien plus petite, avant que le dommage ne survienne.
Ensuite, de meilleurs prompts réduisent l'écart entre les catégories de modèles. Dans l'évaluation du mémoire, des prompts raffinés ont aidé des modèles open source plus petits à combler une partie de la distance qui les séparait de modèles propriétaires coûteux. Pour des domaines à forts enjeux comme le droit, la santé et la finance, où les contraintes de déploiement excluent de toute façon souvent les plus gros modèles, c'est un résultat pratique, pas seulement académique.
Le mémoire, le code source et une démo sont disponibles sur la page recherche. Si vous travaillez sur la fiabilité des LLM et souhaitez échanger, contactez-moi.