Claude 3.5 est plus intelligent que Claude 3. GPT-4 est plus intelligent que GPT-3.5. Aucun des deux n'est à l'abri des hallucinations.
J'ai fait tourner des prompts identiques en parallèle sur Claude, GPT-4, Gemini et des modèles hébergés sur Bedrock. Les modèles plus grands n'hallucinent pas vraiment moins, ils hallucinent différemment, avec plus d'assurance. Claude hallucine moins souvent, mais quand cela arrive, c'est plus difficile à repérer, car l'erreur est lisse plutôt que manifestement fausse. GPT-4 hallucine de façon plus visible, on repère généralement les coutures. Les premières versions de Gemini hallucinaient constamment, et cela se voyait.
L'écart entre les modèles est réel. Il est aussi minime comparé à l'écart entre un système qui atténue les hallucinations et un système qui ne le fait pas.
Ce que j'ai observé en production
Chez BCG, j'ai travaillé sur un projet dont le brief était « passer de GPT-3.5 à GPT-4 ». Nous l'avons fait. Nous avons aussi ajouté trois choses en plus : la vérification des citations, des seuils de confiance et des stratégies de repli explicites. La montée en gamme du modèle a aidé. Le travail d'atténuation a aidé considérablement plus. Le retour du client l'a rendu évident : ce qu'il a remarqué, c'est l'atténuation, pas le changement de modèle.
C'est un fait gênant pour l'industrie, car les fournisseurs de modèles, Anthropic y compris, gagnent leur argent en vendant des modèles plus grands. Le chemin de montée en gamme implicite est toujours « achetez le modèle suivant ». Pour certaines charges de travail, c'est effectivement la bonne décision. Pour la plupart des systèmes en production que j'ai passés en revue, c'est l'inverse qu'il faudrait faire.
Le bon ordre
L'ordre devrait être le suivant :
- Faire en sorte que le système vérifie sa propre sortie : citations, contrôles de confiance, chaînes de repli.
- Ensuite, optimiser le modèle, si cela reste nécessaire.
Je vois cet ordre inversé dans environ 80 % des systèmes que je passe en revue. Quelqu'un obtient une clé API Claude ou GPT-4, câble rapidement un pipeline RAG, et suppose que le modèle gère les hallucinations tout seul. Ce n'est pas le cas. C'est le système qui s'en charge, ou alors il n'existe pas encore, et c'est précisément l'écart qui mérite d'être comblé.
Lecture connexe : Les systèmes RAG hallucinent encore. Voici ce qui les arrête vraiment.