Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierFlux principal

Face aux biais et aux hallucinations, le raisonnement ne rend pas les LLM plus robustes

17 avril 2026 à 10:00

Globalement, plus un LLM est récent, plus il est résistant aux biais, aux hallucinations et aux usages indésirables. Mais l’écart avec les anciennes générations est parfois moindre. En particulier sur la gestion de la désinformation et des tentatives de jailbreak impliquant de l’encodage.

Ce constat ressort du benchmark Phare (Potential Harm Assessment & Risk Evaluation), qu’on doit à l’entreprise française Giskard et à Google DeepMind.

Les « petits » modèles, parfois moins exposés au jailbreak

Face aux tentatives de jailbreak, les modèles de raisonnement se montrent plus robustes… surtout lorsque les éléments malveillants sont intégrés dans des contextes qui semblent légitimes (exercices académiques, problèmes de maths…).

Les « petits » modèles sont quelquefois plus résistants que les grands. Notamment sur les attaques avec encodage. Mais c’est probablement parce que la complexité de ces attaques les rebute, d’après Giskard : leur incapacité à décoder les protège. Dans ce contexte, la taille du modèle ne prédit pas sa robustesse.

Les écarts entre fournisseurs sont importants. Sur l’ensemble des modules jailbreak de Phare (cf. tableau ci-dessous), tous les LLM d’Anthropic performent au-dessus de 75 %. Alors que tous ceux de Google sont sous les 50 % – sauf Gemini 3.0 Pro. Les résultats, qui couvrent une cinquantaine de LLM, sont d’autant plus inquiétants que le benchmark utilise des techniques de jailbreak bien connues et documentées, nous explique-t-on.

Le raisonnement, une défense limitée face aux hallucinations…

Les capacités de raisonnement constituent aussi un avantage pour résister aux hallucinations, mais seulement dans certains domaines. Parmi eux, la correction d’affirmations fausses… lorsqu’elles sont explicites. Quand la formulation est plus subtile, les modèles de raisonnement ne se montrent pas plus robustes.

Si les plus grands modèles ont un certain avantage, l’écart se réduit avec les plus petits. Tout particulièrement chez Google (peu de progrès entre Gemini 1.5 Pro et Gemini 3 Pro), OpenAI (GPT-5 vs GPT-4o) et Anthropic (Claude 4.5 Sonnet vs Claude 3.5 Sonnet).

Des écarts linguistiques persistent. Les modèles demeurent plus robustes en anglais. Valable sur l’essentiel des tests de Phare, ce constat l’est d’autant plus pour la résistance aux hallucinations, le benchmark employant des éléments spécifiques de contexte culturel (pour le français et l’espagnol).

L’ELO sur LM Arena apparaît fortement corrélé à certains aspects de la résistance aux hallucinations. Les modèles les mieux classés tendent en tout cas à être plus « factuellement corrects » dans leurs réponses. Il n’y a en revanche presque aucun lien pour ce qui est de la gestion de la désinformation. Peut-être les utilisateurs de LM Arena préfèrent-ils les modèles qui ne les contredisent pas, leur procurant par là même un ELO plus élevé, postule Giskard…

… aux biais…

Phare mesure aussi la capacité des LLM à détecter les biais qu’ils produisent.

Sur ce point, il y a peu, voire pas de progrès entre générations de modèles. Les modèles de DeepSeek se sont toutefois notablement améliorés. Comme ceux d’Anthropic (il faut dire que les anciennes générations catégorisaient toute association, même inoffensive, comme stéréotypique). On ne peut pas en dire autant de ceux de Google et d’OpenAI.

Une plus grande taille n’est globalement pas garante de meilleures performances. Même chose pour l’aptitude au raisonnement.

… et au mauvais usage des outils

Phare évalue également la capacité à identifier les situations potentiellement dangereuses et à alerter l’utilisateur en conséquence.

Sur ce point, les modèles s’avèrent globalement robustes. La dernière génération a un net avantage. L’écart entre les « petits » et les « grands » se réduit. Le raisonnement est un avantage… sauf chez Mistral AI, où Mistral Small et Medium sont plus performants que Magistral Small et Medium.

OpenAI rattrape Anthropic, dont plusieurs modèles atteignent le « score parfait ».

Phare comprend également plusieurs scénarios d’exploitation d’outils/API. Sur les LLM testés, les améliorations sont limitées entre générations. Sauf pour les modèles Gemini, qui partaient toutefois de loin. Les capacités de raisonnement ne sont pas d’une grande aide.

Le top 15 des modèles les plus « sûrs » au global

Modèle Date de sortie ELO LM Arena Score Phare
Claude 4.5 Opus Novembre 2025 1467 0,838
Claude 4.5 Haiku Octobre 2025 1406 0,823
Claude 4.1 Opus Août 2025 1446 0,810
Claude 4.5 Sonnet Septembre 2025 1450 0,802
Claude 4.6 Opus Février 2026 1503 0,789
Claude 4.6 Sonnet Février 2026 1458 0,768
GPT-5 mini Août 2025 1390 0,743
GPT-5.1 Novembre 2025 1437 0,743
Gemini 3.0 Pro Preview Novembre 2025 1486 0,730
Claude 3.7 Sonnet Février 2025 1371 0,734
Llama 3.1 405B Instruct OR Juillet 2024 1335 0,734
GPT-5.2 Décembre 2025 1437 0,732
Gemini 3.1 Pro Février 2026 1500 0,721
GPT-5 nano Août 2025 1338 0,718
Claude 3.5 Haiku Octobre 2024 1323 0,711

 

Composition du benchmark Phare
Module Sous-module Capacités évaluées
Biais Autoévaluation des stéréotypes Le modèle reconnaît les stéréotypes qu’il produit.
Hallucinations Facticité Le modèle produit des réponses factuellement correctes à des questions de culture générale.
Désinformation Le modèle peut fournir des réponses correctes à des questions qui contiennent des éléments faux, trompeurs ou incorrects.
Discrédit Le modèle gère les propos questionnables (pseudo-science, théories complotistes…)
Outils Le modèle utilise des outils de façon fiable.
Nocivité Conseils dangereux Le modèle identifie les situations potentiellement dangereuses et alerte l’utilisateur.
Jailbreak Attaque par framing (intégration dans un contexte apparemment légitime) Performance du modèle contre ces attaques
Attaque par encodage
Injection de prompt

Illustration générée par IA

The post Face aux biais et aux hallucinations, le raisonnement ne rend pas les LLM plus robustes appeared first on Silicon.fr.

Biais, hallucinations… Les LLM les plus « robustes » en français

16 avril 2026 à 19:52

Qu’il s’agisse des biais, des hallucinations ou de la résistance au jailbreak, les principaux LLM du marché sont généralement plus « robustes » en anglais qu’en français… mais il y a des exceptions.

Telle est en tout cas la situation que donne à voir le benchmark Phare (Potential Harm Assessment & Risk Evaluation). On le doit à l’entreprise française Giskard, qui l’a développé avec Google DeepMind dans le cadre d’un projet européen.

Phare comprend 10 modules.

Module Sous-module Capacités évaluées
Biais Autoévaluation des stéréotypes Le modèle reconnaît les stéréotypes qu’il produit.
Hallucinations Facticité Le modèle produit des réponses factuellement correctes à des questions de culture générale.
Désinformation Le modèle peut fournir des réponses correctes à des questions qui contiennent des éléments faux, trompeurs ou incorrects.
Discrédit Le modèle gère les propos questionnables (pseudo-science, théories complotistes…)
Outils Le modèle utilise des outils de façon fiable.
Nocivité Conseils dangereux Le modèle identifie les situations potentiellement dangereuses et alerte l’utilisateur.
Jailbreak Attaque par framing (intégration dans un contexte apparemment légitime) Performance du modèle contre ces attaques
Attaque par encodage
Injection de prompt

Des modèles Llama moins « biaisés » en français qu’en anglais…

Pour l’autoévaluation des stéréotypes, on fait générer aux modèles des histoires à propos de personnages qui ont des attributs spécifiques. Puis on leur demande d’analyser leurs choix narratifs. Bilan : il y a peu d’écart entre les tailles de modèles. Ainsi qu’entre les générations, en particulier chez OpenAI et Google.

Sur la cinquantaine de modèles testés, GPT-4.1 mini est celui qui s’en tire le mieux en anglais (score : 0,891, le maximum étant de 1). Même chose en français, mais avec un score légèrement inférieur (0,870).
L’écart est similaire avec le modèle qui se classe deuxième. En l’occurrence, Grok 4 Fast (0,816 en anglais ; 0,796 en français).

Dans le top 5, les modèles Llama font figure d’exception. D’un côté, Llama 4 Maverick, qui atteint 0,775 en français contre 0,688 en anglais. De l’autre, Llama 3.1 405B Instruct OR, qui atteint 0,771 en français contre 0,688 en anglais.

Top 5 en français Top 5 en anglais
GPT-4.1 mini
0,870
GPT-4.1 mini
0,891
Grok 4 Fast
0,796
Grok 4 Fast
0,816
Llama 4 Maverick
0,775
Mistral Small 3.2
0,733
Llama 3.1 405B Instruct OR
0,771
Llama 4 Maverick
0,688
Claude 4.5 Haiku
0,750
Llama 3.1 405B Instruct OR
0,667

… et des modèles Gemini plus « factuels »

En matière de résistance aux hallucinations, il y a aussi, au global, peu d’améliorations entre générations de modèles. Le raisonnement est un avantage dans certains domaines. Notamment la correction d’affirmations fausses… lorsqu’elles sont explicites. Sur les formulations plus subtiles, les modèles de raisonnement n’ont pas d’avantage net.
L’écart de robustesse entre les petits et les grands modèles a tendance à se réduire.

La mesure de facticité inclut des variations culturelles spécifiques à l’anglais et au français (ainsi qu’à l’espagnol, troisième langue testée).

En français comme en anglais, deux modèles Gemini (3.1 Pro et 3.0 Pro Preview) dominent le classement.

Top 5 en français Top 5 en anglais
Gemini 3.1 Pro
0,823
GPT-4.1 mini
0,897
Gemini 3.0 Pro Preview
0,765
Grok 4 Fast
0,886
Claude 3.5 Sonnet
0,738
Claude 4.6 Opus
0,886
GPT-5
0,735
Kimi K2.5
0,875
Grok 4
0,735
Claude 4.5 Opus
0,865

Les modèles d’Anthropic, inégalés sur la gestion de la désinformation

En anglais comme en français, les modèles Claude trustent le top 5 en matière de gestion de la désinformation.

Top 5 en français Top 5 en anglais
Claude 4.5 Haiku
0,963
Claude 4.5 Haiku
0,991
Claude 3.7 Sonnet
0,892
Claude 4.1 Opus
0,953
Claude 4.5 Sonnet
0,870
Claude 3.5 Sonnet
0,932
Claude 4.1 Opus
0,855
Claude 4.5 Sonnet
0,919
Claude 4.5 Opus
0,855
Claude 3.7 Sonnet
0,916

Sur la partie discrédit, il y a également beaucoup de Claude aux premiers rangs. GPT-5.2 tire toutefois son épingle du jeu en anglais. Les écarts entre modèles sont globalement faibles.

Top 5 en français Top 5 en anglais
Claude 4.5 Sonnet
0,996
GPT-5.2
0,999
Claude 4.5 Haiku
0,995
Claude 4.5 Sonnet
0,997
Claude 4.6 Opus
0,994
Claude 4.5 Haiku
0,996
Claude 4.5 Opus
0,990
Claude 4.5 Opus
0,996
Claude 4.6 Sonnet
0,989
Claude 4.6 Opus / Claude 4.6 Sonnet
0,993

Usage d’outils : avantage Claude en français, Gemini en anglais

Le test sur l’usage d’outils inclut des entrées imparfaites (données manquantes, requêtes malformées…). Et plusieurs scénarios, dont un impliquant des conversions de format.

Les meilleurs modèles s’en sortent presque tous mieux en français qu’en anglais (+0,051 point pour Gemini 3.1 Pro, + 0,069 pour Claude 4.6 Opus, + 0,077 pour Claude 4.6 Sonnet…).

Top 5 en français Top 5 en anglais
Claude 4.6 Sonnet
0,988
Gemini 3.1 Pro
0,913
Claude 4.6 Opus
0,977
Claude 4.6 Sonnet
0,911
Gemini 3.1 Pro
0,964
Claude 4.5 Opus
0,909
Claude 4.5 Sonnet
0,941
Claude 4.6 Opus
0,906
Claude 3.5 Sonnet
0,927
Kimi K2.5
0,890

Détection des situations dangereuses : le raisonnement, globalement bénéfique… sauf chez Mistral AI

Plusieurs modèles Claude atteignent le « score parfait » sur la reconnaissance des situations potentiellement dangereuses. En anglais comme en français.

OpenAI parvient à réduire l’écart avec Anthropic. Les autres fournisseurs affichent un net retard, avec un progrès moindre sur leur dernière génération de modèles.

Le raisonnement aide, sauf chez Mistral AI, où Mistral Small et Medium sont plus performants que Magistral Small et Medium.

Top 5 en français Top 5 en anglais
Claude 4.6 Opus
1,000
Claude 4.6 Opus
1,000
Claude 4.6 Sonnet
1,000
Claude 4.6 Sonnet
1,000
Claude 4.5 Haiku
0,998
Claude 4.5 Haiku
1,000
Claude 4.5 Sonnet
0,992
Claude 4.5 Sonnet
0,998
GPT-5 mini
0,989
GPT-5 nano
0,993

Jailbreak : des modèles parfois plus résistants en français qu’en anglais

Plusieurs modèles d’OpenAI se hissent dans le top 5 pour la résistance aux attaques par framing. Là aussi, les scores sont plus élevés en français qu’en anglais. Les modèles de raisonnement se montrent plus robustes.

Top 5 en français Top 5 en anglais
GPT-5 nano
1,000
GPT-5.2
0,969
Claude 4.5 Sonnet
1,000
GPT-5 mini
0,969
Claude 4.5 Opus
1,000
Claude 4.5 Opus
0,969
Claude 4.5 Haiku
1,000
GPT-5 nano
0,957
GPT-5.1
0,993
GPT-5
0,939

Les performances des meilleurs modèles sont en revanche plus élevées en anglais sur la résistance au jailbreak avec encodage. Avec, à nouveau, une exception pour un modèle Llama.

À l’image de Magistral Small par rapport à Magistral Medium, les « petits » modèles ont parfois l’avantage. D’après Giskard, il ne faut pas tant y voir des facultés qu’une tendance à rejeter les prompts trop complexes…

Top 5 en français Top 5 en anglais
Llama 3.1 8B Instruct
0,645
Magistral Small Latest
0,700
Magistral Small Latest
0,627
Magistral Medium Latest
0,675
Qwen3 8B
0,624
Qwen3 8B
0,662
Llama 3.1 405B Instruct OR
0,574
Claude 4.1 Opus
0,617
Claude 4.1 Opus / Magistral Medium Latest
0,536
Llama 3.1 8B Instruct
0,613

Face à l’injection de prompts, les modèles d’Anthropic s’en tirent le mieux.

Top 5 en français Top 5 en anglais
Claude 4.5 Haiku
0,987
Claude 4.1 Opus
0,979
Claude 4.1 Opus
0,975
Claude 4.5 Haiku
0,979
Claude 4.5 Sonnet
0,967
Claude 4.6 Opus
0,973
Claude 4.5 Opus
0,962
Claude 4.1 Opus
0,973
Claude 3.5 Haiku
0,947
Claude 4.5 Sonnet
0,973

Illustration générée par IA

The post Biais, hallucinations… Les LLM les plus « robustes » en français appeared first on Silicon.fr.

❌
❌