IA et Avocats – Épisode 5 sur 20
Priés d’identifier les différences factuelles entre une espèce et un précédent, les modèles à raisonnement réussissent dans 64,82 à 92,09 % des cas. Priés d’en tirer les distinctions décisives, ils tombent entre 11,46 et 33,99 %. Et ils dépensent plus de calcul sur leurs réponses fausses que sur leurs réponses justes (L. Zhang et al., symposium CSLAW, Berkeley, mars 2026).
Le raisonnement affiché s’est banalisé. Apparu fin 2024 avec la série o1, il ne constitue plus une gamme de produits, mais un mode d’exécution qu’on active dans les modèles généralistes. La question — faut-il les adopter ? — a cessé d’avoir un sens : ils sont déjà là. Reste celle du risque : cette délibération en change-t-elle la nature, ou se borne-t-elle à le déplacer plus loin dans le texte ?
Du produit au paramètre
Ces modèles insèrent une étape avant la réponse : une chaîne de pensée où le système décompose la question, envisage plusieurs pistes, puis converge. Cette chaîne n’est pas un raisonnement au sens juridique : elle demeure une suite de prédictions probabilistes, organisée en étapes explicites plutôt que d’un seul tenant.
La série dont procède cette architecture s’éteint : OpenAI a retiré o3 de ChatGPT le 26 août 2026, et son retrait de l’interface de programmation est fixé au 11 décembre. Les modèles généralistes qui la remplacent intègrent la délibération comme un paramètre, dont l’intensité se règle requête par requête.
Le déplacement n’est pas seulement commercial : il change la décision que prend le cabinet. On ne choisit plus un modèle capable de réfléchir ; on décide, tâche par tâche, s’il faut en payer le temps et le coût. Une relecture de clause ne l’appelle pas ; l’analyse d’un montage à plusieurs branches contentieuses, si.
Ce que la délibération améliore
Le premier essai randomisé contrôlé consacré à ces outils a réparti 137 étudiants avancés de deux facultés américaines entre trois conditions — modèle à raisonnement, outil à récupération documentaire, aucun outil — sur six tâches réalistes. Les gains de productivité vont de 50 à 130 % sur cinq des six tâches ; la qualité du travail progresse dans les deux groupes équipés, ce qui rompt avec les études sur GPT-4. Le modèle à raisonnement se distingue sur un point : la force de l’analyse, dans les deux tâches les plus exigeantes.
Deux réserves : les gains de qualité n’atteignent pas la seule tâche transactionnelle testée, la rédaction d’un contrat bref ; et les participants étaient étudiants, non avocats.
Il est vrai que la chaîne de pensée a fait ses preuves. Encore faut-il regarder où. La méta-analyse de Z. Sprague et de ses coauteurs — plus de cent travaux, vingt jeux d’épreuves, quatorze modèles — établit que son bénéfice se concentre sur les tâches mathématiques et symboliques : sur l’épreuve MMLU, 95 % du gain tient aux questions comportant un signe « = ». Le droit n’est ni mathématique ni symbolique.
Ce qu’elle n’améliore pas
L’exactitude des références, d’abord. L’article précédent l’a rapporté : dans le même essai, le modèle à raisonnement a produit onze citations inexistantes, contre trois pour l’outil à récupération documentaire. Approfondir l’analyse et ancrer les sources : deux fonctions distinctes, deux outils distincts.
La conduite d’un raisonnement en plusieurs étapes, ensuite. Le jeu d’épreuves MSLR, construit sur 1 389 décisions chinoises en matière de délit d’initié, annotées selon la grille IRAC, mesure la couverture des étapes du raisonnement expert : sur dix-neuf modèles évalués, aucun n’atteint 75 %. Corpus chinois, matière unique : la transposition appelle prudence.
Reste le résultat cité en tête. La performance s’effondre dès que les étapes doivent être intégrées, c’est-à-dire dès que la tâche ressemble à celle de l’avocat. Et la durée de la délibération ne mesure pas la fiabilité, puisqu’elle croît sur les réponses fausses.
La chaîne affichée n’est pas le compte rendu du calcul
Cette chaîne est plausible, non nécessairement fidèle. M. Turpin et ses coauteurs l’ont montré dès 2023 : un biais glissé dans la question oriente la réponse sans jamais apparaître dans les étapes affichées. L’équipe Alignment Science d’Anthropic l’a mesuré en 2025 sur les modèles à raisonnement : lorsqu’un indice inséré dans la question a déterminé la réponse, le modèle le mentionne dans 25 % des cas pour Claude 3.7 Sonnet, 39 % pour DeepSeek R1 ; la fidélité décroît à mesure que la difficulté augmente. Lire les étapes du modèle procure donc un sentiment de contrôle qui croît là même où sa justification décroît.
De là un enseignement contre-intuitif. Les auteurs du jeu MSLR ont comparé les chaînes que le modèle conçoit seul aux trames rédigées par des juristes : les premières l’emportent pour la cohérence et la qualité du raisonnement. La documentation d’OpenAI déconseille l’instruction « procéder étape par étape ». La trame que l’avocat impose spontanément — qualification, texte, application, conséquence — fait sortir le modèle de son propre mécanisme. Mieux vaut exposer le dossier et la question, puis contrôler la sortie.
En définitive
Le guide du Conseil national des barreaux, adopté en mars 2026, pose le contrôle humain de tout contenu généré en obligation pivot. Le mode raisonnement n’en dispense pas ; il le rend plus exigeant. Il est permis de penser qu’une erreur délibérée arrive mieux construite, mieux ordonnée, mieux argumentée qu’une erreur produite d’un trait — et que le soupçon, précisément, ne se porte pas là.
Le prochain article ouvre la deuxième phase : secret professionnel, données, RGPD.
Sources de l’article : L. Zhang, M. Grabmair, M. Gray et K. Ashley, « Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning », CSLAW ’26, Symposium on Computer Science and Law, ACM, Berkeley, 3-5 mars 2026. DOI 10.1145/3788646.3789522 — prépublication arXiv:2510.08710 : en cliquant-ici.
D. Schwarcz, S. Manning, J. J. Prescott, P. Barry, D. R. Cleveland et B. Rich, « AI-Powered Lawyering: AI Reasoning Models, Retrieval Augmented Generation, and the Future of Legal Practice », Journal of Law and Empirical Analysis, 2026, vol. 3, n° 1. DOI 10.1177/2755323X261427048. Z. Sprague, F. Yin, J. D. Rodriguez et al., « To CoT or Not to CoT? Chain-of-Thought Helps Mainly on Math and Symbolic Reasoning », ICLR 2025, arXiv:2409.12183 : en cliquant-ici.
W. Yu, X. Lin, L. Ni, J. Cheng et L. Sha, « Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models », arXiv:2511.07979, 11 novembre 2025 (v3, 20 novembre 2025) ; version de revue parue dans Information Processing & Management, 2026 : en cliquant-ici.
M. Turpin, J. Michael, E. Perez et S. R. Bowman, « Language Models Don’t Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting », arXiv:2305.04388, 2023 : en cliquant-ici.
Y. Chen, J. Benton et al. (Anthropic, Alignment Science Team), « Reasoning Models Don’t Always Say What They Think », arXiv:2505.05410, 2025 : en cliquant-ici.
OpenAI, Reasoning best practices, OpenAI API Developers Guide : en cliquant-ici.
OpenAI, Model release notes (retrait d’o3 de ChatGPT le 26 août 2026) et Deprecations (retrait des instantanés o3-2025-04-16 et o3-pro-2025-06-10 de l’API le 11 décembre 2026) : en cliquant-ici.
Conseil national des barreaux, commission des règles et usages, La déontologie et l’intelligence artificielle, guide pratique, 1re édition, avril 2026, adopté par l’assemblée générale des 12 et 13 mars 2026 : en cliquant-ici.
Cet article fait partie d’une série intitulée
IA et Avocats
À travers cette série, Thierry Wickers essaye de décrypter, de façon claire et accessible, les mécanismes de l’IA générative et leurs implications concrètes pour la profession d’avocat.
Auteur de l’article
Thierry Wickers
Avocat associé à Elige Bordeaux
0 commentaires