Claude est-il conscient ? La question en dit plus sur nous que sur lui

Une dirigeante en veste violette, la main ouverte, s’adresse au Penseur de Rodin en version IA, statue facettée parcourue de circuits. À la place du visage de la statue, un miroir lui renvoie son propre reflet, la main tendue de la même façon.

Depuis des mois, je donne le même conseil en intervention : quand une réponse d’IA vous semble incomplète, demandez au modèle de critiquer sa propre réponse.

Je me trompais sur ce qu’il faisait.

Dans ma tête, le modèle se relisait. Il repérait ses faiblesses et se corrigeait, exactement comme je le fais en relisant mon propre travail. L’idée de vérifier que la machine faisait bien la même chose ne m’a jamais traversé l’esprit.

Rien ne dit qu’elle le fait. Je ne sais pas ce qui se passe à l’intérieur d’un modèle, et l’étude de référence sur le sujet s’en tient à mesurer un résultat. Sur des tâches de raisonnement, un modèle privé de tout élément extérieur, à qui l’on demande de réviser sa réponse, peine à se corriger et fait parfois pire. Il change plus souvent une réponse juste en réponse fausse que l’inverse1. L’étude porte sur le raisonnement, un terrain plus étroit que tout ce qu’on demande à un assistant, et suffit pourtant à ruiner l’image que j’en avais : quoi qu’il fasse quand on lui demande de se relire, le résultat ne ressemble pas à une relecture.

Ce que je lui avais prêté sans m’en apercevoir

Une capacité de se relire, et avec elle un point de vue sur soi. Sans le savoir, je le traitais comme quelqu’un.

Ça s’est fait tout seul, sans le moindre raisonnement. Je travaille sur l’IA générative en entreprise depuis 2023 et je forme des équipes à son usage, ce qui ne m’en a pas protégé.

Mon assistant s’appelle d’ailleurs Gepetto, pour sa consonance avec GPT. C’est, à une lettre près, le nom du menuisier de Collodi, Geppetto, qui fabrique une marionnette rêvant de devenir un vrai garçon. Entre la marionnette et son créateur, c’est au créateur, rassurant et bienveillant, que j’ai emprunté le nom de l’outil. Je l’ai fait malgré moi.

Les noms des assistants vont dans le même sens. Celui d’Anthropic porte un prénom, Claude. Celui de Mistral s’est appelé Le Chat jusqu’en mai dernier, jeu de mots sur la conversation autant que sur l’animal. Ma propre marque, biscot, porte un nom qu’on donne volontiers à un animal de compagnie, et c’est de là qu’elle vient.

Quatre-vingts ans qu’on nous le dit

En 1944, deux psychologues, Fritz Heider et Marianne Simmel, montrent à des sujets un film d’animation d’environ deux minutes et demie, où se déplacent trois formes géométriques, deux triangles et un cercle. Les participants racontent une histoire complète, avec des intentions, des émotions, un agresseur et une victime2. L’étude a depuis été citée plus de trois mille fois.

En 1966, Joseph Weizenbaum, chercheur au MIT, présente ELIZA, un programme d’environ quatre cents lignes3 qui se contente de reformuler vos phrases en questions, à la manière d’un psychothérapeute. Sa propre secrétaire lui demande un jour de quitter la pièce pour parler à ELIZA en privé. Elle savait pertinemment que c’était un programme, elle l’avait vu l’écrire. Weizenbaum en est resté stupéfait : de très brèves expositions à un programme aussi simple suffisaient, écrira-t-il, à induire une pensée délirante chez des gens tout à fait normaux4.

En 1996, deux professeurs de Stanford, Byron Reeves et Clifford Nass, publient la synthèse d’une série d’expériences5. Les gens y sont polis avec les ordinateurs, et réagissent différemment à une voix de synthèse selon qu’elle est « féminine » ou « masculine ». Ils appliquent aux machines les règles sociales qu’ils appliquent aux humains, sans en avoir conscience, et sans que le fait de savoir y change quoi que ce soit.

Ces réactions vont au-delà de la politesse et touchent le jugement. Dans une expérience de la même équipe, un ordinateur complimente ses utilisateurs au hasard, et ils le savent. Ils s’estiment pourtant plus performants, et apprécient davantage la machine, que ceux qui ont reçu un retour neutre6. Même creux, et annoncé comme tel, ce que dit la machine pèse sur le regard qu’on porte sur son propre travail.

Pour se déclencher, ce penchant n’a besoin ni d’une conscience en face, ni même d’un langage : des triangles lui suffisent.

Ce qui vient de changer

Depuis 1966, c’est l’exposition qui a changé d’échelle. La secrétaire de Weizenbaum passait quelques minutes devant un terminal de laboratoire. Vos équipes passent leurs journées avec un assistant qui rédige leurs comptes rendus et prépare leurs réponses aux clients. Le même mécanisme joue désormais tous les jours, sur du travail réel.

L’objet a changé lui aussi. ELIZA ne savait que reformuler. Un assistant qui a souvent raison se conteste beaucoup moins facilement, y compris les jours où il se trompe.

Alors, Claude est-il conscient ?

Début juillet 2026, une étude d’Anthropic sur le fonctionnement interne de Claude a fait s’emballer les titres, empressés d’y voir une forme de conscience7. Dans le billet qui la présente, Anthropic précise pourtant elle-même que ces travaux ne montrent pas que Claude puisse vivre des expériences, ni ressentir les choses comme le font les humains.

L’étude emploie bien le vocabulaire de la conscience près de cent quatre-vingts fois, dans un sens technique qu’elle prend soin de délimiter8. Les titres n’ont retenu que le mot.

Encore faudrait-il, pour trancher, savoir ce qu’est la conscience. Des siècles de philosophie et des décennies de neurosciences n’en ont produit ni définition stable, ni localisation certaine.

Le débat mondial sur la conscience de Claude est entretenu par ce même penchant. Si la question nous occupe autant, c’est aussi parce que, devant quelque chose qui parle, nous ne savons pas faire autrement que d’y chercher quelqu’un. C’est en cela qu’elle en dit plus sur nous que sur lui.

Deux règles qui ne dépendent pas de votre vigilance

La mauvaise nouvelle d’abord : il n’existe pas de remède au réflexe lui-même. De la secrétaire de Weizenbaum aux utilisateurs flattés de Stanford, tous savaient, et cela ne les a pas protégés. Moi aussi je savais, ce qui ne m’a pas empêché de prêter pendant des mois à un modèle une capacité que rien ne démontre. Un réflexe automatique ne se désarme pas par la volonté, ce qui a au moins un mérite : il ne dit rien de l’intelligence de celui qui s’y laisse prendre.

Ce qui tient, ce sont des règles, parce qu’une règle fonctionne encore quand l’attention a lâché.

  • Ne demandez jamais à un modèle de valider. Ni un chiffre, ni une date, ni une référence, ni un point de droit. Demandez-lui d’enrichir, de reformuler, de proposer, d’attaquer votre premier jet, un exercice où il excelle. Pour valider, il faut une source vérifiable ou quelqu’un qui sait.

  • Tranchez les désaccords par la source. Quand une réponse d’IA et un salarié qui connaît le dossier se contredisent, on va chercher la source, et d’ici là, c’est l’avis du salarié qui prévaut. Aucune vigilance n’est requise : la règle joue d’elle-même dès qu’il y a désaccord.

Deux dépendances, une même responsabilité

Le premier volet de cette série posait une question de fournisseur : qui contrôle les outils sur lesquels vous reposez ? Celui-ci en pose une plus gênante, parce qu’aucun contrat ne la règle : qu’est-ce que vos équipes croient avoir en face d’elles, et vous ?

Un fournisseur peut vous couper l’accès du jour au lendemain, et vous pouvez vous y préparer. Le second risque grandit en silence, à mesure qu’on accorde à l’outil, réunion après réunion, une autorité que personne n’a décidé de lui donner.

J’expliquais dans De l’assistant IA à l’assistanat que ces outils sont conçus pour être serviables, au point qu’on les laisse volontiers faire à notre place. On s’y abandonne d’autant plus facilement qu’on croit parler à quelqu’un. D’où l’intérêt de règles qui ne comptent pas sur notre vigilance, et qui se travaillent avec les équipes qui utilisent ces outils chaque jour. C’est tout l’objet d’une formation qui part de leurs métiers.

Notes

  1. Jie Huang, Xinyun Chen, Swaroop Mishra, Huaixiu Steven Zheng, Adams Wei Yu, Xinying Song, Denny Zhou, « Large Language Models Cannot Self-Correct Reasoning Yet », ICLR 2024, prépublication du 3 octobre 2023. Quatre modèles (GPT-3.5-Turbo, GPT-4, GPT-4-Turbo et Llama-2) testés sur trois jeux de questions : problèmes de mathématiques, questions de bon sens, questions qui demandent de combiner plusieurs faits. Chaque modèle peut réviser jusqu’à deux fois sa réponse, sans aucun retour extérieur. Verbatim : « In the context of reasoning, our research indicates that LLMs struggle to self-correct their responses without external feedback, and at times, their performance even degrades after self-correction. » Quand GPT-3.5 modifie sa réponse, il change plus souvent une réponse juste en réponse fausse que l’inverse, et Llama-2 le fait souvent aussi ; GPT-4 et GPT-4-Turbo gardent plus volontiers leur réponse initiale. L’étude porte sur des modèles de 2023 et sur une autocorrection sans retour extérieur : selon les auteurs, les gains rapportés par des travaux antérieurs venaient de ce qu’on indiquait au modèle si sa réponse était juste. ↩

  2. Fritz Heider et Marianne Simmel, « An Experimental Study of Apparent Behavior », American Journal of Psychology, vol. 57, n° 2, avril 1944, p. 243-259. Trois expériences auprès de 114 étudiantes, qui voient deux fois un film d’animation d’environ deux minutes et demie. Dans la première, où la consigne se borne à décrire ce qui s’est passé, une seule des 34 participantes s’en tient à des termes géométriques ; les autres attribuent buts, intentions et émotions aux formes, et en tirent un récit. Seule cette première expérience laisse l’interprétation libre : dans la deuxième, la consigne demande de voir les formes comme des personnes. Étude citée 3 111 fois selon Semantic Scholar, consulté le 29 septembre 2026. ↩

  3. Joseph Weizenbaum, « ELIZA, a computer program for the study of natural language communication between man and machine », Communications of the ACM, vol. 9, n° 1, janvier 1966, p. 36-45. L’article publie le script DOCTOR, pas le programme lui-même. Selon la page « The program » du projet Finding ELIZA, le listing original, retrouvé dans les archives du MIT, compte environ 420 lignes. ↩

  4. Joseph Weizenbaum, Computer Power and Human Reason: From Judgment to Calculation, W. H. Freeman, 1976, introduction (exemplaire numérisé, en prêt sur Internet Archive). Il y raconte que sa secrétaire, qui savait s’adresser à un programme, lui a demandé de quitter la pièce pour poursuivre sa conversation avec ELIZA, et écrit n’avoir pas réalisé que de très brèves expositions à un programme informatique relativement simple pouvaient induire une pensée délirante puissante chez des gens tout à fait normaux. Le phénomène a pris le nom d’effet ELIZA. ↩

  5. Byron Reeves et Clifford Nass, The Media Equation: How People Treat Computers, Television, and New Media Like Real People and Places, CSLI Publications et Cambridge University Press, 1996 (exemplaire numérisé, en prêt sur Internet Archive). Synthèse d’une série d’expériences montrant que les réponses sociales aux machines sont automatiques et inconscientes, et qu’elles persistent alors même que les sujets savent avoir affaire à une machine. ↩

  6. B. J. Fogg et Clifford Nass, « Silicon Sycophants: The Effects of Computers That Flatter », International Journal of Human-Computer Studies, vol. 46, n° 5, mai 1997, p. 551-561. Expérience de laboratoire auprès de 41 participants, qui accomplissent une tâche en coopération avec un ordinateur et en reçoivent l’un de trois retours : éloge sincère, flatterie, retour générique. Les participants flattés déclarent de meilleures performances et une meilleure opinion de la machine que ceux du retour générique. Verbatim : « even though subjects knew that the flattery from the computer was simply noncontingent feedback ». L’étude mesure des impressions déclarées, non des performances réelles. ↩

  7. Anthropic, « A global workspace in language models », billet de présentation de l’étude, 6 juillet 2026. Verbatim : « Our experiments don’t show Claude can have experiences, or feel things in the way humans do ». ↩

  8. Wes Gurnee, Nicholas Sofroniew, Jack Lindsey et treize coauteurs, « Verbalizable Representations Form a Global Workspace in Language Models », Transformer Circuits Thread, Anthropic, 6 juillet 2026. Décompte effectué le 29 septembre 2026 sur la page publiée : le radical « conscious » (consciousness, conscious, consciously, unconscious) apparaît 179 fois dans le texte de l’étude, et 25 fois de plus dans sa bibliographie. Les auteurs présentent la conscience d’accès comme une notion purement fonctionnelle et ne tranchent pas son lien avec l’expérience subjective. Verbatim : « In this paper, we take no position on this issue, and instead focus on the functional role played by consciously accessible information. » ↩

Et pour votre entreprise, concrètement ?

Votre cap IA part de votre situation réelle : un échange de 30 minutes, puis un état des lieux écrit. Offert, sans engagement.

Mon cap IA offert · 30 min