Dans cet essai, je soutiens que les LLM ne sont pas des perroquets stochastiques, en évaluant les thèses de (Bender et al., 2021), qui ont forgé l’expression « perroquet stochastique » pour exprimer l’idée que la production des LLM est 1) aléatoire, 2) incohérente, 3) dépourvue de sens, parce que, à la suite de (Harnad, 1990), elle produit des symboles qui ne sont pas ancrés dans l’existence phénoménale humaine au sein d’un monde physique. Je présente un concept de « réseaux de sens », une conception réticulaire du sens des termes, qui consiste en des associations pondérées, multimodales et socialement stabilisées, constituant ce qu’un terme signifie pour un locuteur. L’argument principal de l’essai consiste à montrer que les LLM produisent des résultats qui héritent indirectement de l’ancrage du langage produit par les humains, lequel est lui-même ancré. L’usage des données linguistiques comme interface vers l’existence humaine dans le monde physique souffre d’une compression avec perte : toute interface qui traduit l’existence humaine, qui est un « signal continu » (pour reprendre la terminologie de l’informatique), en unités discrètes, comme les symboles linguistiques, perd la richesse du détail. L’ancrage est donc à la fois indirect et avec perte. Comparés à l’intelligence et à l’usage du sens au niveau humain, les LLM occupent une niche jamais vue auparavant : celle de systèmes qui produisent une production linguistique de niveau humain dont le sens a une modalité purement symbolique. Les réseaux de sens générés par les LLM peuvent être compris comme un exemple extrême d’intelligence humaine chargée de langage.
Introduction
Depuis au moins la seconde moitié du XXe siècle, notre société a été qualifiée de société de l’information, de société en réseaux, de société postindustrielle, etc.[1] Tous ces termes reflètent le mode dominant de fonctionnement de la société. L’information, les réseaux, les abstractions et le savoir symbolique sont les monnaies du jour. Les individus très instruits, doués pour la pensée analytique et abstraite et pour le traitement de l’information, sont les professionnels recherchés. L’avènement du cognitivisme en philosophie de l’esprit et dans les sciences cognitives a marqué le début de l’ère où la métaphore de l’homme comme processeur d’information a commencé à être prise au sérieux, jusqu’à la pointe de notre quête pour comprendre qui nous sommes et comment fonctionne notre esprit. Les travaux de Simon et Newell sur les logiciels Logic Theorist et General Problem Solver, l’ELIZA de Weizenbaum, le SHRDLU de Winograd, et même les Syntactic Structures de Chomsky puis le tournant biologique en linguistique, ne furent que quelques-unes des nombreuses théories et des nombreux projets visant à expliquer la cognition humaine en invoquant la logique et le langage comme ingrédients essentiels de l’intelligence humaine. Il est vrai que, depuis, les sciences cognitives et l’IA ont connu des changements majeurs. Les changements de paradigme connexionniste et 4E ont mis l’accent sur l’usage des réseaux de neurones et sur le rôle du corps enchâssé dans des contextes situés et, plus largement, culturels et sociaux, pour créer un modèle plus fidèle du fonctionnement des processus cérébraux et de la cognition humaine. Mais l’attention portée à la compréhension de l’intelligence, humaine comme artificielle, reste primordiale.
Pourtant, l’arrivée de ChatGPT, Bard, Claude et d’autres chatbots fondés sur l’architecture des grands modèles de langage (LLM) nous oblige à reconsidérer qui nous sommes. Les LLM montrent que l’usage du langage, qui est le trait le plus distinctif de l’homme par rapport à toutes les autres espèces animales, peut être automatisé pour produire des réponses semblables à celles d’un humain, passant le test de Turing avec aisance, surpassant l’humain moyen dans le traitement des données factuelles, le raisonnement logique ou les capacités langagières. Si les LLM battent les humains dans les tâches que nous considérons comme proprement humaines, une intelligence artificielle fondée sur les LLM ne devient-elle pas plus semblable à nous que nous-mêmes ? Il semble absurde de prétendre que le LLM, une machine formelle de prédiction de chaînes de symboles, puisse atteindre le statut d’être humain. À moins d’être hypocrites, nous ne pouvons pas cesser de louer l’intelligence et la compétence linguistique humaines comme les plus hautes valeurs cognitives humaines au moment même où une autre entité nous devient supérieure. Pour éviter l’énigme ontologique de ce que signifie être humain, je poserai la question autrement : les LLM peuvent-ils, même en théorie, devenir plus intelligents que les humains ? Pour éviter, là encore, de définir ce qu’est l’intelligence, je restreindrai encore mon enquête : quoi que signifie être intelligent, je présuppose que l’intelligence de type humain exige la compréhension ; et la compréhension exige de saisir ce que signifient les mots, les phrases ou les concepts. Sans compréhension du sens, il ne peut y avoir d’intelligence.
Réseaux de sens : une intersection de la phénoménologie et des significations linguistiques
Il est important de clarifier ce que j’entends par sens. Je ne présenterai pas ici un panorama des théories du sens en philosophie analytique. Ce que je peux esquisser ici, c’est une théorie minimale du sens qui se heurte à la fois à la théorie référentielle du sens et à la théorie vériconditionnelle du sens.
Imaginons que nous voulions parler du sens du mot « mère ». Ma mère est décédée il y a quelques mois. Voici ce que génère mon esprit lorsque je pense au sens de ce mot : je me souviens de l’image visuelle du visage sombre de ma mère et de la froideur de son front lorsque je l’ai embrassée, alors qu’elle reposait dans le cercueil à l’église. Je me souviens de l’odeur de l’encens, tandis que j’entendais les notes de Dancing Queen d’ABBA jouées par le quatuor à cordes, à l’alto, aux violons et au violoncelle. J’ai des souvenirs tactiles d’avoir serré dans mes bras ma mère malade quelques jours avant sa mort. J’éprouve des sentiments non objectivables de tristesse, de remords et de bonheur en pensant à ce mot. Mon esprit gravite aussi autour de la question de ce que signifie être mère, dont j’ai discuté avec ma fiancée enceinte. Mon esprit est également conscient des liens purement linguistiques que le mot « mère » entretient avec d’autres mots comme « père », « grossesse », « femme », « enfants », etc., et des relations linguistiques entre le mot « mère » et d’autres traits de la langue (le pronom « ma », le pluriel « mères », le gérondif « ne respirant plus », etc.). Je suis aussi conscient des connotations du mot « mère » que j’ai assimilées dans ma compréhension du mot en lisant des journaux, de la littérature, ou en apprenant de manière intersubjective, en parlant avec d’autres gens, ce que les mères peuvent faire ou à quoi elles ressemblent.
Le sens du mot « mère » est pour moi à la fois privé et public. Le sens privé se compose d’éléments relevant de diverses modalités perceptives et de symboles linguistiques. Le sens public, externe, se compose de ce que j’ai entendu et assimilé de ma communauté et de la société en général, habituellement sous la forme de symboles linguistiques (c’est-à-dire de mots et de phrases), qui ont pu affecter mes sous-significations existantes, non linguistiques et issues de la perception, par une boucle de rétroaction (par exemple, lorsque j’ai entendu combien la mère de quelqu’un s’était mal comportée, j’ai commencé à apprécier davantage ma mère et à ressentir plus d’amour pour elle, modifiant mes sous-significations antérieures issues des sentiments).
Si nous empruntons en outre à la théorie des réseaux les termes de base de « nœud » et d’« arêtes », leur équivalent serait
nœud = mots / concepts
arête = élément de sens pouvant relever de nombreuses modalités : représentations perceptives ou symboliques, sentiments, autres nœuds médiatisés par les représentations symboliques
Comme nous pouvons le voir, le sens d’un mot est avant tout un sens pour moi, qui existe dans mon esprit. C’est un « réseau de sens » multimodal, fait d’éléments à la fois perceptifs et linguistiques. Ce « réseau de sens » n’est pas statique : il réagit dynamiquement à mon existence située dans le monde, et de nouveaux éléments perceptifs ou linguistiques peuvent y être ajoutés ou éventuellement retirés (ou plutôt supplantés) à tout moment.
Le terme « mère » ne peut pas renvoyer à un seul « objet » existant dans le monde. Je laisse de côté la distinction frégéenne entre « sens » et « référence », qui présuppose des référents et un sens stables. Je veux proposer à la place une sémantique multimodale et réticulaire, où le sens des termes est égal aux réseaux de sens eux-mêmes. Je peux ainsi intégrer des données sensorielles, des sentiments, de l’imagerie visuelle, de fausses croyances, des mots, des concepts, des souvenirs de nombreuses modalités dont j’ai le sentiment net et clair qu’ils constituent ce que je veux dire lorsque j’emploie le terme « mère », ou des termes comme « ma mère » ou « Helena Ferencová ».
Le réseau de sens est sensible à l’influence des significations publiques et partagées du mot « mère », et cela aide à défendre la théorie du sens proposée ici contre l’accusation de sens privé, lequel, comme l’a soutenu Wittgenstein, est impossible[2]. La communauté dont je suis membre participe bel et bien à la constitution de ce que « mère » signifie pour moi, et je suis conscient que nos expériences personnelles et nos pensées sur les mères co-constituent nos réseaux de sens respectifs, et que la culture partagée fait que nos réseaux de sens se recoupent considérablement. Cela implique qu’il doit exister des éléments stables, qui sont fixes ou dont la stabilité est dynamiquement et continuellement imposée par l’interaction linguistique ou perceptive avec autrui. En d’autres termes, les réseaux de sens peuvent être dynamiques, mais leur stabilité est constamment négociée à travers l’interaction avec les autres. Je ne peux pas changer tout le réseau de sens de ce que j’entends par « mère », car je parlerais alors de quelqu’un ou de quelque chose d’autre. Si le langage doit conserver une fonction communicative, je dois garder le contenu de mes réseaux de sens (autrement dit, le sens des termes que j’emploie) plutôt stable, afin d’être raisonnablement compris par la plupart des gens. Si ce que je veux dire diffère radicalement de ce que veut dire n’importe qui d’autre, je dois m’expliquer auprès des autres et, par là, mettre à jour leurs propres réseaux de sens, pourvu qu’ils soient disposés à intégrer cognitivement de nouvelles informations.
Quant aux conditions de vérité, la vérité peut être un élément de mon réseau de sens, mais elle n’épuise pas le concept entier de sens. Mon sentiment subjectif de chagrin est en ce moment plus porteur de sens que n’importe quelle conception de la vérité. Cela ne veut pas dire qu’une condition de vérité ne participe pas au sens des termes, mais elle est pour ainsi dire rétrogradée au niveau des autres éléments de sens.
Il semble plausible que l’aspect dynamique des réseaux de sens soit en partie réalisé par l’influence du monde extérieur sur mes éléments de sens stockés dans ma mémoire. Mais mes éléments de sens peuvent changer parce que ma mémoire me trahit, lorsque j’oublie des mots ou des expériences liés à ma mère. De plus, sous l’effet du temps, il est probable que certains éléments de sens s’estomperont en partie, tandis que d’autres resteront forts, voire deviendront plus forts. Si nous empruntons la terminologie des réseaux de neurones sur lesquels reposent les LLM eux-mêmes, nous pouvons attribuer à chaque élément de sens un poids qui indique avec quelle force ou quelle faiblesse un élément de sens donné participe à la constitution du sens. Si je fais brûler un bâton d’encens chez moi demain, cela pourra augmenter le poids des éléments de sens liés à l’odeur, à l’église, au cercueil, aux funérailles dans le sens du mot « mère ».
Les éléments de sens individuels peuvent aussi être faux. J’ai peut-être commencé à associer les vestes de velours noir au sens de « mère » parce que je crois qu’elle portait ce vêtement lors des funérailles. En réalité, il s’agissait peut-être d’une robe de velours bleu marine foncé, mais en raison d’un mauvais éclairage, la couleur m’a paru noire. Certains éléments de sens peuvent donc être ajoutés à mon réseau de sens sur la base d’une fausse croyance. Mais ce qui est indubitablement vrai, c’est que cet élément de sens faux participe au sens de « mère ». Je pense qu’on peut en dire autant des éléments de sens issus de références à des hallucinations ou à des choses dont l’existence n’est pas prouvée, et qui font pourtant partie de mes réseaux de sens, comme le concept de « paradis » ou de « Dieu ».
Il importe de noter qu’il reste une place, dans le réseau de sens, pour un sens purement symbolique ou linguistique. D’autres mots et traits linguistiques, qui peuvent être purement formels (fondés sur la position des mots dans une phrase, comme l’exigent les règles syntaxiques d’une langue), contribuent bel et bien à co-constituer le réseau de sens global. Mais là encore, le sens linguistique n’est qu’une partie du réseau de sens. Il n’épuise pas non plus le sens complet du mot « mère ».
Je reste agnostique quant au pourcentage du réseau de sens global constitué par une modalité donnée. Certaines personnes sont peut-être plus enclines au visuel, d’autres s’appuient sur des éléments linguistiques dans leurs réseaux de sens. Toutes les modalités décrites ici ne seront pas présentes dans les réseaux de sens des autres. Par exemple, une personne atteinte d’une affection appelée aphantasie est incapable de générer des images mentales. Nous pouvons nous attendre à ce que son réseau de sens ne repose sur aucune donnée sensorielle visuelle, ou que l’influence des données sensorielles visuelles y soit fortement réduite.
La théorie du sens, telle qu’elle se présente au regard du concept de réseau de sens, repose sur quelques exigences minimales : elle n’est pas seulement formelle et symbolique ni purement linguistique ; elle est à la fois interne/privée et externe/partagée par la communauté ; elle est constituée de plusieurs modalités, parmi lesquelles les symboles et les relations linguistiques ne sont qu’un élément constitutif du sens parmi beaucoup d’autres. Les éléments de sens qui constituent le sens ont des poids qui indiquent avec quelle force ou quelle faiblesse l’élément de sens donné participe au sens global.
La chambre chinoise et les perroquets stochastiques
Tous les réseaux de sens ne naissent pas égaux. Il y a des gens qui ont une compréhension plus profonde que d’autres des concepts, des choses, des actions corporelles, etc. Que se passe-t-il exactement lorsque nous disons que la compréhension de quelqu’un est profonde ou superficielle ?
Dans la célèbre expérience de la chambre chinoise[3], Searle nous montre ce que signifie n’avoir exactement aucune compréhension du sens des mots et des phrases. Searle, qui ne comprend pas un mot de chinois, est assis dans une pièce fermée. D’un côté, on lui remet un ensemble de symboles chinois qui représentent un message écrit par un locuteur natif du chinois. On lui remet aussi un ensemble de symboles chinois pour les réponses, ainsi que des instructions rédigées en anglais, qu’il comprend, indiquant comment mettre en corrélation les symboles d’entrée avec les symboles de sortie, de manière à feindre une conversation naturelle en chinois avec une personne se trouvant hors de la pièce. Searle ne comprend pas du tout le sens des symboles chinois ; il les met en corrélation de manière purement formelle, d’après leur forme. Searle soutient qu’une telle manipulation de symboles formels selon un ensemble fixe de règles est analogue au fonctionnement des ordinateurs. Parce que les ordinateurs ne travaillent eux aussi qu’avec des symboles formels, ils n’ont aucune compréhension du sens des symboles. Searle, comme les ordinateurs, ne comprend pas le chinois, parce qu’ils opèrent au niveau formel et syntaxique, qui manque de compréhension du sens des mots, ou, comme le dirait Searle : la manipulation de symboles formels selon des règles est dépourvue d’états mentaux, qui sont les conditions préalables d’une intentionnalité intrinsèque[4]. L’intentionnalité est une propriété des états mentaux, qui indique que chaque état mental a un contenu ; ils portent sur quelque chose.
D’une certaine manière, nous pourrions répondre ici même à la question de savoir si l’IA fondée sur les LLM est intelligente, en disant que les LLM n’ont pas d’états mentaux et que, par conséquent, quoi qu’ils fassent, cela manque d’intentionnalité, d’« aboutness » ou de contenu mental. Et si leurs états ne portent sur rien, ils ne peuvent pas comprendre le sens.
Je ne discuterai pas ici de la question de savoir si les LLM ont des états mentaux ou une intentionnalité. Disons que c’est une question de définition, ou une question empirique. Je veux imaginer avec quelle sorte d’états mentaux, ou plutôt avec quelle sorte de réseaux de sens travaillent les LLM, qu’ils aient des états mentaux ou non.
Les LLM fonctionnent en assemblant des chaînes de mots sur la base de la probabilité d’une telle combinaison, dérivée de représentations de grande dimension latentes dans le vaste corpus de données linguistiques. (Bender et al., 2021) ont forgé l’expression « perroquet stochastique » pour décrire le fait que l’architecture des LLM produit des chaînes de mots apparemment cohérentes, mais sans aucune référence au sens de ces chaînes de données, exactement comme le perroquet, l’animal, qui n’a aucune compétence linguistique et ne fait que répéter les sons phonétiques qu’il a entendus à des humains qui interprètent ces sons répétés mécaniquement comme des unités phonémiques distinctes de mots reconnaissables. (Bender et al., 2021) soutiennent que les LLM génèrent ces chaînes assemblées « au hasard » et que leur cohérence est purement « dans l’œil de celui qui regarde », suggérant que la cohérence n’est pas inhérente à la production des LLM elle-même, mais plutôt donnée de l’extérieur par les interprètes humains des productions des LLM. (Bender & Koller, 2020) précisent ensuite leur compréhension du sens en souscrivant à la théorie référentielle du sens, selon laquelle ils tiennent le sens pour « la relation entre la forme et quelque chose d’extérieur au langage… » (p. 5187). En d’autres termes, pour qu’un humain ou un ordinateur soit un locuteur compétent et comprenne le sens des mots employés, il doit « ancrer » sa compréhension des mots dans le monde réel. (Bender & Koller, 2020) citent (Harnad, 1990) et son « problème de l’ancrage des symboles » pour soutenir que, sans l’ancrage des significations dans le monde physique, le système (humain, ordinateur) ne peut pas comprendre le langage ; ce serait analogue à apprendre une langue en étudiant seulement un dictionnaire. Des réponses sensées doivent établir des liens entre les mots et le monde physique.
Comme je tente de l’expliquer ci-dessous, je suis en désaccord avec Bender et al. sur trois points précis :
- le sens doit renvoyer à quelque chose d’extérieur au langage
- les LLM produisent leurs résultats au hasard
- la cohérence est dans l’œil de celui qui regarde
Significations ancrées et non ancrées
(Harnad, 1990), à l’époque du paradigme de l’IA symbolique et dans la ligne de l’argument de la chambre chinoise de Searle, écrit contre l’idée que la manipulation purement formelle de symboles puisse mener à la compréhension. Le ressort principal de son argumentation est que, pour que des systèmes symboliques comprennent un langage, ils doivent ancrer le sens des mots, au niveau le plus bas, dans des représentations non symboliques issues des données sensorielles de notre perception du monde physique et de notre interaction avec lui.
Pour « ancrer » leurs significations, les systèmes doivent disposer d’équivalents de deux éléments que Harnad appelle 1) représentations iconiques et 2) représentations catégorielles, et ce n’est qu’ensuite qu’il est possible de leur apposer une étiquette linguistique par le biais de 3) la représentation symbolique.
1 Représentations iconiques
Les représentations iconiques sont des données perceptives brutes de certains objets spécifiques, que nous ne pouvons pas encore identifier ni nommer. Dans le cas de la vision, les représentations iconiques seraient les formes que des objets, comme des chevaux, pour reprendre l’exemple de Harnad lui-même, projettent sur nos rétines. L’esprit conserverait les représentations iconiques des chevaux comme des analogues de leurs formes réelles. À ce niveau, les seules fonctions nécessaires selon Harnad sont celles qui permettent de discriminer les formes de chevaux stockées sur la base de la similarité ou de la différence. Le fait important est qu’il existe une relation non arbitraire, isomorphe, entre l’icône et ce à quoi elle renvoie, parce que la représentation iconique a une relation structurelle avec son origine.
2 Représentation catégorielle
Selon Harnad, les icônes ne suffisent pas au sens. Le monde est trop complexe et nous avons besoin d’identifier plus rapidement quelles formes et quelles données sensorielles issues de nos organes des sens appartiennent à une catégorie spécifique. Pour cela, nous devons abstraire des représentations iconiques des traits invariants et créer des catégories à partir de ces invariants, afin qu’à l’avenir, lorsque nous rencontrerons un objet ayant la forme d’un cheval, nous puissions identifier plus rapidement si cet objet appartient à la catégorie dotée d’attributs chevalins. À ce niveau, nous n’utilisons toujours pas le mot « cheval » pour décrire la représentation catégorielle, mais nous identifions les chevaux par la forme de leur tête, le fait d’avoir quatre pattes, une queue, etc.
3 Représentation symbolique
Ce n’est qu’à ce niveau que le langage entre en jeu. Une fois que nous avons le « cheval » comme ensemble de traits abstraits de ce qui ressemble à un cheval réel, nous associons dans notre esprit le symbole « cheval » à notre compréhension perceptivement ancrée et expérientielle d’un cheval. Bien que les symboles soient, à ce niveau, entièrement arbitraires – la forme du symbole/mot « cheval » ne ressemble en rien au cheval réel –, ils ont un sens parce que leur contenu sémantique (leur sens) est hérité des représentations iconiques et catégorielles. Dans cette perspective, ce qui donne leur sens aux symboles, ce sont bien leurs références au monde extérieur, issues de la perception.
Il est intéressant de noter que Harnad admet la possibilité que nous puissions créer des symboles dotés de sens qui n’ont pas de représentations iconiques et catégorielles directes. Harnad donne l’exemple du mot « zèbre » :
« zèbre » = « cheval » + « rayures ».
Si le système dispose de représentations iconiques et catégorielles du mot « rayures », alors Harnad admet que la représentation symbolique héritera de son ancrage à partir des représentations symboliques ancrées de « cheval » et de « rayures ». Qu’est-ce que cela signifie ? Le système disposera d’un mot « zèbre » doté de sens, bien qu’il n’ait aucune référence perceptive directe à un zèbre dans le monde extérieur. Le sens est hérité, ou dérivé. Ses seules significations directes sont des références aux symboles linguistiques « cheval » et « rayures ».
Il me semble que (Bender & Koller, 2020), qui s’appuient sur (Harnad, 1990), supposent à tort que Harnad exclut toute signification autre que celles qui sont ancrées. Mais d’après ma lecture de (Harnad, 1990), il admet des significations de symboles/mots qui n’ont pas de référence directe au monde physique, pourvu que leurs références réelles soient des symboles/mots dont les significations sont ancrées dans le monde physique. Exactement comme dans l’exemple du zèbre = « cheval » + « rayures ».
Une fois que nous avons brisé la nécessité d’un lien direct entre le sens d’un mot/symbole et sa relation au monde physique, rien ne semble nous empêcher d’injecter un certain nombre de symboles intermédiaires comme seules significations réelles d’un symbole d’origine, pourvu qu’un symbole, le dernier, soit ancré dans le monde physique.
Je pense que nous avons sapé la première thèse, 1) le sens doit renvoyer à quelque chose d’extérieur au langage. Nous venons de voir qu’un sens peut renvoyer à quelque chose d’intérieur au langage, mais que, pour rester en accord avec (Harnad, 1990), il doit finalement sauter hors de l’espace linguistique vers un espace physique de perceptions et de représentations iconiques et catégorielles pour être ancré, ce qui est pour (Harnad, 1990) une issue nécessaire à une régression à l’infini de symboles linguistiques renvoyant seulement à d’autres symboles linguistiques, jamais à l’extérieur du système de la langue.
Réseaux de sens épars et denses
Pour revenir à notre concept de réseaux de sens, comment pouvons-nous mieux comprendre quelles significations sont profondes ou denses, et lesquelles sont superficielles ou éparses ?
En nous servant de la théorie de l’ancrage des symboles de (Harnad, 1990), je pense que nous pouvons affirmer que mes descriptions du réseau de sens représentant le sens du mot « mère », tel que je l’emploie, sont un cas de sens ancré par excellence.
Imaginons maintenant que je n’aie jamais eu de mère. En fait, je n’ai jamais rien lu sur les mères, hormis l’information qu’une mère est un être humain de sexe féminin qui a au moins un enfant. Imaginons en outre que j’aie une compréhension ancrée des symboles « humain », « femme » et « enfant ». En quoi une compréhension aussi superficielle de « mère » diffère-t-elle de ma compréhension personnelle et plus profonde ?
Dans le premier cas, le réseau de sens serait plutôt épars. Il ne se composerait que de trois symboles linguistiques potentiels. Dans le second exemple, le schéma graphique du sens de « mère » tel que je l’emploie serait un réseau dense de données issues de la perception, de nombreux symboles linguistiques ancrés, et peut-être aussi de symboles non ancrés comme « paradis » ou « Dieu », avec lesquels, pour les besoins de l’argument, je ne peux même en théorie avoir aucune relation expérientielle, et dont toutes les significations directes liées à ces deux mots sont des symboles linguistiques. Certains d’entre eux peuvent être ancrés à des niveaux inférieurs.
Comme nous l’avons dit, nous pouvons avoir des arêtes pondérées (éléments de sens) du réseau de sens reliées à un nœud (mot/symbole), comme le permet la théorie des graphes standard en mathématiques. La densité et le caractère épars des réseaux de sens ne se calculeraient pas seulement par le nombre d’éléments de sens. Il faut aussi tenir compte du poids de la participation des éléments de sens individuels à la constitution du sens global.
La modélisation du sens sous forme de réseaux implique aussi que le sens n’est pas une valeur binaire. Vers le côté gauche du spectre, le sens est de plus en plus épars. Vers l’autre côté, le sens gagne en densité.
Cohérence et caractère aléatoire des LLM
Nous avons dit plus haut que (Bender et al., 2021) affirment que
2) les LLM produisent leurs résultats au hasard
3) la cohérence est dans l’œil de celui qui regarde
Les thèses 2) et 3) sont en fait logiquement interdépendantes. Si les LLM produisent leurs résultats au hasard, toute cohérence et tout sens qu’il y aurait doivent être soit le fruit du pur hasard, soit reconstruits par le système extérieur qui interprète la production des LLM. Ce système peut être, par exemple, les humains.
Les LLM sont des machines de prédiction de symboles. Et leur succès en matière de prédiction statistique et de reconnaissance de motifs dépend de la taille du corpus de données fourni par les humains. L’usage de la statistique et de la prédiction ne rend pas les LLM aléatoires[5].
À moins que nous ne soyons préoccupés par le fait que les données elles-mêmes soient aléatoires et incohérentes. Mais ce n’est pas ce que soutiennent (Bender et al., 2021). Quoi que nous puissions dire de la qualité du discours humain, en particulier de celui qui provient des sources en ligne, si les données utilisées par les LLM sont issues du discours de locuteurs natifs, la cohérence n’est pas dans l’œil de celui qui regarde : elle est objectivement enchâssée dans le corpus de données avec lequel travaillent les LLM, précisément parce que la cohérence est initialement créée par les humains eux-mêmes. Ce que font les LLM, me semble-t-il, c’est appliquer la statistique et la prédiction au corpus de données, qui sont des compressions linguistiques de toutes sortes de réseaux de sens épars et denses créés par les humains eux-mêmes. Les LLM peuvent puiser dans les réseaux de sens en exploitant le fait que toutes les significations ancrées ou tous les réseaux de sens peuvent être rendus explicites par une transformation en formes purement symboliques, c’est-à-dire en une langue. Le langage est une fenêtre, ou une interface, vers les réseaux de sens humains et toutes les significations ancrées dans un monde physique extérieur.
Le langage comme interface vers les réseaux de sens humains
Nous savons que les LLM fonctionnent en prédisant statistiquement le meilleur mot suivant, celui qui s’accorde avec les chaînes de texte générées précédemment et avec leur contexte. Si, par « stochastique » dans l’accusation de « perroquet stochastique », nous voulons simplement dire que les LLM utilisent la statistique pour générer leurs réponses, cela ne peut pas être considéré en soi comme un argument contre les LLM, d’autant que les cerveaux humains emploient certainement leurs propres processus de prédiction statistique.[6] Que reste-t-il alors, sinon critiquer l’idée que les LLM seraient de simples « perroquets » ? Les perroquets qui savent parler imitent assez fidèlement les sons de la parole humaine, mais ne peuvent pas aller au-delà des données qu’ils ont entendues, et de plus, ces sons n’ont aucun sens pour les perroquets eux-mêmes. Les LLM vont clairement au-delà des données, en générant des phrases nouvelles. Nous pouvons écarter la première partie de l’accusation d’être un perroquet. Qu’en est-il du sens dans cette accusation ?
Les LLM n’ont pas de corps, pour l’instant. Le sens de leurs mots et de leurs énoncés ne peut pas être ancré dans le monde physique. Cela ne constitue pas en soi, comme nous l’avons soutenu plus haut, un problème conduisant à l’absence de sens, si les mots que produisent les LLM sont, à un certain niveau, ancrés dans le monde physique habité et vécu par les humains. Le sont-ils ? Je veux soutenir que les mots produits par les LLM sont bel et bien ancrés, quoique par l’intermédiaire de médiateurs symboliques qui fonctionnent comme une interface vers les réseaux de sens humains.
Imaginons que chaque humain ait un réseau de sens pour chaque mot. Nous avons admis que les réseaux de sens ne sont pas entièrement privés, mais partiellement partagés au sein de la communauté linguistique. Lorsque nous parlons et écrivons et voulons « faire passer le sens », nous compressons nos réseaux de sens complexes et désordonnés dans une langue. Par sa conception même, la langue compresse et rend les choses complexes discrètes, séparées en unités saisissables. Je peux garder à l’esprit l’expérience bouleversante de funérailles. Pourtant, lorsque j’ai écrit sur les funérailles dans mon journal, j’ai été contraint de dépouiller l’expérience pour la réduire à des mots et à des phrases. En fait, toutes les sources écrites, des journaux à la poésie et aux romans, sont des artefacts dans lesquels nous utilisons la technologie cognitive de l’écriture pour rendre ce qui semble indescriptible accessible à la description linguistique.
Après la compression qu’implique l’usage d’une langue, nous transformons tous les éléments de sens non linguistiques en une forme de chaînes linguistiques. Ces chaînes seront ancrées, parce que leur sens renvoie finalement à d’autres représentations symboliques qui sont ancrées, ou renvoie directement à des représentations iconiques et catégorielles. Plus les réseaux de sens se recoupent pour certains mots, plus vite les traits invariants du sens du mot passeront dans les LLM, parce que ce sont des machines statistiques si puissantes qu’elles capturent dans les données des régularités et des motifs que même les humains ne remarquent pas.
Une fois que les significations ancrées issues de l’expérience physique humaine du monde ont été compressées dans les symboles linguistiques, qui peuvent ou non constituer les réseaux de sens d’autres mots, les LLM peuvent puiser dans cet ancrage linguistiquement compressé des mots.
Par procuration, en parasitant l’ancrage humain du sens, les LLM utilisent une langue comme une interface pour puiser dans nos réseaux de sens, médiatisés par toute la production linguistique que nous, en tant qu’humanité, avons produite et qui a servi de données d’entrée à partir desquelles les LLM apprennent. Mais l’usage d’une interface a un prix qu’il faut payer. Cet acte d’utiliser une interface – je l’ai précédemment appelé interfacialité[7] – est une compression avec perte, parce que l’interface simplifie et réduit inévitablement. Prenons un exemple. Mes sentiments, mes souvenirs et mes idées qui constituent le sens du mot « mère », et que je garde dans mon esprit, n’ont pas de formes discrètes spécifiques. Ils sont, pour employer un terme d’informatique, un signal continu, précisément parce que ma réalité expérientielle (phénoménale), qui co-constitue le réseau mémoriel (avec les représentations symboliques), n’est pas discrète non plus. Mais en utilisant une langue comme interface vers le réseau de sens du mot « mère », je réduis les signaux continus aux formes discrètes des mots pour créer des représentations discrètes, symboliques. Inévitablement, beaucoup de détails se perdent, du fait que produire une représentation linguistique d’une réalité phénoménale est un processus avec perte.
Avec quelle perte ? Cela dépend de la densité d’une représentation linguistique et de la profondeur à laquelle elle puise dans l’intégralité des réseaux de sens de chaque mot, et des éléments d’ordre supérieur comme une phrase ou un paragraphe. Quels sont les sens de ces éléments d’ordre supérieur ? Tel que je le vois, le sens est constitué par un processus de fusion des réseaux de sens de chaque mot et de parcours à travers les réseaux de sens fusionnés, où les règles valides d’un tel parcours sont régies par les règles syntaxiques d’une langue donnée. La perte d’une représentation linguistique serait différente chez une personne moyenne et chez, disons, un lauréat du prix Nobel de littérature. Quel que soit le statut ontologique de la réalité expérientielle, un écrivain ou un orateur de talent peut se servir de sa maîtrise de la langue pour rapprocher la réalité phénoménale continue et irréductible de quelque chose qui soit saisissable et sensé pour nous.
Les LLM ont des réseaux de sens denses, mais modalement superficiels
Pour nous, humains, il est normal d’enrichir nos propres réseaux de sens par une pollinisation croisée qui se produit lorsque nous interagissons uniquement avec les représentations linguistiques d’autrui, comme la littérature, ce qui rend les réseaux de sens plus denses, bien que nous n’ayons aucune référence expérientielle directe (représentations iconiques, catégorielles) à ce que nous lisons dans les grands romans, la poésie ou la philosophie. La plupart des gens qui lisent des ouvrages de neurosciences n’ont aucune représentation iconique ou catégorielle de termes comme « lobes frontaux », « codage prédictif » ou « cellules gliales ». Pourtant, nous en parlons volontiers. Une personne quelconque qui parle de neurosciences a un réseau de sens très épars sur le sujet, avec très probablement peu de représentations symboliques ancrées dans une réalité expérientielle, voire aucune. Vraisemblablement, la plupart des éléments de sens de ses réseaux de sens liés au sujet, sinon tous, seraient des représentations symboliques/linguistiques non ancrées, avec quelques exemples de films, de photos ou d’entretiens avec des patients atteints de lésions cérébrales qui co-constituent ce que le sujet signifie pour elle. Si cette étudiante en neurosciences nous disait quoi que ce soit sur le cerveau, il lui manquerait le sens ancré dans la réalité expérientielle de voir et d’opérer un cerveau, il lui manquerait les liens émotionnels avec les patients, etc., mais elle serait capable de réciter les dernières théories, les derniers concepts, des livres entiers sur le sujet. Notre neuroscientifique serait une théoricienne experte du sujet : elle analyserait des concepts, trouverait des similitudes et des différences, pourrait formuler des critiques fondées sur la cohérence avec le corpus de connaissances existant, et pourrait même prédire de nouvelles théories en voyant dans ce corpus des motifs et des liens que personne d’autre ne pourrait voir. Notre théoricienne des neurosciences pourrait même réussir des études de médecine, mais nous penserions qu’il manque quelque chose à sa compréhension du sujet.
Les LLM sont un cas extrême de notre théoricienne des neurosciences, pour ce qui est des réseaux de sens. À partir des données linguistiques cohérentes et structurées que nous, humains, avons produites au cours de l’histoire, les LLM reconstruisent les motifs qui existent dans nos réseaux de sens et en trouvent facilement de nouveaux, ce dont aucun humain ne serait capable. À travers le langage, les LLM disposent d’une interface accessible vers notre représentation symbolique discrète de la réalité phénoménale continue et irréductible, ce qui est inévitablement un processus avec perte ; mais là encore, la masse même des données linguistiques peut jeter sur la réalité existentielle plus de lumière qu’aucune personne ne pourrait l’espérer. Toute modification des réseaux de sens des LLM consiste uniquement à ajouter, retirer ou modifier des représentations symboliques. Les LLM ont donc des réseaux de sens extrêmement denses, avec une quantité inimaginable d’éléments de sens pondérés. Mais ce qui leur manque, comme à notre neuroscientifique théoricienne, c’est une diversité dans la modalité de ces éléments de sens. La plupart des éléments de sens des réseaux de sens de la neuroscientifique théoricienne sont des représentations symboliques. Tandis que les LLM sont la limite extrême de tels réseaux de sens « modalement superficiels », où une seule des modalités – la représentation symbolique – peut servir à coder les éléments de sens.
Discussion en guise de conclusion
Nous n’avons jamais rencontré d’entité qui puisse d’emblée citer, analyser et synthétiser l’histoire de la réalité expérientielle humaine, médiatisée par la compression avec perte des représentations linguistiques. Répondre à la question de savoir si les LLM peuvent atteindre une intelligence de type humain dépend, bien sûr, de ce que nous entendons par « humain ». En raison de la tendance de notre société à privilégier les processus cognitifs et intellectuels, et le don du langage étant une capacité distinctement humaine, les capacités langagières occupent la première place sur la liste de ce qui nous sépare du reste du règne animal. À cet égard, les LLM nous ont dépassés. Aucun humain ne sera jamais capable de contenir, d’analyser, de synthétiser et de parcourir les réseaux de sens construits à partir de l’ensemble du corpus de la connaissance et de l’expérience humaines. Bien que les LLM présentent des réseaux de sens quantitativement denses, mais modalement superficiels, le sens de la production que génèrent les LLM n’est ni stochastique ni répétitif. Pour cette raison, je suggère que nous rejetions la thèse actuelle selon laquelle les LLM seraient des perroquets stochastiques. Au contraire, les réseaux de sens latents dans le corpus linguistique et enchâssés dans les réseaux de plus grande dimension des LLM ont un solide pedigree, fondé sur les symboles ancrés qui renvoient à la réalité expérientielle humaine. Et alors, si les LLM eux-mêmes ne l’ont pas vécue ? Nous, humains, théoriciens et philosophes en tête, utilisons volontiers des mots/représentations symboliques dont le réseau de sens ne se compose que d’autres mots et concepts représentés linguistiquement, parce que nous n’en avons aucune autre expérience que d’autres mots et concepts.
La densité des réseaux de sens enchâssés dans les LLM est de loin supérieure à ce que nos cerveaux peuvent contenir. Et alors, si les réseaux de sens sont implémentés dans le silicium plutôt que dans le carbone ?
Références
Bell, D. (1999). The coming of post-industrial society: a venture in social forecasting (Special anniversary ed. /). Basic Books.
Bender, E. M., & Koller, A. (2020). Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data. In Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics. https://doi.org/10.18653/v1/2020.acl-main.463
Bender, E. M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots, 610-623. https://doi.org/10.1145/3442188.3445922
Castells, M., & Cardoso, G. (2006). The network society: from knowledge to policy. Johns Hopkins Center for Transatlantic Relations.
Clark, A. (2013a). Are we predictive engines? Perils, prospects, and the puzzle of the porous perceiver. Behavioral and Brain Sciences, 36(3), 233-253. https://doi.org/10.1017/s0140525x12002440
Clark, A. (2013b). Whatever next? Predictive brains, situated agents, and the future of cognitive science. Behavioral and Brain Sciences, 36(3), 181-204. https://doi.org/10.1017/s0140525x12000477
Dijk, J. van. (2006). The network society: social aspects of new media (2nd ed.). Sage Publications.
Ferenc, J. (2018). Postkognitivistické HCI: Vidět interface jako sociotechnický vztah [Mémoire de master]. Univerzita Karlova.
Harnad, S. (1990). The symbol grounding problem. Physica D: Nonlinear Phenomena, 42(1-3), 335-346. https://doi.org/10.1016/0167-2789(90)90087-6
Searle, J. R. (1980). Minds, brains, and programs. Behavioral and Brain Sciences, 3(3), 417-424. https://doi.org/10.1017/S0140525X00005756
Webster, F. (2006). Theories of the information society (3rd ed.). Routledge.
Wittgenstein, L. (2009). Philosophical investigations (Rev. 4th ed.). Wiley-Blackwell.
- Bell, 1999 ; Castells, 2006 ; Dijk, 2006 ; Webster, 2006 ↑
- Wittgenstein, 2009 ↑
- Searle, 1980 ↑
- ibid., Searle, 1980 ↑
- Si je sais que vous êtes une femme originaire des États-Unis et que votre prénom commence par les lettres « JAN », il y a de bonnes chances que la quatrième lettre de votre prénom soit « E ». Je ne peux pas en être entièrement sûr, mais la réponse découle d’une analyse statistique de l’ensemble des prénoms féminins américains et de la fréquence des lettres dans ces prénoms. Ce n’est pas un processus aléatoire pour parvenir à la réponse. De même, les LLM utilisent la statistique pour parvenir à leur réponse. Je ne vois pas bien pourquoi l’usage de méthodes statistiques constituerait un processus aléatoire de traitement des données. ↑
- Clark, 2013a ; Clark, 2013b ↑
- Ferenc, 2018 ↑