V této eseji tvrdím, že LLM nejsou stochastičtí papoušci, a to na základě zhodnocení tvrzení (Bender et al., 2021), kteří zavedli termín „stochastický papoušek“, aby vyjádřili názor, že výstup LLM je 1) nahodilý, 2) nekoherentní, 3) bez významu, protože – v návaznosti na (Harnad, 1990) – produkuje symboly, které nejsou ukotveny v lidské fenomenální existenci ve fyzickém světě. Představuji koncept „sítí významu“, síťově pojatý výklad významu termínů, který spočívá ve vážených, multimodálních, sociálně stabilizovaných asociacích, jež konstituují, co daný termín znamená pro uživatele jazyka. Hlavním argumentem eseje je ukázat, že LLM produkují výstupy, které nepřímo dědí ukotvení z jazyka vytvořeného lidmi, jenž je sám ukotvený. Použití jazykových dat jako interface do lidské existence ve fyzickém světě trpí ztrátovou kompresí: jakýkoli interface, který převádí lidskou existenci, jež je „spojitým signálem“ (abychom použili terminologii informatiky), na diskrétní jednotky, jako jsou jazykové symboly, ztrácí bohatost detailu. Ukotvení je tedy zároveň nepřímé i ztrátové. Ve srovnání s inteligencí a užíváním významu na lidské úrovni zaujímají LLM dosud nevídanou niku systémů, které produkují jazykový výstup na lidské úrovni, jehož význam má čistě symbolickou modalitu. Sítě významu generované LLM lze chápat jako extrémní příklad jazykem prosycené lidské inteligence.

Úvod

Přinejmenším od druhé poloviny 20. století je naše společnost označována za informační společnost, síťovou společnost, postindustriální společnost atd.[1] Všechny tyto termíny odrážejí dominantní způsob, jakým společnost funguje. Informace, sítě, abstrakce a symbolické vědění jsou měnou dneška. Vysoce vzdělaní jedinci s nadáním pro analytické, abstraktní myšlení a zpracování informací jsou vyhledávanými profesionály. Nástup kognitivismu ve filosofii mysli a v kognitivních vědách znamenal počátek éry, kdy se metafora člověka jako zpracovatele informací začala brát vážně i na samé hranici našeho hledání porozumění tomu, kdo jsme a jak fungují naše mysli. Práce Simona a Newella na softwarových systémech Logic Theorist a General Problem Solver, Weizenbaumova ELIZA, Winogradův SHRDLU, a dokonce i Chomského Syntactic structures a později biologický obrat v lingvistice byly jen některé z mnoha teorií a projektů, které se snažily vysvětlit lidské poznání odkazem na logiku a jazyk coby základní složky lidské inteligence. Je pravda, že od té doby prošly kognitivní vědy i obor AI zásadními změnami. Konekcionistický obrat a obrat k paradigmatu 4E zdůraznily využití neuronových sítí a roli těla zasazeného do situovaných a širších kulturně-společenských kontextů pro vytvoření věrnějšího modelu toho, jak fungují mozkové procesy a lidské poznání. Důraz na porozumění inteligenci, lidské i umělé, však zůstává primární.

Přesto nás uvedení ChatGPT, Bardu, Clauda a dalších chatbotů založených na architektuře velkých jazykových modelů (LLM) nutí znovu promyslet, kdo jsme. LLM ukazují, že užívání jazyka, které je ve srovnání se všemi ostatními živočišnými druhy nejvýraznějším lidským rysem, lze automatizovat tak, aby produkovalo odpovědi podobné lidským, s lehkostí prošlo Turingovým testem a překonalo průměrného člověka ve zpracování faktických dat, v logickém uvažování či v jazykových schopnostech. Pokud LLM porážejí lidi v úlohách, které považujeme za jedinečně lidské, nestává se umělá inteligence založená na LLM podobnější nám, než jsme my sami? Tvrdit, že LLM, tento stroj na formální predikci řetězců symbolů, může dosáhnout statusu člověka, se zdá absurdní. Nejsme-li pokrytci, nemůžeme přestat oslavovat lidskou inteligenci a jazykovou kompetenci jako nejvyšší lidské kognitivní hodnoty ve chvíli, kdy nás jiná entita předčí. Abych se vyhnul ontologickému hlavolamu, co znamená být člověkem, zeptám se jinak: mohou se LLM byť jen teoreticky stát inteligentnějšími než lidé? Abych se opět vyhnul definování toho, co je inteligence, zúžím své zkoumání ještě dále: ať už být inteligentní znamená cokoli, předpokládám, že inteligence podobná lidské vyžaduje porozumění; a porozumění vyžaduje uchopení toho, co znamenají slova, věty či pojmy. Bez porozumění významu nemůže být inteligence.

Sítě významu: průsečík fenomenologie a jazykových významů

Je důležité vyjasnit, co myslím významem. Nebudu zde předkládat přehled teorií významu v analytické filosofii. Co zde mohu nastínit, je minimální teorie významu, která se střetává jak s referenční teorií významu, tak s pravdivostně-podmínkovou teorií významu.

Představme si, že chceme mluvit o významu slova „matka“. Moje matka zemřela před několika měsíci. Moje mysl při přemýšlení o významu tohoto slova generuje následující: vybavuji si vizuální obraz zachmuřené tváře své matky a chlad jejího čela, když jsem ji políbil, zatímco ležela v rakvi v kostele. Vybavuji si vůni kadidla a k tomu tóny písně Dancing Queen od skupiny ABBA, kterou smyčcové kvarteto hrálo na violu, housle a violoncello. Mám hmatové vzpomínky na to, jak jsem objímal svou nemocnou matku několik dní před jejím odchodem. Při myšlence na to slovo cítím neobjektivizovatelné pocity smutku, lítosti i štěstí. Moje mysl také tíhne k tématu toho, co znamená být matkou, o němž jsem mluvil se svou těhotnou snoubenkou. Moje mysl si je rovněž vědoma čistě jazykových vazeb, které má slovo „matka“ s jinými slovy, jako „otec“, „těhotenství“, „žena“, „děti“ atd., a jazykových vztahů mezi slovem „matka“ a dalšími rysy jazyka („moje“ – zájmeno, „matky“ – množné číslo, „nedýchající“ – příčestí atd.). Jsem si také vědom konotací slova „matka“, které jsem začlenil do svého porozumění tomuto slovu při čtení novin a literatury či při intersubjektivním poznávání toho, co matky dokážou nebo jaké jsou, v rozhovorech s ostatními lidmi.

Význam slova „matka“ je pro mě zároveň soukromý i veřejný. Soukromý význam se skládá z prvků různých percepčních modalit a z jazykových symbolů. Veřejný, vnější význam se skládá z toho, co jsem slyšel a převzal od své komunity a od společnosti obecně, obvykle v podobě jazykových symbolů (tj. slov a vět), což mohlo prostřednictvím zpětné vazby ovlivnit mé stávající nejazykové, z vnímání odvozené dílčí významy (např. když jsem slyšel, jak špatně se něčí matka chovala, začal jsem si své matky více vážit a cítit k ní více lásky, čímž se změnily mé dřívější, z pocitů odvozené dílčí významy).

Vypůjčíme-li si dále z teorie sítí základní pojmy „uzel“ a „hrany“, jejich ekvivalentem by bylo

uzel = slova / pojmy

hrana = prvek významu, který může mít mnoho modalit: percepční či symbolické reprezentace, pocity, další uzly zprostředkované symbolickými reprezentacemi

Jak vidíme, význam slova je primárně významem pro mě, existujícím v mé mysli. Jde o multimodální „síť významu“ tvořenou percepčními i jazykovými prvky. Tato „síť významu“ není statická, nýbrž dynamicky reaguje na mou situovanou existenci ve světě; jakékoli nové percepční či jazykové prvky do ní lze kdykoli přidat, případně je z ní odebrat (či spíše přepsat).

Termín „matka“ nemůže odkazovat jen k jednomu existujícímu „objektu“ ve světě. Ponechávám stranou Fregeho rozlišení „smyslu“ a „reference“, které předpokládá stabilní referenty i smysl. Místo toho chci navrhnout multimodální, síťově založenou sémantiku, v níž se význam termínů rovná samotným sítím významu. Díky tomu mohu integrovat smyslová data, pocity, vizuální představy, mylná přesvědčení, slova, pojmy, vzpomínky mnoha modalit, o nichž mám zřetelný a jasný pocit, že konstituují to, co myslím, když používám termín „matka“, nebo termíny jako „moje matka“ či „Helena Ferencová“.

Síť významu je přístupná vlivu veřejných a sdílených významů slova „matka“, a to pomáhá hájit zde navrhovanou teorii významu proti obvinění ze soukromého významu, který je, jak argumentoval Wittgenstein, nemožný[2]. Komunita, jejímž jsem členem, se na konstituci toho, co pro mě „matka“ znamená, skutečně podílí, a jsem si vědom, že naše osobní zkušenosti a přemýšlení o matkách vzájemně spoluvytvářejí naše sítě významu a že sdílená kultura ovlivňuje naše sítě významu tak, že se značně překrývají. Z toho plyne, že musí existovat stabilní prvky, které jsou pevné, nebo jejichž stabilita je dynamicky a neustále vynucována jazykovou či percepční interakcí s ostatními. Jinak řečeno, sítě významu mohou být dynamické, a přesto se o jejich stabilitu neustále vyjednává v interakci s ostatními. Nemohu změnit celou síť významu toho, co myslím slovem „matka“, protože bych pak mluvil o někom nebo o něčem jiném. Má-li si jazyk zachovat komunikační funkci, musím obsah svých sítí významu (jinými slovy význam termínů, které používám) udržovat poměrně stabilní, aby mi většina lidí rozumně rozuměla. Pokud se to, co myslím, radikálně liší od toho, co myslí kdokoli jiný, musím se ostatním vysvětlit a tím aktualizovat jejich vlastní sítě významu, za předpokladu, že jsou otevřeni tomu nové informace kognitivně začlenit.

Pokud jde o pravdivostní podmínky, pravda může být prvkem mé sítě významu, ale nevyčerpává celý pojem významu. Můj subjektivní pocit žalu nese právě teď více významu než jakékoli pojetí pravdy. Tím neříkám, že se pravdivostní podmínka na významu termínů nepodílí, ale je takříkajíc posunuta dolů, na úroveň ostatních prvků významu.

Zdá se věrohodné, že dynamický aspekt sítí významu je zčásti realizován tím, že vnější svět ovlivňuje prvky významu uložené v mé paměti. Mé prvky významu se ale mohou měnit i proto, že mě paměť zrazuje, když zapomínám slova či zážitky, které s mou matkou souvisejí. Vlivem času je také pravděpodobné, že některé prvky významu částečně vyblednou, zatímco jiné zůstanou silné, nebo dokonce zesílí. Vypůjčíme-li si terminologii z neuronových sítí, na nichž jsou samy LLM založeny, můžeme každému prvku významu přiřadit váhu, která udává, jak silně či slabě se daný prvek významu podílí na konstituci významu. Pokud si zítra doma zapálím vonnou tyčinku, může to ve významu slova „matka“ zvýšit váhu prvků významu souvisejících s vůní, kostelem, rakví a pohřbem.

Jednotlivé prvky významu mohou být také mylné. Mohl jsem začít spojovat černá sametová saka s významem slova „matka“ kvůli svému přesvědčení, že na pohřbu měla na sobě takový oděv. Ve skutečnosti to mohly být tmavě modré sametové šaty, ale kvůli špatnému osvětlení se mi barva jevila jako černá. Některé prvky významu tak mohou být do mé sítě významu přidány na základě mylného přesvědčení. Co je ale nepochybně pravda, je to, že se tento mylný prvek významu na významu slova „matka“ podílí. Myslím, že totéž lze říci o prvcích významu odvozených z odkazů na halucinace nebo na věci, jejichž existence nebyla prokázána, a přesto jsou součástí mých sítí významu, jako je pojem „nebe“ nebo „Bůh“.

Podstatné je, že v síti významu je stále místo i pro čistě symbolický či jazykový význam. Jiná slova a jazykové rysy, které mohou být čistě formální (založené na pozici slov ve větě, jak to vyžadují syntaktická pravidla jazyka), celkovou síť významu skutečně spoluvytvářejí. Ale opět, jazykový význam je jen částí sítě významu. Ani on nevyčerpává plný význam slova „matka“.

Zůstávám agnostikem v otázce, jaké procento celkových sítí významu tvoří daná modalita. Někteří lidé mohou být více vizuálně založení, jiní se ve svých sítích významu spoléhají na jazykové prvky. Ne všechny zde popsané modality budou v sítích významu ostatních přítomny. Například člověk trpící stavem zvaným afantazie není schopen vytvářet mentální představy. Lze očekávat, že jeho síť významu se nebude opírat o žádná vizuální smyslová data, nebo že vliv vizuálních smyslových dat bude výrazně oslaben.

Teorie významu vis-à-vis pojmu sítě významu stojí na několika minimálních požadavcích: není jen formálně-symbolická či čistě jazyková, je zároveň vnitřní/soukromá i vnější/sdílená komunitou, je konstituována několika modalitami, mezi nimiž jsou jazykové symboly a vztahy jen jedním z mnoha prvků konstituujících význam. Prvky významu, které konstituují význam, mají váhy, jež udávají, jak silně či slabě se daný prvek významu podílí na celkovém významu.

Čínský pokoj a stochastičtí papoušci

Ne všechny sítě významu jsou si rovny. Jsou lidé, kteří pojmům, věcem, tělesným úkonům atd. rozumějí hlouběji než jiní. Co se přesně děje, když říkáme, že něčí porozumění je hluboké či mělké?

Ve slavném experimentu s čínským pokojem[3] nám Searle ukazuje, co znamená mít přesně nulové porozumění významu slov a vět. Searle, který vůbec neumí čínsky, sedí v uzavřené místnosti. Z jedné strany dostává sadu čínských symbolů, které představují psaný vstup rodilého mluvčího čínštiny. Dostává také sadu čínských symbolů pro odpovědi a instrukce psané anglicky, jimž rozumí, jak přiřazovat vstupní symboly k výstupním, a předstírá tak přirozený rozhovor v čínštině s osobou mimo místnost. Searle nemá žádné porozumění významu čínských symbolů; přiřazuje je čistě formálně na základě jejich tvaru (tj. formy). Searle argumentuje, že taková manipulace s formálními symboly na základě pevně dané sady pravidel je analogická tomu, jak fungují počítače. Protože i počítače pracují pouze s formálními symboly, nemají žádné porozumění významu těchto symbolů. Searle stejně jako počítače nerozumí čínsky, protože pracují na formální a syntaktické úrovni, které chybí porozumění významu slov, nebo jak by to formuloval Searle: manipulace s formálními symboly řízená pravidly postrádá mentální stavy, které jsou předpokladem vnitřní intencionality[4]. Intencionalita je vlastností mentálních stavů, poukazující na to, že každý mentální stav má obsah; mentální stavy jsou o něčem.

Svým způsobem bychom mohli na otázku, zda je AI založená na LLM inteligentní, odpovědět přímo zde: LLM nemají mentální stavy, a proto čemukoli, co dělají, chybí intencionalita, vztaženost k něčemu či mentální obsah. A pokud jejich stavy nejsou o ničem, nemohou rozumět významu.

Zda LLM mají mentální stavy či intencionalitu, zde rozebírat nebudu. Řekněme, že jde o otázku definice nebo o otázku empirickou. Chci si představit, s jakými mentálními stavy, či spíše s jakými sítěmi významu LLM pracují, ať už mentální stavy mají, nebo ne.

LLM fungují tak, že spojují řetězce slov na základě pravděpodobnosti takové kombinace, odvozené z vysokodimenzionálních reprezentací latentně přítomných ve velkém korpusu jazykových dat. (Bender et al., 2021) zavedli termín „stochastický papoušek“, aby popsali, že architektura LLM produkuje zdánlivě koherentní řetězce slov, avšak bez jakéhokoli vztahu k významu těchto řetězců dat, stejně jako papoušek, zvíře, které nemá žádnou jazykovou kompetenci a jen opakuje fonetické zvuky, jež slyšel, zpět lidem, kteří mechanicky opakované zvuky interpretují jako zřetelné fonémy rozlišitelných slov. (Bender et al., 2021) argumentují, že LLM tyto řetězce generují „nahodile“ poskládané a že jejich koherence je čistě „v očích pozorovatele“, čímž naznačují, že koherence není vlastní samotnému výstupu LLM, nýbrž je mu dána zvenčí lidskými interprety výstupů vytvořených LLM. (Bender & Koller, 2020) pak objasňují své chápání významu tím, že se hlásí k referenční teorii významu, v níž význam chápou jako „vztah mezi formou a něčím vnějším vůči jazyku…“ (s. 5187). Jinými slovy, aby byl člověk či počítač kompetentním mluvčím a rozuměl významu užívaných slov, musí své porozumění slovům „ukotvit“ v reálném světě. (Bender & Koller, 2020) citují (Harnad, 1990) a jeho „Symbol grounding problem“, aby argumentovali, že bez ukotvení významů ve fyzickém světě nemůže systém (člověk, počítač) rozumět jazyku; bylo by to obdobné jako učit se jazyk jen studiem slovníku. Smysluplné odpovědi musejí vytvářet spojení mezi slovy a fyzickým světem.

Jak se níže pokusím vysvětlit, s Bender et al. nesouhlasím ve třech konkrétních bodech:

  1. význam musí odkazovat k něčemu mimo jazyk
  2. LLM produkují výstupy nahodile
  3. koherence je v očích pozorovatele

Ukotvené a neukotvené významy

(Harnad, 1990) v době paradigmatu symbolické AI a v souladu se Searlovým argumentem čínského pokoje píše proti myšlence, že čistě formální manipulace se symboly může vést k porozumění. Jádrem jeho argumentace je, že mají-li symbolické systémy rozumět jazyku, musejí ukotvit význam slov na nejnižší úrovni v nesymbolických reprezentacích, které pocházejí ze smyslových dat našeho vnímání fyzického světa a naší interakce s ním.

Aby své významy „ukotvily“, musejí systémy disponovat ekvivalenty dvou prvků, které Harnad nazývá 1) ikonické reprezentace a 2) kategoriální reprezentace, a teprve pak je možné nad nimi vytvořit jazykové označení prostřednictvím 3) symbolické reprezentace.

1 Ikonické reprezentace

Ikonické reprezentace jsou surová percepční data určitých konkrétních objektů, které ještě nedokážeme identifikovat ani pojmenovat. V případě zraku by ikonickými reprezentacemi byly tvary, které objekty, například koně, abychom zůstali u Harnadova vlastního příkladu, vrhají na naši sítnici. Mysl by uchovávala ikonické reprezentace koní jako analogony jejich skutečných tvarů. Na této úrovni jsou podle Harnada zapotřebí pouze funkce, které rozlišují uložené tvary koní na základě podobnosti/odlišnosti. Důležité je, že mezi ikonou a tím, k čemu odkazuje, existuje nearbitrární, izomorfní vztah, protože ikonická reprezentace je se svým původem ve strukturním vztahu.

2 Kategoriální reprezentace

Podle Harnada ikony k významu nestačí. Svět je příliš složitý a potřebujeme rychleji identifikovat, které tvary a smyslová data z našich smyslových orgánů patří do určité kategorie. K tomu potřebujeme z ikonických reprezentací abstrahovat invariantní rysy a z těchto invariant vytvořit kategorie, abychom v budoucnu, až narazíme na objekt tvarem připomínající koně, dokázali rychleji určit, zda tento objekt patří do kategorie, která má koňské atributy. Na této úrovni ještě k popisu kategoriální reprezentace nepoužíváme slovo „kůň“, ale koně identifikujeme podle tvaru jejich hlavy, toho, že mají čtyři nohy a ocas atd.

3 Symbolická reprezentace

Teprve na této úrovni vstupuje do hry jazyk. Jakmile máme „koně“ jako soubor abstrahovaných rysů toho, co se podobá skutečnému koni, spojíme si v mysli symbol „kůň“ s naším percepčně ukotveným a zkušenostním porozuměním koni. Přestože jsou symboly na této úrovni zcela arbitrární – tvar symbolu/slova „kůň“ se skutečnému koni nijak nepodobá –, jsou smysluplné, protože jejich sémantický obsah (význam) je zděděn z ikonických a kategoriálních reprezentací. Podle tohoto pohledu činí symboly smysluplnými právě jejich z vnímání odvozené odkazy k vnějšímu světu.

Harnad zajímavě připouští možnost, že můžeme vytvářet smysluplné symboly, které nemají přímé ikonické a kategoriální reprezentace. Uvádí příklad slova „zebra“:

„zebra“ = „kůň“ + „pruhy“.

Pokud má systém ikonické a kategoriální reprezentace slova „pruhy“, pak Harnad připouští, že symbolická reprezentace zdědí své ukotvení na základě ukotvených symbolických reprezentací „kůň“ a „pruhy“. Co to znamená? Systém bude mít smysluplné slovo „zebra“, přestože nemá žádný přímý percepční odkaz na zebru ve vnějším světě. Význam je zděděný, neboli odvozený. Jeho jedinými přímými významy jsou odkazy na jazykové symboly „kůň“ a „pruhy“.

Zdá se mi, že (Bender & Koller, 2020), kteří se opírají o (Harnad, 1990), mylně předpokládají, že Harnad nepřipouští jiné významy než ty, které jsou ukotvené. Podle mého čtení (Harnad, 1990) však připouští významy symbolů/slov, které nemají přímý odkaz k fyzickému světu, za předpokladu, že jejich skutečnými referenty jsou symboly/slova, jejichž významy jsou ukotveny ve fyzickém světě. Přesně jako v příkladu zebra = „kůň“ + „pruhy“.

Jakmile rozbijeme nutnost přímého spojení mezi významem slova/symbolu a jeho vztahem k fyzickému světu, zdá se, že nám nic nebrání vložit řadu zprostředkujících symbolů jako jediné skutečné významy původního symbolu, za předpokladu, že nějaký symbol, ten poslední, je ukotven ve fyzickém světě.

Myslím, že jsme podkopali první tvrzení 1) význam musí odkazovat k něčemu mimo jazyk. Právě jsme viděli, že význam může odkazovat k něčemu uvnitř jazyka, ale aby to bylo v souladu s (Harnad, 1990), musí nakonec vyskočit z jazykového prostoru do fyzického prostoru vjemů a ikonických a kategoriálních reprezentací, aby byl ukotven, což je pro (Harnad, 1990) nezbytná cesta ven z nekonečného regresu jazykových symbolů odkazujících pouze na jiné jazykové symboly, nikdy mimo jazykový systém.

Řídké a husté sítě významu

Vrátíme-li se k našemu pojmu sítí významu, jak můžeme lépe porozumět tomu, které významy jsou hluboké či husté a které mělké či řídké?

S pomocí teorie ukotvení symbolů (Harnad, 1990) můžeme, myslím, tvrdit, že mé popisy sítě významu reprezentující význam slova „matka“, jak ho používám já, jsou případem ukotveného významu par excellence.

Nyní si představme, že jsem nikdy neměl matku. Vlastně jsem o matkách nikdy nic nečetl, kromě informace, že matka je lidská bytost ženského pohlaví, která má alespoň jedno dítě. Představme si dále, že mám ukotvené porozumění symbolům „člověk“, „žena“ a „dítě“. Jak se takové mělké porozumění „matce“ liší od mého osobního a hlubšího porozumění?

V prvním případě by síť významu byla spíše řídká. Skládala by se potenciálně jen ze tří jazykových symbolů. Ve druhém příkladu by grafické schéma významu slova „matka“, jak ho používám já, bylo hustou sítí percepčně odvozených dat, množství ukotvených jazykových symbolů a možná i neukotvených symbolů jako „nebe“ či „Bůh“, s nimiž – pro účely argumentu – nemohu mít ani teoreticky žádný zkušenostní vztah a všechny přímé významy vázané k těmto dvěma slovům jsou jazykové symboly. Některé z nich mohou být ukotveny na nižších úrovních.

Jak jsme řekli, můžeme mít vážené hrany (prvky významu) sítě významu připojené k uzlu (slovu/symbolu), jak to umožňuje standardní teorie grafů v matematice. Hustota a řídkost sítí významu by se nepočítala pouze podle počtu prvků významu. Je třeba vzít v úvahu i váhu, s jakou se jednotlivé prvky významu podílejí na konstituci celkového významu.

Modelování významu jako sítí také implikuje, že význam není binární hodnota. Směrem k levé straně spektra je význam stále řidší. Směrem k druhé straně jeho hustota roste.

Koherence a nahodilost LLM

Dříve jsme řekli, že (Bender et al., 2021) tvrdí, že

2) LLM produkují výstupy nahodile

3) koherence je v očích pozorovatele

Tvrzení 2) a 3) jsou ve skutečnosti logicky vzájemně závislá. Pokud LLM produkují výstupy nahodile, veškerá koherence a význam, které v nich jsou, musejí být buď čistou náhodou, nebo je musí rekonstruovat vnější systém, který výstup LLM interpretuje. Takovým systémem mohou být například lidé.

LLM jsou stroje na predikci symbolů. A jejich úspěch ve statistické predikci a rozpoznávání vzorců závisí na velikosti korpusu dat, který dodávají lidé. Použití statistiky a predikce nečiní LLM nahodilými[5].

Ledaže by nás znepokojovalo, že nahodilá a nekoherentní jsou samotná data. To ale není to, co (Bender et al., 2021) tvrdí. Ať už můžeme o kvalitě lidského diskurzu, zejména toho pocházejícího z online zdrojů, říci cokoli, pokud jsou data používaná LLM odvozena z diskurzu rodilých mluvčích, koherence není v očích pozorovatele, nýbrž je objektivně vtělena do korpusu dat, s nimiž LLM pracují, a to právě proto, že koherenci původně vytvářejí sami lidé. Co LLM dělají, jak se mi zdá, je to, že aplikují statistiku a predikci na korpus dat, která jsou jazykovými kompresemi všech druhů řídkých i hustých sítí významu vytvořených samotnými lidmi. LLM se mohou na sítě významu napojit díky tomu, že využívají faktu, že všechny ukotvené významy či všechny sítě významu lze explicitně vyjádřit transformací do čistě symbolických forem, tj. do jazyka. Jazyk je oknem, neboli interfacem do lidských sítí významu a všech významů ukotvených ve vnějším fyzickém světě.

Jazyk jako interface do lidských sítí významu

Víme, že LLM fungují tak, že statisticky predikují nejlepší další slovo, které odpovídá dříve vygenerovaným řetězcům textu a jejich kontextu. Pokud slovem „stochastický“ v obvinění ze „stochastického papouška“ myslíme pouze to, že LLM ke generování svých odpovědí používají statistiku, nelze to samo o sobě považovat za argument proti LLM, zvláště když lidské mozky zcela jistě využívají své vlastní procesy statistické predikce.[6] Zbývá tedy kritizovat představu, že LLM jsou pouzí „papoušci“? Papoušci, kteří umějí mluvit, napodobují zvuky lidské řeči poměrně věrně, ale nedokážou jít za data, která slyšeli, a navíc tyto zvuky nemají pro samotné papoušky žádný význam. LLM zjevně jdou za data a generují nové věty. První část obvinění z papouškování tedy můžeme odmítnout. A co ta část obvinění, která se týká významu?

LLM zatím nemají těla. Význam jejich slov a výpovědí nemůže být ukotven ve fyzickém světě. To samo o sobě, jak jsme argumentovali dříve, nepředstavuje problém vedoucí k bezvýznamnosti, pokud jsou slova, která LLM vydávají, na nějaké úrovni ukotvena ve fyzickém světě obývaném a prožívaném lidmi. Jsou? Chci argumentovat, že slova produkovaná LLM ukotvena skutečně jsou, byť prostřednictvím symbolických zprostředkovatelů, kteří fungují jako interface do lidských sítí významu.

Představme si, že každý člověk má pro každé slovo síť významu. Připustili jsme, že sítě významu nejsou zcela soukromé, ale zčásti sdílené v rámci jazykového společenství. Když mluvíme a píšeme a chceme „předat význam“, komprimujeme své složité a neuspořádané sítě významu do jazyka. Jazyk už svou povahou komprimuje a činí složité věci diskrétními a rozdělenými do uchopitelných jednotek. V mysli si mohu podržet zdrcující zážitek pohřbu. Když jsem však o pohřbu psal do deníku, byl jsem nucen ten zážitek osekat na slova a věty. Ve skutečnosti jsou všechny psané zdroje, od novin po poezii a romány, artefakty, v nichž používáme kognitivní technologii psaní k tomu, abychom zdánlivě nepopsatelné učinili přístupným jazykovému popisu.

Po kompresi, kterou s sebou užívání jazyka nese, převedeme všechny prvky významu, které nejsou jazykové, do nějaké podoby jazykových řetězců. Tyto řetězce budou ukotvené, protože jejich význam nakonec odkazuje zpět k jiným symbolickým reprezentacím, které jsou ukotvené, nebo přímo k ikonickým a kategoriálním reprezentacím. Čím více se sítě významu u některých slov překrývají, tím rychleji se invariantní rysy významu daného slova dostanou do LLM, protože jde o tak mocné statistické stroje, že zachycují pravidelnosti a vzorce v datech, kterých si nevšimnou ani lidé.

Poté, co jsou ukotvené významy z lidské fyzické zkušenosti ve světě zkomprimovány do jazykových symbolů, které mohou, ale nemusejí konstituovat sítě významu jiných slov, se LLM mohou napojit na tuto jazykově zkomprimovanou ukotvenost slov.

Zprostředkovaně a parazitujíce na lidské ukotvenosti významu používají LLM jazyk jako interface, jehož prostřednictvím se napojují na naše sítě významu, zprostředkované veškerým jazykovým výstupem, který jsme jako lidstvo vytvořili a který posloužil jako vstupní data, z nichž se LLM učí. Používání interface však má svou cenu, kterou musíme zaplatit. Tento akt používání interface – dříve jsem ho nazval interfacialitou[7] – je ztrátovou kompresí, protože interface nevyhnutelně zjednodušuje a redukuje. Uvedu příklad. Mé pocity, vzpomínky a myšlenky, které konstituují význam slova „matka“ a které uchovávám v mysli, nemají žádné konkrétní diskrétní formy. Jsou, abych použil termín z informatiky, spojitým signálem, a to právě proto, že ani má zkušenostní (fenomenální) realita, která spoluvytváří paměťovou síť (spolu se symbolickými reprezentacemi), není diskrétní. Když však používám jazyk jako interface do sítě významu slova „matka“, redukuji spojité signály na diskrétní formy slov, abych vytvořil diskrétní symbolické reprezentace. Nevyhnutelně se tak ztrácí mnoho detailů, protože vytvoření jazykové reprezentace fenomenální reality je ztrátový proces.

Jak moc ztrátový? Záleží na hustotě jazykové reprezentace a na tom, jak hluboko se napojuje na celek sítí významu jednotlivých slov a prvků vyššího řádu, jako je věta či odstavec. Jaké jsou významy těchto prvků vyššího řádu? Jak to vidím já, význam se konstituuje procesem slučování sítí významu jednotlivých slov a procházení sloučenými sítěmi významu, přičemž platná pravidla takového procházení se řídí syntaktickými pravidly daného jazyka. Ztrátovost jazykové reprezentace by se lišila mezi průměrným člověkem a, řekněme, nositelem Nobelovy ceny za literaturu. Ať je ontologický status zkušenostní reality jakýkoli, mistrný spisovatel či řečník dokáže svou dovedností v užívání jazyka přiblížit spojitou a neredukovatelnou fenomenální realitu do podoby, která je pro nás uchopitelná a smysluplná.

LLM mají husté, modálně povrchní sítě významu

Pro nás lidi je normální obohacovat vlastní sítě významu křížovým opylením, k němuž dochází, když jsme v interakci pouze s jazykovými reprezentacemi druhých, například s literaturou, a které sítě významu zhušťuje, přestože s tím, o čem čteme ve skvělých románech, poezii či filosofii, nemáme žádný přímý zkušenostní vztah (ikonické, kategoriální reprezentace). Většina lidí, kteří čtou o neurovědě, nemá žádné ikonické ani kategoriální reprezentace termínů jako „čelní laloky“, „prediktivní kódování“ či „gliové buňky“. Přesto o tom rádi mluvíme. Náhodná osoba, která mluví o neurovědě, má k tomuto tématu velmi řídkou síť významu a s největší pravděpodobností jen málo symbolických reprezentací ukotvených ve zkušenostní realitě, pokud vůbec nějaké. Lze předpokládat, že většina, ne-li všechny prvky významu v jejích sítích významu vztahujících se k tématu by byly neukotvené symbolické/jazykové reprezentace a jen několik příkladů z filmů, fotografií či rozhovorů s pacienty s poškozením mozku by spoluvytvářelo, co pro ni téma znamená. Kdyby nám tato studentka neurovědy vyprávěla cokoli o mozcích, chyběl by jí význam ukotvený ve zkušenostní realitě toho, jak mozek vidět a operovat, chyběla by jí emoční pouta s pacienty atd., ale dokázala by odříkat nejnovější teorie, pojmy, celé knihy na toto téma. Naše neurovědkyně by byla expertní teoretičkou v daném oboru: analyzovala by pojmy, hledala podobnosti a rozdíly, mohla by nabídnout kritiku založenou na koherenci se stávajícím korpusem vědění, a dokonce by mohla předpovídat nové teorie na základě vzorců a souvislostí v korpusu vědění, které nikdo jiný nevidí. Naše teoretička neurovědy by mohla dokonce vystudovat medicínu, ale měli bychom za to, že v jejím porozumění tématu něco chybí.

LLM jsou, pokud jde o sítě významu, extrémním případem naší teoretičky neurovědy. Z koherentních a strukturovaných jazykových dat, která jsme my lidé historicky vytvořili, LLM rekonstruují vzorce existující v našich sítích významu a snadno nacházejí nové, což by žádný člověk nedokázal. Skrze jazyk mají LLM přístupný interface do naší diskrétní symbolické reprezentace spojité a neredukovatelné fenomenální reality, což je nevyhnutelně ztrátový proces, ale opět: pouhé množství jazykových dat může na existenciální realitu vrhnout více světla, než v jaké by kdy mohl doufat kterýkoli člověk. Jakákoli modifikace sítí významu LLM spočívá pouze v přidávání, odebírání či úpravě symbolických reprezentací. LLM tak mají extrémně husté sítě významu s nepředstavitelným množstvím vážených prvků významu. Co jim však chybí, podobně jako naší teoretičce neurovědy, je rozmanitost modalit těchto prvků významu. Většinu prvků významu v sítích významu teoretičky neurovědy tvoří symbolické reprezentace. Zatímco LLM jsou krajní mezí takových „modálně povrchních“ sítí významu, v nichž lze ke kódování prvků významu použít pouze jednu z modalit – symbolickou reprezentaci.

Diskuse jako shrnutí

Nikdy jsme se nesetkali s entitou, která by pohotově citovala, analyzovala a syntetizovala dějiny lidské zkušenostní reality zprostředkované ztrátovou kompresí jazykových reprezentací. Odpověď na otázku, zda LLM mohou dosáhnout inteligence podobné lidské, samozřejmě závisí na tom, co myslíme slovem „lidský“. Kvůli společenské tendenci upřednostňovat kognitivní a intelektuální procesy, přičemž jazyková výbava je výrazně lidskou schopností, stojí jazykové schopnosti na předním místě seznamu toho, co nás odděluje od zbytku živočišné říše. V tomto ohledu nás LLM překonaly. Žádný člověk nikdy nebude schopen pojmout, analyzovat, syntetizovat a procházet sítě významu vybudované z celého korpusu lidského vědění a zkušenosti. Přestože LLM vykazují kvantitativně husté, ale modálně povrchní sítě významu, význam výstupu, který LLM generují, není ani stochastický, ani opakující se. Z toho důvodu navrhuji, abychom současné tvrzení, že LLM jsou stochastičtí papoušci, odmítli. Sítě významu latentně přítomné v jazykovém korpusu a vtělené do vysokodimenzionálních sítí LLM mají naopak solidní rodokmen, založený na ukotvených symbolech odkazujících k lidské zkušenostní realitě. No a co, že ji samy LLM nezažily? My lidé, s teoretiky a filosofy v čele, ochotně používáme slova/symbolické reprezentace, jejichž síť významu se skládá pouze z jiných slov a pojmů reprezentovaných jazykově, protože s nimi nemáme jinou zkušenost než jiná slova a pojmy.

Hustota sítí významu vtělených do LLM daleko převyšuje to, co dokážou pojmout naše mozky. No a co, že jsou sítě významu implementovány v křemíku, a ne v uhlíku?

Zdroje

Bell, D. (1999). The coming of post-industrial society: a venture in social forecasting (Special anniversary ed. /). Basic Books.

Bender, E. M., & Koller, A. (2020). Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data. In Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics. https://doi.org/10.18653/v1/2020.acl-main.463

Bender, E. M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots, 610-623. https://doi.org/10.1145/3442188.3445922

Castells, M., & Cardoso, G. (2006). The network society: from knowledge to policy. Johns Hopkins Center for Transatlantic Relations.

Clark, A. (2013a). Are we predictive engines? Perils, prospects, and the puzzle of the porous perceiver. Behavioral and Brain Sciences, 36(3), 233-253. https://doi.org/10.1017/s0140525x12002440

Clark, A. (2013b). Whatever next? Predictive brains, situated agents, and the future of cognitive science. Behavioral and Brain Sciences, 36(3), 181-204. https://doi.org/10.1017/s0140525x12000477

Dijk, J. van. (2006). The network society: social aspects of new media (2. vyd.). Sage Publications.

Ferenc, J. (2018). Postkognitivistické HCI: Vidět interface jako sociotechnický vztah [Diplomová práce]. Univerzita Karlova.

Harnad, S. (1990). The symbol grounding problem. Physica D: Nonlinear Phenomena, 42(1-3), 335-346. https://doi.org/10.1016/0167-2789(90)90087-6

Searle, J. R. (1980). Minds, brains, and programs. Behavioral and Brain Sciences, 3(3), 417-424. https://doi.org/10.1017/S0140525X00005756

Webster, F. (2006). Theories of the information society (3. vyd.). Routledge.

Wittgenstein, L. (2009). Philosophical investigations (Rev. 4. vyd.). Wiley-Blackwell.

  1. Bell, 1999; Castells, 2006; Dijk, 2006; Webster, 2006 ↑
  2. Wittgenstein, 2009 ↑
  3. Searle, 1980 ↑
  4. tamtéž, Searle, 1980 ↑
  5. Pokud vím, že jste žena z USA a vaše jméno začíná písmeny „JAN“, je velká šance, že čtvrté písmeno vašeho jména je „E“. Nemohu si být zcela jistý, ale odpověď vychází ze statistické analýzy množiny všech amerických ženských jmen a četnosti písmen v těchto jménech. Nejde o nahodilý proces, jak dospět k odpovědi. Podobně LLM používají statistiku, aby dospěly ke své odpovědi. Nejsem si jistý, proč by použití statistických metod mělo představovat nahodilý proces práce s daty. ↑
  6. Clark, 2013a; Clark, 2013b ↑
  7. Ferenc, 2018 ↑