En este ensayo sostengo que los LLM no son loros estocásticos, y lo hago evaluando las afirmaciones de (Bender et al., 2021), quienes acuñaron el término «loro estocástico» para expresar la idea de que la salida de los LLM es 1) azarosa, 2) incoherente y 3) carente de significado porque, siguiendo a (Harnad, 1990), produce símbolos que no están anclados en la existencia fenoménica humana dentro de un mundo físico. Presento el concepto de «redes de significado», una explicación reticular del significado de los términos que consiste en asociaciones ponderadas, multimodales y socialmente estabilizadas que constituyen lo que un término significa para un usuario de la lengua. El argumento principal del ensayo pretende mostrar que los LLM producen salidas que heredan el anclaje de forma indirecta del lenguaje producido por los seres humanos, que a su vez está anclado. El uso de datos lingüísticos como interfaz hacia la existencia humana en el mundo físico sufre una compresión con pérdida: cualquier interfaz que traduzca la existencia humana, que es una «señal continua» (por usar la terminología de la informática), en unidades discretas, como los símbolos lingüísticos, pierde la riqueza del detalle. El anclaje es, por tanto, a la vez indirecto y con pérdida. En comparación con la inteligencia y el uso del significado propios del nivel humano, los LLM ocupan un nicho nunca visto: el de sistemas que producen una salida lingüística de nivel humano cuyo significado tiene una modalidad puramente simbólica. Las redes de significado generadas por los LLM pueden entenderse como un ejemplo extremo de inteligencia humana impregnada de lenguaje.
Introducción
Al menos desde la segunda mitad del siglo XX, nuestra sociedad ha sido calificada de sociedad de la información, sociedad red, sociedad postindustrial, etc.[1] Todos estos términos reflejan el modo dominante en que funciona la sociedad. La información, las redes, las abstracciones y el conocimiento simbólico son la moneda de nuestro tiempo. Los individuos con un alto nivel educativo y aptitud para el pensamiento analítico y abstracto y para el procesamiento de información son los profesionales más buscados. La llegada del cognitivismo a la filosofía de la mente y a las ciencias cognitivas marcó el comienzo de la era en que la metáfora del ser humano como procesador de información empezó a tomarse en serio incluso en la vanguardia de nuestra búsqueda por comprender quiénes somos y cómo funcionan nuestras mentes. El trabajo de Simon y Newell en los sistemas de software Logic Theorist y General Problem Solver, ELIZA de Weizenbaum, SHRDLU de Winograd, e incluso Syntactic structures de Chomsky y, más tarde, el giro biológico en la lingüística fueron algunas de las muchas teorías y proyectos que intentaron explicar la cognición humana apelando a la lógica y al lenguaje en tanto que ingredientes esenciales de la inteligencia humana. Es cierto que desde entonces las ciencias cognitivas y la IA han experimentado cambios profundos. Los cambios de paradigma conexionista y 4E pusieron el acento en el uso de redes neuronales y en el papel del cuerpo inserto en contextos situados y, más ampliamente, culturales y sociales, para crear un modelo más fiel de cómo funcionan los procesos cerebrales y la cognición humana. Pero el interés por comprender la inteligencia, tanto humana como artificial, sigue siendo primordial.
Sin embargo, la aparición de ChatGPT, Bard, Claude y otros chatbots basados en la arquitectura de los grandes modelos de lenguaje (LLM) nos obliga a reconsiderar quiénes somos. Los LLM muestran que el uso del lenguaje, el rasgo humano más distintivo frente a todas las demás especies animales, puede automatizarse para producir respuestas semejantes a las humanas, superar con facilidad la prueba de Turing y aventajar al ser humano medio en el manejo de datos factuales, en el razonamiento lógico o en las capacidades lingüísticas. Si los LLM vencen a los seres humanos en las tareas que consideramos exclusivamente humanas, ¿se está volviendo la inteligencia artificial basada en LLM más parecida a nosotros que nosotros mismos? Parece absurdo afirmar que un LLM, una máquina de predicción formal de cadenas de símbolos, pueda alcanzar el estatus de ser humano. A menos que seamos hipócritas, no podemos dejar de ensalzar la inteligencia y la competencia lingüística humanas como los valores cognitivos humanos más elevados en el momento en que otra entidad nos supera. Para evitar el enigma ontológico de qué significa ser humano, preguntaré de otro modo: ¿pueden los LLM, siquiera en teoría, llegar a ser más inteligentes que los seres humanos? Para evitar, de nuevo, definir qué es la inteligencia, acotaré aún más mi indagación: signifique lo que signifique ser inteligente, presupongo que la inteligencia de tipo humano requiere comprensión; y la comprensión requiere captar lo que significan las palabras, las oraciones o los conceptos. Sin comprensión del significado no puede haber inteligencia.
Redes de significado: una intersección entre la fenomenología y los significados lingüísticos
Es importante aclarar qué entiendo por significado. No presentaré aquí un panorama de las teorías del significado en la filosofía analítica. Lo que sí puedo esbozar aquí es una teoría mínima del significado que choca tanto con la teoría referencial del significado como con la teoría veritativo-condicional del significado.
Imaginemos que queremos hablar del significado de la palabra «madre». Mi madre falleció hace unos meses. Lo que genera mi mente al pensar en el significado de la palabra es lo siguiente: recuerdo una imagen visual del rostro sombrío de mi madre y la frialdad de su frente cuando la besé mientras yacía en el ataúd en la iglesia. Recuerdo el olor del incienso mientras oía las notas de Dancing Queen de ABBA, interpretada por un cuarteto de cuerda con viola, violines y violonchelo. Tengo recuerdos táctiles de abrazar a mi madre enferma unos días antes de su muerte. Siento sentimientos no objetivables de tristeza, remordimiento y felicidad al pensar en la palabra. Además, mi mente gravita hacia el tema de qué significa ser madre, del que hablé con mi prometida embarazada. Mi mente también es consciente de los vínculos puramente lingüísticos que la palabra «madre» tiene con otras palabras como «padre», «embarazo», «mujer», «hijos», etc., y de las relaciones lingüísticas entre la palabra «madre» y otros rasgos de la lengua («mi», posesivo; «madres», plural; «sin respirar», construcción verbal, etc.). También soy consciente de las connotaciones de la palabra «madre» que he asimilado en mi comprensión de la palabra al leer periódicos y literatura o al aprender intersubjetivamente, hablando con otras personas, qué pueden hacer las madres o cómo son.
El significado de la palabra «madre» es para mí a la vez privado y público. El significado privado consiste en elementos de diversas modalidades perceptivas y en símbolos lingüísticos. El significado público, externo, consiste en lo que he oído y asimilado de mi comunidad y de la sociedad en general, normalmente en forma de símbolos lingüísticos (es decir, palabras y oraciones), lo cual puede haber afectado, mediante un bucle de retroalimentación, a mis subsignificados no lingüísticos, derivados de la percepción (p. ej., cuando oí lo mal que se había portado la madre de alguien, empecé a apreciar más a la mía y a sentir más amor por ella, lo que modificó mis subsignificados anteriores, derivados de los sentimientos).
Si tomamos prestados además de la teoría de redes los términos básicos «nodo» y «aristas», su equivalente sería
nodo = palabras / conceptos
arista = elemento de significado que puede tener muchas modalidades: representaciones perceptivas o simbólicas, sentimientos, otros nodos mediados por las representaciones simbólicas
Como vemos, el significado de una palabra es ante todo un significado para mí, que existe en mi mente. Es una «red de significado» multimodal formada por elementos tanto perceptivos como lingüísticos. Esta «red de significado» no es estática, sino que reacciona dinámicamente a mi existencia situada en el mundo; en cualquier momento pueden añadirse nuevos elementos perceptivos o lingüísticos, o posiblemente eliminarse (o más bien sobrescribirse).
El término «madre» no puede referirse a un solo «objeto» existente en el mundo. Dejo de lado la distinción fregeana entre «sentido» y «referencia», que presupone referentes y sentido estables. En su lugar, quiero proponer una semántica multimodal y reticular en la que el significado de los términos equivale a las propias redes de significado. Con ello puedo integrar datos sensoriales, sentimientos, imágenes visuales, creencias falsas, palabras, conceptos y recuerdos de muchas modalidades de los que tengo la sensación clara y distinta de que constituyen lo que quiero decir cuando uso el término «madre», o términos como «mi madre» o «Helena Ferencová».
La red de significado está abierta a la influencia de los significados públicos y compartidos de la palabra «madre», y eso ayuda a defender la teoría del significado aquí propuesta frente a la acusación de significado privado, que, como argumentó Wittgenstein, es imposible[2]. La comunidad de la que soy miembro sí participa en la constitución de lo que «madre» significa para mí, y soy consciente de que nuestras experiencias personales y lo que pensamos sobre las madres coconstituyen mutuamente nuestras redes de significado, y de que la cultura compartida influye en nuestras redes de significado de modo que se solapan considerablemente. Eso implica que debe haber elementos estables que estén fijados, o cuya estabilidad se imponga de forma dinámica y continua mediante la interacción lingüística o perceptiva con los demás. En otras palabras, las redes de significado pueden ser dinámicas y, sin embargo, su estabilidad se negocia constantemente en la interacción con los demás. No puedo cambiar toda la red de significado de lo que entiendo por «madre», porque estaría hablando de otra persona o de otra cosa. Si el lenguaje ha de conservar una función comunicativa, necesito mantener bastante estables los contenidos de mis redes de significado (en otras palabras, el significado de los términos que uso) para que la mayoría de la gente me entienda razonablemente. Si lo que quiero decir difiere radicalmente de lo que quiere decir cualquier otra persona, necesito explicarme a los demás y, con ello, actualizar sus propias redes de significado, siempre que estén abiertos a integrar cognitivamente información nueva.
En cuanto a las condiciones de verdad, la verdad puede ser un elemento de mi red de significado, pero no agota todo el concepto de significado. Mi sentimiento subjetivo de pena es ahora mismo más portador de significado que cualquier concepción de la verdad. No quiero decir que una condición de verdad no participe en el significado de los términos, sino que queda relegada, por así decirlo, al nivel de los demás elementos de significado.
Parece plausible que el aspecto dinámico de las redes de significado se realice en parte a través de la influencia del mundo exterior sobre los elementos de significado almacenados en mi memoria. Pero mis elementos de significado también pueden cambiar porque mi memoria falla, cuando olvido palabras o experiencias relacionadas con mi madre. Asimismo, por efecto del tiempo, es probable que algunos elementos de significado se desvanezcan en parte, mientras que otros sigan siendo fuertes o incluso se refuercen. Si tomamos prestada la terminología de las redes neuronales, en las que se basan los propios LLM, podemos asignar a cada elemento de significado un peso que indica con qué fuerza o debilidad participa un elemento de significado dado en la constitución del significado. Si mañana enciendo una varilla de incienso en casa, puede que aumente el peso de los elementos de significado relacionados con el olor, la iglesia, el ataúd y el funeral en el significado de la palabra «madre».
Los elementos de significado individuales también pueden ser falsos. Puede que haya empezado a asociar las chaquetas de terciopelo negro con el significado de «madre» por mi creencia de que ella llevaba esa prenda en el funeral. En realidad, puede que fuera un vestido de terciopelo azul marino oscuro, pero debido a la mala iluminación el color me pareció negro. Así, algunos elementos de significado pueden añadirse a mi red de significado sobre la base de una creencia falsa. Pero lo que es indudablemente cierto es que este elemento de significado falso participa en el significado de «madre». Creo que lo mismo puede decirse de los elementos de significado derivados de referencias a alucinaciones o a cosas cuya existencia no está probada y que, sin embargo, forman parte de mis redes de significado, como el concepto de «cielo» o de «Dios».
Lo importante es que sigue habiendo lugar en la red de significado para un significado puramente simbólico o lingüístico. Otras palabras y rasgos lingüísticos que pueden ser puramente formales (basados en la posición de las palabras en una oración, tal como exigen las reglas sintácticas de una lengua) sí contribuyen a constituir la red de significado en su conjunto. Pero, de nuevo, el significado lingüístico es solo una parte de la red de significado. Tampoco él agota el significado completo de la palabra «madre».
Me mantengo agnóstico en cuanto a qué porcentaje de las redes de significado en su conjunto está constituido por una modalidad dada. Algunas personas pueden tener una inclinación más visual; otras se apoyan en elementos lingüísticos en sus redes de significado. No todas las modalidades aquí descritas estarán presentes en las redes de significado de los demás. Por ejemplo, una persona que padece la condición llamada afantasía es incapaz de generar imágenes mentales. Cabe esperar que su red de significado no se apoye en ningún dato sensorial visual, o que la influencia de los datos sensoriales visuales esté muy disminuida.
La teoría del significado vis-à-vis el concepto de red de significado se apoya en unos pocos requisitos mínimos: no es solo formal-simbólica ni puramente lingüística; es a la vez interna/privada y externa/compartida por la comunidad; está constituida por varias modalidades, entre las cuales los símbolos y las relaciones lingüísticas son solo uno de los muchos elementos constitutivos del significado. Los elementos de significado que constituyen el significado tienen pesos que indican con qué fuerza o debilidad participa un elemento de significado dado en el significado global.
La habitación china y los loros estocásticos
No todas las redes de significado son iguales. Hay personas con una comprensión más profunda que otras de los conceptos, las cosas, las acciones corporales, etc. ¿Qué ocurre exactamente cuando decimos que la comprensión de alguien es profunda o superficial?
En el famoso experimento de la habitación china[3] Searle nos muestra qué significa tener una comprensión exactamente nula del significado de las palabras y las oraciones. Searle, que no entiende nada de chino, está sentado en una habitación cerrada. Por un lado recibe un conjunto de símbolos chinos que representan un texto escrito por un hablante nativo de chino. También recibe un conjunto de símbolos chinos para las respuestas, así como instrucciones escritas en inglés, que él entiende, sobre cómo correlacionar los símbolos de entrada con los de salida, de modo que finge mantener una conversación natural en chino con una persona que está fuera de la habitación. Searle no comprende en absoluto el significado de los símbolos chinos; los correlaciona de forma puramente formal, a partir de su figura (es decir, su forma). Searle sostiene que esta manipulación de símbolos formales basada en un conjunto fijo de reglas es análoga a como funcionan los ordenadores. Puesto que los ordenadores también trabajan solo con símbolos formales, no comprenden el significado de los símbolos. Searle, al igual que los ordenadores, no entiende el chino porque ambos operan en el nivel formal y sintáctico, que carece de comprensión del significado de las palabras, o, como diría Searle: la manipulación de símbolos formales regida por reglas carece de estados mentales, que son condición previa de una intencionalidad intrínseca[4]. La intencionalidad es una propiedad de los estados mentales que señala que cada estado mental tiene un contenido; los estados mentales son acerca de algo.
En cierto modo, podríamos responder aquí mismo a la pregunta de si la IA basada en LLM es inteligente diciendo que los LLM no tienen estados mentales y que, por tanto, todo lo que hacen carece de intencionalidad, de direccionalidad hacia algo o de contenido mental. Y si sus estados no son acerca de nada, no pueden comprender el significado.
No discutiré aquí si los LLM tienen estados mentales o intencionalidad. Digamos que es una cuestión de definición o una cuestión empírica. Quiero imaginar con qué tipo de estados mentales, o más bien con qué tipo de redes de significado, trabajan los LLM, tengan o no estados mentales.
Los LLM funcionan enlazando cadenas de palabras según la probabilidad de esa combinación, derivada de representaciones de alta dimensionalidad latentes en el gran corpus de datos lingüísticos. (Bender et al., 2021) acuñaron el término «loro estocástico» para describir que la arquitectura de los LLM produce cadenas de palabras aparentemente coherentes, pero sin referencia alguna al significado de esas cadenas de datos, igual que el loro, el animal, que no tiene competencia lingüística y se limita a repetir los sonidos fonéticos que ha oído a los seres humanos, quienes interpretan esos sonidos repetidos mecánicamente como unidades fonémicas diferenciadas de palabras distinguibles. (Bender et al., 2021) sostienen que los LLM generan esas cadenas enlazadas «al azar» y que su coherencia está puramente «en los ojos del observador», lo que sugiere que la coherencia no es inherente a la salida de los LLM, sino que se la dan desde fuera los intérpretes humanos de las salidas producidas por los LLM. (Bender & Koller, 2020) aclaran después su concepción del significado adhiriéndose a la teoría referencial del significado, en la que entienden el significado como «la relación entre la forma y algo externo al lenguaje…» (p. 5187). En otras palabras, para que un ser humano o un ordenador sea un hablante competente y comprenda el significado de las palabras que usa, tiene que «anclar» su comprensión de las palabras en el mundo real. (Bender & Koller, 2020) citan a (Harnad, 1990) y su «Symbol grounding problem» para argumentar que, sin el anclaje de los significados en el mundo físico, el sistema (ser humano, ordenador) no puede comprender el lenguaje; sería análogo a aprender una lengua solo estudiando un diccionario. Las respuestas con significado deben establecer conexiones entre las palabras y el mundo físico.
Como intentaré explicar a continuación, discrepo de Bender et al. en tres puntos concretos:
- el significado debe referirse a algo fuera del lenguaje
- los LLM producen salidas al azar
- la coherencia está en los ojos del observador
Significados anclados y no anclados
(Harnad, 1990), en la época del paradigma de la IA simbólica y en consonancia con el argumento de la habitación china de Searle, escribe contra la idea de que la manipulación puramente formal de símbolos pueda conducir a la comprensión. El núcleo de su argumentación es que, para que los sistemas simbólicos comprendan una lengua, deben anclar el significado de las palabras en el nivel más básico en representaciones no simbólicas procedentes de los datos sensoriales de nuestra percepción del mundo físico y de nuestra interacción con él.
Para «anclar» sus significados, los sistemas deben contar con equivalentes de dos elementos que Harnad llama 1) representaciones icónicas y 2) representaciones categoriales, y solo entonces es posible ponerles encima una etiqueta lingüística mediante 3) la representación simbólica.
1 Representaciones icónicas
Las representaciones icónicas son datos perceptivos en bruto de objetos concretos que todavía no podemos identificar ni nombrar. En el caso de la visión, las representaciones icónicas serían las formas que los objetos, como los caballos, por seguir el propio ejemplo de Harnad, proyectan en nuestra retina. La mente conservaría las representaciones icónicas de los caballos como análogos de sus formas reales. En este nivel, según Harnad, las únicas funciones necesarias son las que discriminan las formas almacenadas de caballos según su similitud o diferencia. Lo importante es que existe una relación no arbitraria, isomórfica, entre el icono y aquello a lo que se refiere, porque la representación icónica guarda una relación estructural con su origen.
2 Representación categorial
Según Harnad, los iconos no bastan para el significado. El mundo es demasiado complejo y necesitamos identificar con mayor rapidez qué formas y qué datos sensoriales procedentes de nuestros órganos de los sentidos pertenecen a una categoría determinada. Para ello necesitamos abstraer rasgos invariantes de las representaciones icónicas y crear categorías a partir de esas invariantes, de modo que en el futuro, cuando encontremos un objeto con forma de caballo, podamos identificar más rápido si pertenece a la categoría que tiene atributos equinos. En este nivel todavía no usamos la palabra «caballo» para describir la representación categorial, sino que identificamos a los caballos por la forma de su cabeza, por tener cuatro patas, por tener cola, etc.
3 Representación simbólica
Solo en este nivel entra en juego el lenguaje. Una vez que tenemos el «caballo» como conjunto de rasgos abstraídos de lo que se parece a un caballo real, asociamos en nuestra mente el símbolo «caballo» con nuestra comprensión, perceptivamente anclada y experiencial, de un caballo. Pese a que los símbolos de este nivel son completamente arbitrarios —la forma del símbolo/palabra «caballo» no guarda parecido alguno con el caballo real—, tienen significado porque su contenido semántico (el significado) se hereda de las representaciones icónicas y categoriales. Desde este punto de vista, lo que da significado a los símbolos son precisamente sus referencias al mundo exterior derivadas de la percepción.
Curiosamente, Harnad admite la posibilidad de crear símbolos con significado que no tengan representaciones icónicas y categoriales directas. Harnad pone el ejemplo de la palabra «cebra»:
«cebra» = «caballo» + «rayas».
Si el sistema tiene representaciones icónicas y categoriales de la palabra «rayas», entonces Harnad admite que la representación simbólica heredará su anclaje a partir de las representaciones simbólicas ancladas de «caballo» y «rayas». ¿Qué significa esto? El sistema tendrá una palabra con significado, «cebra», pese a no tener ninguna referencia perceptiva directa de una cebra en el mundo exterior. El significado es heredado, o derivado. Sus únicos significados directos son referencias a los símbolos lingüísticos «caballo» y «rayas».
Me parece que (Bender & Koller, 2020), que se apoyan en (Harnad, 1990), suponen erróneamente que Harnad no admite otros significados que los anclados. Pero, según mi lectura de (Harnad, 1990), admite significados de símbolos/palabras que no tienen una referencia directa al mundo físico, siempre que sus referencias reales sean símbolos/palabras cuyos significados estén anclados en el mundo físico. Exactamente como en el ejemplo de cebra = «caballo» + «rayas».
Una vez que rompemos la necesidad de una conexión directa entre el significado de una palabra/símbolo y su relación con el mundo físico, parece que nada nos impide introducir una serie de símbolos intermedios como los únicos significados reales de un símbolo original, siempre que algún símbolo, el último, esté anclado en el mundo físico.
Creo que hemos socavado la primera afirmación, 1) el significado debe referirse a algo fuera del lenguaje. Acabamos de ver que un significado puede referirse a algo dentro del lenguaje, pero, para ser coherente con (Harnad, 1990), debe en última instancia saltar del espacio lingüístico a un espacio físico de percepciones y de representaciones icónicas y categoriales para quedar anclado, lo cual es para (Harnad, 1990) una salida necesaria de un regreso infinito de símbolos lingüísticos que remiten solo a otros símbolos lingüísticos, nunca fuera del sistema de la lengua.
Redes de significado dispersas y densas
Volviendo a nuestro concepto de redes de significado, ¿cómo podemos comprender mejor qué significados son profundos o densos y cuáles son superficiales o dispersos?
Con la teoría del anclaje de los símbolos de (Harnad, 1990), creo que podemos afirmar que mis descripciones de la red de significado que representa el significado de la palabra «madre», tal como yo la uso, son un caso de significado anclado por excelencia.
Imaginemos ahora que nunca tuve madre. De hecho, nunca he leído nada sobre las madres, salvo la información de que una madre es un ser humano de sexo femenino que tiene al menos un hijo. Imaginemos además que tengo una comprensión anclada de los símbolos «humano», «mujer» e «hijo». ¿En qué se diferencia una comprensión tan superficial de «madre» de mi comprensión personal y más profunda?
En el primer caso, la red de significado sería más bien dispersa. Constaría potencialmente de solo tres símbolos lingüísticos. En el segundo ejemplo, el esquema gráfico del significado de «madre» tal como yo la uso sería una red densa de datos derivados de la percepción, de numerosos símbolos lingüísticos anclados y quizá también de símbolos no anclados como «cielo» o «Dios», con los que, a efectos del argumento, ni siquiera en teoría puedo tener relación experiencial alguna, y todos los significados directos vinculados a estas dos palabras son símbolos lingüísticos. Algunos de ellos pueden estar anclados en niveles inferiores.
Como dijimos, podemos tener aristas ponderadas (elementos de significado) de la red de significado conectadas a un nodo (palabra/símbolo), tal como permite la teoría de grafos estándar en matemáticas. La densidad y la dispersión de las redes de significado no se calcularían únicamente por el número de elementos de significado, sino que habría que tener en cuenta el peso con que participan los distintos elementos de significado en la constitución del significado global.
Modelar el significado como redes implica también que el significado no es un valor binario. Hacia el extremo izquierdo del espectro, el significado es cada vez más disperso. Hacia el otro extremo, el significado va ganando densidad.
Coherencia y azar en los LLM
Antes dijimos que (Bender et al., 2021) afirman que
2) los LLM producen salidas al azar
3) la coherencia está en los ojos del observador
Las afirmaciones 2) y 3) son en realidad lógicamente interdependientes. Si los LLM producen salidas al azar, toda la coherencia y el significado que haya en ellas deben deberse a la pura casualidad, o bien ser reconstruidos por el sistema externo que interpreta la salida de los LLM. Ese sistema pueden ser, por ejemplo, los seres humanos.
Los LLM son máquinas de predicción de símbolos. Y su éxito en la predicción estadística y en el reconocimiento de patrones depende del tamaño del corpus de datos, aportado por los seres humanos. El uso de la estadística y la predicción no hace que los LLM sean azarosos[5].
A menos que nos preocupe que los propios datos sean azarosos e incoherentes. Pero eso no es lo que sostienen (Bender et al., 2021). Digamos lo que digamos sobre la calidad del discurso humano, sobre todo del que procede de fuentes en línea, si los datos que usan los LLM se derivan del discurso de hablantes nativos, la coherencia no está en los ojos del observador, sino que está objetivamente incrustada en el corpus de datos con el que trabajan los LLM, precisamente porque la coherencia la crean inicialmente los propios seres humanos. Lo que hacen los LLM, según me parece, es aplicar la estadística y la predicción al corpus de datos, que son compresiones lingüísticas de todo tipo de redes de significado dispersas y densas creadas por los propios seres humanos. Los LLM pueden acceder a las redes de significado aprovechando el hecho de que todos los significados anclados o todas las redes de significado pueden hacerse explícitos mediante una transformación en formas puramente simbólicas, es decir, en una lengua. El lenguaje es una ventana, o una interfaz, hacia las redes de significado humanas y hacia todos los significados anclados en un mundo físico exterior.
El lenguaje como interfaz hacia las redes de significado humanas
Sabemos que los LLM funcionan prediciendo estadísticamente la mejor palabra siguiente que encaje con las cadenas de texto generadas previamente y con su contexto. Si con «estocástico», en la acusación de «loro estocástico», queremos decir simplemente que los LLM usan la estadística para generar sus respuestas, eso no puede considerarse por sí solo un argumento contra los LLM, sobre todo cuando los cerebros humanos sin duda emplean sus propios procesos de predicción estadística.[6] Entonces, ¿lo que queda es criticar la idea de que los LLM son meros «loros»? Los loros que pueden hablar imitan con bastante fidelidad los sonidos del habla humana, pero no pueden ir más allá de los datos que han oído y, además, esos sonidos no tienen ningún significado para los propios loros. Los LLM van claramente más allá de los datos y generan oraciones nuevas. Podemos descartar, pues, la primera parte de la acusación de ser un loro. ¿Y qué hay de la parte de la acusación que atañe al significado?
Los LLM no tienen cuerpo, por ahora. El significado de sus palabras y enunciados no puede estar anclado en el mundo físico. Esto por sí mismo, como hemos argumentado antes, no constituye un problema que conduzca a la falta de significado, si las palabras que emiten los LLM están ancladas en algún nivel en el mundo físico que los seres humanos habitan y experimentan. ¿Lo están? Quiero argumentar que las palabras producidas por los LLM están efectivamente ancladas, aunque sea a través de mediadores simbólicos que funcionan como una interfaz hacia las redes de significado humanas.
Imaginemos que cada ser humano tiene una red de significado para cada palabra. Hemos admitido que las redes de significado no son del todo privadas, sino que se comparten en parte dentro de la comunidad lingüística. Cuando hablamos y escribimos y queremos «transmitir el significado», comprimimos nuestras complejas y desordenadas redes de significado en una lengua. Por su propio diseño, la lengua comprime, vuelve discretas las cosas complejas y las separa en unidades aprehensibles. Puedo retener en mi mente la experiencia abrumadora de un funeral. Sin embargo, cuando escribí sobre el funeral en mi diario, me vi obligado a reducir la experiencia a palabras y oraciones. De hecho, todas las fuentes escritas, desde los periódicos hasta la poesía y las novelas, son artefactos en los que usamos la tecnología cognitiva de la escritura para hacer que lo aparentemente indescriptible se preste a la descripción lingüística.
Tras la compresión que conlleva el uso de una lengua, transformamos todos los elementos de significado que no son lingüísticos en alguna forma de cadenas lingüísticas. Estas cadenas estarán ancladas porque su significado remite en última instancia a otras representaciones simbólicas que están ancladas, o directamente a representaciones icónicas y categoriales. Cuanto más se solapen las redes de significado de algunas palabras, más rápido llegarán a los LLM los rasgos invariantes del significado de la palabra, porque son máquinas estadísticas tan potentes que captan regularidades y patrones en los datos que ni siquiera los seres humanos advierten.
Una vez que los significados anclados procedentes de la experiencia física humana en el mundo se han comprimido en símbolos lingüísticos, que pueden constituir o no redes de significado de otras palabras, los LLM pueden acceder a este anclaje de las palabras comprimido lingüísticamente.
De forma indirecta y parasitando el anclaje humano del significado, los LLM usan el lenguaje como una interfaz para acceder a nuestras redes de significado, mediadas por toda la producción lingüística que nosotros, como humanidad, hemos generado y que se ha usado como datos de entrada de los que aprenden los LLM. Pero usar una interfaz tiene un precio que hay que pagar. Este acto de usar una interfaz —anteriormente lo llamé interfacialidad[7] — es una compresión con pérdida, porque la interfaz inevitablemente simplifica y reduce. Pondré un ejemplo. Mis sentimientos, recuerdos e ideas que constituyen el significado de la palabra «madre» y que guardo en mi mente no tienen formas discretas concretas. Son, por usar un término de la informática, una señal continua, precisamente porque mi realidad experiencial (fenoménica), que coconstituye la red de memoria (junto con las representaciones simbólicas), tampoco es discreta. Pero al usar una lengua como interfaz hacia la red de significado de la palabra «madre», reduzco las señales continuas a las formas discretas de las palabras para crear representaciones simbólicas discretas. Inevitablemente se pierde mucho detalle, porque hacer una representación lingüística de una realidad fenoménica es un proceso con pérdida.
¿Cuánta pérdida hay? Depende de la densidad de una representación lingüística y de lo profundamente que acceda a la totalidad de las redes de significado de cada palabra y de elementos de orden superior, como una oración o un párrafo. ¿Cuáles son los significados de estos elementos de orden superior? Tal como yo lo veo, el significado se constituye mediante un proceso de fusión de las redes de significado de cada palabra y de recorrido de las redes de significado fusionadas, en el que las reglas válidas de dicho recorrido se rigen por las reglas sintácticas de la lengua dada. La pérdida de una representación lingüística sería distinta en una persona corriente y, digamos, en un premio Nobel de Literatura. Sea cual sea el estatus ontológico de la realidad experiencial, un escritor o un orador magistral puede usar su destreza en el uso de la lengua para acercar la realidad fenoménica, continua e irreductible, a algo que nos resulte aprehensible y significativo.
Los LLM tienen redes de significado densas y modalmente superficiales
Para nosotros, los seres humanos, es normal enriquecer nuestras propias redes de significado mediante una polinización cruzada que se produce cuando interactuamos únicamente con las representaciones lingüísticas de otros, como la literatura, y que hace más densas las redes de significado, pese a que no tenemos referencias experienciales directas (representaciones icónicas, categoriales) de lo que leemos en las grandes novelas, en la poesía o en la filosofía. La mayoría de las personas que leen sobre neurociencia no tienen representaciones icónicas ni categoriales de términos como «lóbulos frontales», «codificación predictiva» o «células gliales». Y, sin embargo, hablamos de ello con gusto. Una persona cualquiera que habla de neurociencia tiene una red de significado muy dispersa sobre el tema y, muy probablemente, pocas representaciones simbólicas ancladas en una realidad experiencial, si es que tiene alguna. Es de suponer que la mayoría, si no la totalidad, de los elementos de significado de sus redes de significado relacionados con el tema serían representaciones simbólicas/lingüísticas no ancladas, y solo unos pocos ejemplos de películas, fotos o entrevistas con pacientes con lesiones cerebrales contribuirían a constituir lo que el tema significa para ella. Si esta estudiante de neurociencia nos contara algo sobre los cerebros, le faltaría el significado anclado en la realidad experiencial de ver y operar un cerebro, le faltarían los vínculos emocionales con los pacientes, etc., pero sería capaz de recitar las últimas teorías, los conceptos, libros enteros sobre el tema. Nuestra neurocientífica sería una teórica experta en la materia: analizaría conceptos, encontraría semejanzas y diferencias, podría ofrecer críticas basadas en la coherencia con el cuerpo de conocimiento existente e incluso podría predecir nuevas teorías al ver patrones y conexiones en el cuerpo de conocimiento que nadie más podría ver. Nuestra teórica de la neurociencia podría incluso aprobar la carrera de Medicina, pero pensaríamos que algo falta en su comprensión del tema.
Los LLM son un caso extremo de nuestra teórica de la neurociencia en lo que respecta a las redes de significado. A partir de los datos lingüísticos coherentes y estructurados que los seres humanos hemos producido a lo largo de la historia, los LLM reconstruyen patrones que existen en nuestras redes de significado y encuentran con facilidad otros nuevos, algo que ningún ser humano podría hacer. A través del lenguaje, los LLM disponen de una interfaz accesible hacia nuestra representación simbólica discreta de la realidad fenoménica, continua e irreductible, lo cual es inevitablemente un proceso con pérdida; pero, de nuevo, la mera cantidad de datos lingüísticos puede arrojar más luz sobre la realidad existencial de lo que cualquier persona podría esperar. Cualquier modificación de las redes de significado de los LLM consiste únicamente en añadir, eliminar o modificar representaciones simbólicas. Así, los LLM tienen redes de significado extremadamente densas, con una cantidad inimaginable de elementos de significado ponderados. Pero lo que les falta, de manera similar a nuestra neurocientífica teórica, es diversidad en la modalidad de esos elementos de significado. La mayoría de los elementos de significado de las redes de significado de la neurocientífica teórica son representaciones simbólicas. Los LLM, en cambio, son el límite extremo de estas redes de significado «modalmente superficiales», en las que solo una de las modalidades —la representación simbólica— puede usarse para codificar los elementos de significado.
Discusión a modo de resumen
Nunca nos habíamos encontrado con una entidad capaz de citar, analizar y sintetizar sin esfuerzo la historia de la realidad experiencial humana mediada por la compresión con pérdida de las representaciones lingüísticas. Responder a si los LLM pueden alcanzar una inteligencia de tipo humano depende, por supuesto, de lo que entendamos por «humano». Debido a nuestra tendencia social a privilegiar los procesos cognitivos e intelectuales, siendo la dotación lingüística una capacidad marcadamente humana, las capacidades lingüísticas ocupan un lugar destacado en la lista de lo que nos separa del resto del reino animal. En ese sentido, los LLM nos han superado. Ningún ser humano será nunca capaz de abarcar, analizar, sintetizar y recorrer las redes de significado construidas a partir de todo el corpus del conocimiento y la experiencia humanos. Pese a que los LLM presentan redes de significado cuantitativamente densas pero modalmente superficiales, el significado de la salida que generan no es ni estocástico ni repetitivo. Por esa razón, propongo que rechacemos la afirmación actual de que los LLM son loros estocásticos. Al contrario, las redes de significado latentes en el corpus lingüístico e incrustadas en las redes de alta dimensionalidad de los LLM tienen un sólido linaje, basado en símbolos anclados que remiten a la realidad experiencial humana. ¿Y qué, si los propios LLM no la han vivido? Los seres humanos, con los teóricos y los filósofos a la cabeza, usamos sin reparos palabras/representaciones simbólicas cuya red de significado consiste solo en otras palabras y conceptos representados lingüísticamente, porque no tenemos otra experiencia de ellas que otras palabras y conceptos.
La densidad de las redes de significado incrustadas en los LLM es muy superior a lo que pueden abarcar nuestros cerebros. ¿Y qué, si las redes de significado están implementadas en silicio y no en carbono?
Referencias
Bell, D. (1999). The coming of post-industrial society: a venture in social forecasting (Special anniversary ed. /). Basic Books.
Bender, E. M., & Koller, A. (2020). Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data. En Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics. https://doi.org/10.18653/v1/2020.acl-main.463
Bender, E. M., Gebru, T., McMillan-Major, A., & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots, 610-623. https://doi.org/10.1145/3442188.3445922
Castells, M., & Cardoso, G. (2006). The network society: from knowledge to policy. Johns Hopkins Center for Transatlantic Relations.
Clark, A. (2013a). Are we predictive engines? Perils, prospects, and the puzzle of the porous perceiver. Behavioral and Brain Sciences, 36(3), 233-253. https://doi.org/10.1017/s0140525x12002440
Clark, A. (2013b). Whatever next? Predictive brains, situated agents, and the future of cognitive science. Behavioral and Brain Sciences, 36(3), 181-204. https://doi.org/10.1017/s0140525x12000477
Dijk, J. van. (2006). The network society: social aspects of new media (2.ª ed.). Sage Publications.
Ferenc, J. (2018). Postkognitivistické HCI: Vidět interface jako sociotechnický vztah [Tesis de máster]. Univerzita Karlova.
Harnad, S. (1990). The symbol grounding problem. Physica D: Nonlinear Phenomena, 42(1-3), 335-346. https://doi.org/10.1016/0167-2789(90)90087-6
Searle, J. R. (1980). Minds, brains, and programs. Behavioral and Brain Sciences, 3(3), 417-424. https://doi.org/10.1017/S0140525X00005756
Webster, F. (2006). Theories of the information society (3.ª ed.). Routledge.
Wittgenstein, L. (2009). Philosophical investigations (4.ª ed. rev.). Wiley-Blackwell.
- Bell, 1999; Castells, 2006; Dijk, 2006; Webster, 2006 ↑
- Wittgenstein, 2009 ↑
- Searle, 1980 ↑
- ibíd., Searle, 1980 ↑
- Si sé que eres una mujer de Estados Unidos y que tu nombre empieza por las letras «JAN», hay bastantes probabilidades de que la cuarta letra de tu nombre sea «E». No puedo estar del todo seguro, pero la respuesta se deriva de un análisis estadístico del conjunto de todos los nombres femeninos estadounidenses y de la frecuencia de las letras en esos nombres. No es un proceso azaroso para llegar a la respuesta. De manera similar, los LLM usan la estadística para llegar a su respuesta. No veo por qué el uso de métodos estadísticos habría de constituir un proceso azaroso de trabajo con los datos. ↑
- Clark, 2013a; Clark, 2013b ↑
- Ferenc, 2018 ↑