Introducción
En la asignatura Fundamentos de los estudios de nuevos medios nos centramos esta vez en las redes sociales, que nos permitían explorar y aclarar cualquier tema mediante la visualización de datos. Como herramienta para el análisis en sí elegimos el programa de visualización de código abierto Gephi, construido sobre la plataforma NetBeans de Java. De ella hereda varias propiedades buenas y malas: modularidad, un gran conjunto de funciones, una inestabilidad ocasional y, por último, aunque no menos importante, una GUI que no se diseñó como nativa para ningún sistema operativo concreto, lo que para muchos usuarios puede suponer un manejo no del todo intuitivo. Los autores de Gephi presumen además de que se trata del Photoshop de la visualización de datos en su categoría. Dejo al lector que juzgue si, desde el punto de vista del marketing, es un buen eslogan.
El tema era libre, así que decidí averiguar cómo reacciona la gente en la red social Twitter ante unos acontecimientos que, y no solo al otro lado del Atlántico, ocupan a la gente la mayor parte de su tiempo libre: las elecciones presidenciales de EE. UU.
Una vez elegido el tema, me encontré ante una pregunta mucho más complicada, que debía decidir si las horas de trabajo siguientes serían un juego al analista de datos meramente inútil o provechoso — la pregunta de cómo iba a tratar los datos, qué datos necesitaría en realidad, qué iba a buscar en ellos y si era teóricamente posible obtenerlo a partir de esos datos. Dicho de otro modo, saber qué buscar exactamente en los datos es en muchos casos más importante que saber cómo lograr algo. En realidad, estas preguntas son inseparables, pues se informan mutuamente.
Así, por ejemplo, un excelente conocimiento del dominio es, según las teorías actuales de la creatividad, uno de los requisitos para que una persona llegue a algo nuevo, útil y funcional, que son, por cierto, las propiedades que todo resultado creativo debe cumplir. El conocimiento del dominio es, por supuesto, un requisito necesario para un rendimiento eminente en cualquier actividad humana. Y es precisamente el conocimiento del dominio lo que hace de la analítica de datos mucho más que la mera aplicación de métodos matemáticos rigurosos a un conjunto de datos; la analítica de datos requiere también esos conocimientos que la comunidad académica considera soft: conciencia de la sociedad, de la cultura y del contexto actual del ámbito que voy a investigar, es decir, una especie de conciencia humanística, de soft science. Mi hipótesis, del todo especulativa, para explicar por qué hay tan pocos analistas de datos de calidad es precisamente la poco frecuente exigencia de ser a la vez un buen matemático y un humanista, de tener una formación informática y matemática unida a una dosis de sana conciencia de lo que ocurre en la sociedad al otro lado de la ventana, y además conocimientos de sociología, antropología, e incluso de literatura o filosofía, y, Dios no lo quiera, también de nuevos medios. Hace falta un poeta y un ajedrecista, un científico y un artista.
Bien, ¿cómo me las arreglé con este wicked problem, en el que existen muchas soluciones posibles, en el que la respuesta no oscila entre un binario SÍ-NO, sino que se sitúa más bien en una escala continua de idoneidad? ¿Qué pregunta decidí investigar?
Twitter es una plataforma adecuada para el análisis de texto, sobre todo porque las publicaciones son homogéneas gracias a su límite de 140 caracteres, lo que simplifica el análisis. Además de la publicación en sí, que aquí llamaré publicación propiamente dicha, un tuit contiene también texto que cumple la función de describir la publicación propiamente dicha; se trata, pues, de metadatos. Como tales se consideran la combinación de la arroba @ + nombre de usuario del usuario al que la publicación propiamente dicha se refiere de algún modo y, por supuesto, también el signo # + cualquier texto, es decir, la combinación que hoy se denomina ya comúnmente hashtag.
Como los hashtags se utilizan a menudo no como una cadena de caracteres del todo irrelevante y sin relación, sino como metadatos que completan la publicación propiamente dicha con información contextual útil que ayuda a los lectores a comprender el tuit, decidí servirme precisamente de los hashtags para llegar a una visión de cómo reacciona la gente, cómo escribe y, por tanto, cómo piensa sobre las campañas presidenciales de los candidatos que elegí. Pero ¿cómo exactamente iban a ser útiles para ello los hashtags, y qué significa en realidad un hashtag?
La web social 2.0, la folksonomía y los hashtags
Desde el punto de vista etimológico y lingüístico, la palabra hashtag surgió de la combinación de las palabras «hash» y «tag». Mientras que la palabra hash remite sin complicaciones al signo de almohadilla #, la segunda mitad de este compuesto, la palabra tag (etiqueta), es mucho más interesante, sobre todo porque las etiquetas fueron un aspecto importante de la transformación de la Web en una plataforma social, a la que en conjunto se empezó a llamar Web 2.0. El término se usó en su día tan a menudo que muchos lo despreciaron como un mero buzzword de marketing; aun así, era y sigue siendo una denominación útil de la Web en el momento en que nuevas tecnologías y nuevos enfoques en la creación de sitios y aplicaciones web dieron lugar a tendencias y proyectos que se diferenciaban notablemente de lo que, tras la introducción de la versión 2.0, llamamos Web 1.0. El resumen de todos los cambios importantes lo ofreció el influyente artículo What is Web 2.0 de Tim O’Reilly, por lo que aquí me limitaré solo a lo que atañe directamente a las etiquetas, o más bien a los hashtags: la folksonomía y lo que O’Reilly llamó «aprovechar la inteligencia colectiva».
Aunque desde la perspectiva actual pueda parecer inimaginable, la plataforma de la Web no siempre fue tan interactiva, receptiva y abierta a los usuarios. Es comprensible, sin embargo, pues la creatividad de los creadores de sitios web siempre fue de la mano de lo que la tecnología permitía. Así, por ejemplo, un diseñador web no podía pensar, al diseñar un sitio, en que su web tuviera abundante material fotográfico hasta que en 1993 llegó al mercado el navegador Mosaic, el primero que permitía que los elementos gráficos (p. ej., fotografías, elementos gráficos de la interfaz de usuario) no se mostraran en una ventana nueva, sino directamente dentro del contenido de la página web. Mosaic puede considerarse así el navegador web que por primera vez permitió que la Web se acercara al diseño gráfico, con lo que al mismo tiempo surgió la demanda de diseñadores web y arquitectos de la información, es decir, de profesionales capaces de dar forma adecuada a estas nuevas y asombrosas posibilidades gráficas para que una página web pudiera ofrecer a sus visitantes información y experiencias de forma rápida y adecuada.
Con la llegada de lenguajes de script del lado del cliente como Javascript, de los navegadores, del uso de lenguajes de programación y bases de datos más adecuados y, sobre todo, del soporte de estas funcionalidades por parte de los fabricantes de navegadores web, surgieron proyectos web que permitían no solo interacciones más ricas, sino también la implicación de sus usuarios en la creación de contenido web. Mientras que antes las páginas web eran estáticas y servían como un sustituto algo más caro de los folletos impresos de las empresas (la teórica y diseñadora Rachel Hinman llamó de hecho a esas páginas brochureware), ahora las páginas web se convirtieron en un espacio dinámico donde el usuario no era solo un visitante, sino también coautor. Esta revolución social de la plataforma de la Web supuso también que la Web empezara por fin a aprovechar sus mayores virtudes: el hipertexto y los hipervínculos. O’Reilly señala en su artículo que:
«Los hipervínculos son el fundamento de la web. A medida que los usuarios añaden nuevo contenido y nuevos sitios, estos quedan ligados a la estructura [existente] de la web gracias a que otros usuarios descubren ese contenido y enlazan a él. Del mismo modo que en el cerebro se forman sinapsis y las asociaciones se hacen más fuertes por repetición o por intensidad, la red de conexiones de la web crece orgánicamente como resultado de la actividad colectiva de todos sus usuarios» (O’Reilly, 2005)
Entre los representantes prototípicos de la revolución social de la plataforma de la Web, O’Reilly incluye, además de Wikipedia y Ebay, el antaño popular proyecto de marcadores (bookmarks) del.icio.us y Flickr, todavía activo y hoy ya integrado en Yahoo. Ambos proyectos popularizaron el concepto de «etiquetado», es decir, permitían a los usuarios marcar las fotografías o los marcadores que añadían con palabras breves cuya elección quedaba por completo en manos de los usuarios, de su creatividad, formación o conocimientos. Esta clasificación de elementos definida por los usuarios recibió el nombre de folksonomy, surgido de la unión de las palabras folk (popular) y taxonomy.
Además de que las funcionalidades sociales de los proyectos web y las etiquetas externalizan hacia los usuarios la generación del contenido y su categorización, con lo que, entre otras cosas, democratizan la Web como tal, ofrecen también una visión extraordinaria del pensamiento de cada usuario, ya que al definir las etiquetas el usuario puede, ciertamente, verse influido por las convenciones del momento y por la popularidad de determinadas etiquetas, pero por lo demás, en los populares proyectos web actuales que permiten el (hash)tagging, nada le impide en teoría etiquetar a su antojo. En la práctica, sin embargo, el usuario elige al fin y al cabo cómo etiquetar sus fotos o mensajes de forma que aproveche lo mejor posible toda la esencia del etiquetado: comentar brevemente de qué trata el elemento, qué representa. Algunas etiquetas pueden volverse tan populares que crean una especie de relato continuo; esto puede verse a menudo en las redes sociales actuales como Twitter, que elabora dinámicamente una lista de las etiquetas más usadas en cada momento. Su popularidad corresponde a menudo a algún acontecimiento sociocultural importante, como la entrega de los premios Óscar, un escándalo político, un conflicto bélico o una catástrofe natural. Pero este uso de los (hash)tags describe ya la situación actual: Twitter no ofrecía (hash)tags nada más ponerse en marcha y, cuando los introdujo, suponía que se utilizarían de un modo algo distinto.
Twitter y el hashtag
Cuando Twitter se lanzó en 2006, no ofrecía «ningún mecanismo técnico ni social que permitiera responder a otro usuario, agrupar tuits o indicar que un tuit formaba parte de un tema más amplio». (Highfield, 2015) No fue hasta 2007 cuando Chris Messina, por entonces empleado de Google, propuso una idea completa de cómo Twitter podría usar el signo «#» para agrupar los mensajes de Twitter. Messina se inspiró en el protocolo y chat IRC (Internet Relay Chat), donde el símbolo de la almohadilla se usa para designar canales y temas, es decir, para la misma función que Messina quería introducir en Twitter. Una de las razones por las que el hashtag (hash + tag) arraigó rápidamente fue que exigía pocos cambios en la infraestructura existente de Twitter; además, el hashtag no requería de los usuarios conocimientos técnicos de programación ni de búsqueda. (Messina, 2007)
La introducción del hashtag servía así, en origen, para agrupar los mensajes de Twitter por un mismo tema. (Scott, 2015) Algunos académicos que estudian las redes sociales observaron, sin embargo, que ya entre 2009 y 2010 este uso purista de los hashtags se convirtió rápidamente en un «misil sin control» (went rogue). Otros sostienen que los hashtags dejaron de servir para organizar el contenido y se transformaron en un «tumor lingüístico». (Vosper, 2016)
Dicho de otro modo, el hashtag pasó de ser una herramienta utilitaria a una herramienta con la que los usuarios empezaron a expresar sus emociones, sin tener en cuenta si un hashtag tan personal y emocional contribuiría a la categorización del tuit o, en su caso, a hacerlo más visible y fácil de encontrar.
Lo que un análisis de hashtags en la red social Twitter debe, en mi opinión, presuponer de manera inherente es el hecho de que, tanto si un hashtag representa relaciones emocionales subjetivas como si, por el contrario, representa una categorización objetiva y deliberada de la publicación para facilitar la búsqueda, el hashtag elegido está necesariamente relacionado tanto con la publicación propiamente dicha como con las demás etiquetas de la misma publicación.
Si es así, no considero un problema los hashtags que representan emociones. Al contrario, el análisis de hashtags puede desvelar no solo temas relacionados entre sí (p. ej., cuando los temas se indican mediante hashtags usados dentro de una misma publicación), sino también qué actitud personal y qué emociones mantienen los usuarios ante un tema dado (p. ej., cuando un usuario usa en una publicación uno de los hashtags para representar el tema principal y uno o más hashtags para expresar una actitud personal y emocional hacia ese tema).
Si vuelvo al tema original de este texto — el análisis de las elecciones presidenciales estadounidenses —, mi plan es aprovechar las hipótesis mencionadas: si un tuit contiene varios hashtags, estos representarán, entre otras cosas, las relaciones entre los temas principales de la publicación propiamente dicha concreta y la relación entre los temas principales y las reacciones subjetivas y emocionales. Con un número suficiente de publicaciones, el análisis debería desvelar la estructura de una red de relaciones del tipo tema-tema y tema-reacción emocional.
Método
Para mi análisis elegí cuatro candidatos presidenciales, dos que se presentan por el Partido Demócrata y dos por los republicanos. Son Hillary Clinton, Bernie Sanders, Donald Trump y Ted Cruz. Para cada candidato elegí hashtags adecuados que están estrechamente vinculados con sus campañas presidenciales. Un análisis así no es exhaustivo, ya que para un mismo candidato existen varios hashtags populares, pero para un estudio piloto considero suficientes los hashtags elegidos.
Obtuve los datos de los hashtags elegidos mediante la aplicación web http://socioviz.net/, en la que se puede obtener una cuenta de usuario gratuita. Esta está limitada por la cantidad de resultados que la aplicación devuelve al usuario en cada consulta. Actualmente, a los usuarios con una cuenta gratuita limitada se les permite obtener hasta 100 tuits por consulta de un intervalo temporal muy limitado de un día. Este molesto límite puede sortearse en parte si el usuario descarga los datos por separado para cada día. Por desgracia, ni aun así es posible cambiar el intervalo temporal limitado, de modo que los tuits de un día dado procederán de un intervalo de un minuto entre las 18:58 y las 18:59. Para mi análisis elegí los datos del 1 de abril de 2016 al 6 de abril de 2016, ambos incluidos. En total trabajé así con 600 tuits para cada hashtag.
Hashtags elegidos
- Hillary Clinton: #iamwithher
- Bernie Sanders: #feelthebern
- Donald Trump: #donaldtrump
- Ted Cruz: #tedcruz
Configuración de Gephi
- Distribución: ForceAtlas 2
- Disuadir hubs
- Modo LinLog
- Evitar solapamiento
- Influencia del peso de las aristas 1,0
- Escalado 2,0
- Gravedad 0,2
- Filtro de rango de grado: 5 (para #tedcruz, 12)
- Modularity Class
Configuración de Gephi para la «nube de etiquetas»
- Distribución: Fruchterman Reingold
- Filtro de rango de grado: 12
- Mostrar aristas: No
Resultados
Para cada candidato exporté dos tipos de grafos: uno con la distribución ForceAtlas 2 y otro con Fruchterman Reingold, que parece más claro si podemos mostrar los hashtags como una «nube de etiquetas», sin destacar la distancia respecto al nodo central. Para la vista de «nube de etiquetas» desactivé las aristas y, además, aumenté el límite inferior del filtro del grado total del nodo. Recuerdo que en un grafo dirigido, donde las aristas tienen dirección, que es mi caso, el grado total k del nodo i se calcula como la suma de las aristas entrantes y salientes, lo que matemáticamente se expresa como:

Por último, para cada candidato incluyo una tabla de los hashtags más usados que los usuarios emplearon junto con el hashtag principal.
Hillary Clinton
Hashtag #iamwithher, forceatlas2, filtro de grado 5 (haz clic para verlo a resolución completa, 8192 x 4096)
Hashtag #iamwithher, nube de etiquetas, filtro de grado 12 (haz clic para verlo a resolución completa, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/iamwithher-Nodes-1.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #iamwithher, nube de etiquetas, filtro de grado 12, tabla de los hashtags que aparecen junto con el principal, ordenados por peso
Bernie Sanders
Hashtag #feelthebern, forceatlas2, filtro de grado 5 (haz clic para verlo a resolución completa, 8192 x 4096)
Hashtag #feelthebern, nube de etiquetas, filtro de grado 12 (haz clic para verlo a resolución completa, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/feelthebern-Nodes.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #feelthebern, nube de etiquetas, filtro de grado 12, tabla de los hashtags que aparecen junto con el principal, ordenados por peso
Donald Trump
Hashtag #donaldtrump, forceatlas2, filtro de grado 5 (haz clic para verlo a resolución completa, 8192 x 4096)
Hashtag #donaldtrump, nube de etiquetas, filtro de grado 12 (haz clic para verlo a resolución completa, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/donaldtrump-Nodes.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #donaldtrump, nube de etiquetas, filtro de grado 12, tabla de los hashtags que aparecen junto con el principal, ordenados por peso
Ted Cruz
Hashtag #tedcruz, forceatlas2, filtro de grado 5 (haz clic para verlo a resolución completa, 8192 x 4096)
Hashtag #tedcruz, nube de etiquetas, filtro de grado 12 (haz clic para verlo a resolución completa, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/tedcruz-Nodes.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #tedcruz, nube de etiquetas, filtro de grado 12, tabla de los hashtags que aparecen junto con el principal, ordenados por peso
Comentario sobre los datos
próximamente
Bibliografía
HIGHFIELD, Tim y Tama LEAVER. 2015. A methodology for mapping Instagram hashtags. First Monday. 20(1), -. DOI: 10.5210/fm.v20i1.5563. ISSN 13960466. Disponible también en: http://journals.uic.edu/ojs/index.php/fm/article/view/5563
MESSINA, Chris. 2007. Groups for Twitter: or a proposal for Twitter tag channels [en línea]. [consulta: 2016-04-07]. Disponible en: http://factoryjoe.com/2007/08/25/groups-for-twitter-or-a-proposal-for-twitter-tag-channels/
O’REILLY, Tim. 2005. What Is Web 2.0: Design Patterns and Business Models for the Next Generation of Software.O’Reilly.com [en línea]. [consulta: 2016-04-07]. Disponible en: http://www.oreilly.com/pub/a/web2/archive/what-is-web-20.html
SCOTT, Kate. 2015. The pragmatics of hashtags: Inference and conversational style on Twitter. Journal of Pragmatics. 81, 8-20. DOI: 10.1016/j.pragma.2015.03.015. ISSN 03782166. Disponible también en: http://linkinghub.elsevier.com/retrieve/pii/S037821661500096X
VOSPER, Yuwa. 2016. Hashtags: Not Just Used in Social Media [en línea]. Louisiana State University Baton Rouge, LA [consulta: 2016-04-07]. Disponible en: https://www.academia.edu/23491466/Hashtags_Not_Just_Used_in_Social_Media







