Introduction
Pour le cours Fondements des études des nouveaux médias, nous nous sommes cette fois concentrés sur les réseaux sociaux, où nous pouvions explorer et éclairer un thème de notre choix à l’aide de la visualisation de données. Comme outil pour l’analyse elle-même, nous avons choisi le programme de visualisation open source Gephi, construit sur la plateforme NetBeans de Java. Il en hérite plusieurs qualités, bonnes et mauvaises : la modularité, un grand ensemble de fonctions, une instabilité occasionnelle et, enfin et surtout, une GUI qui n’a pas été conçue comme native pour des OS spécifiques, ce qui peut signifier pour beaucoup d’utilisateurs une prise en main pas tout à fait intuitive. Les auteurs de Gephi se vantent en outre qu’il s’agit d’un logiciel qui est, dans sa catégorie, le Photoshop de la visualisation de données. Je laisse au lecteur le soin de juger si c’est, du point de vue marketing, un bon slogan.
Le thème était libre, et j’ai donc décidé de découvrir comment les gens réagissent, sur le réseau social Twitter, à des événements qui, et pas seulement de l’autre côté de l’Atlantique, occupent la majeure partie de leur temps libre : l’élection présidentielle aux États-Unis.
Une fois le thème choisi, je me suis trouvé face à une question bien plus difficile, qui devait décider si les heures de travail suivantes ne seraient qu’une manière vaine, ou au contraire utile, de jouer à l’analyste de données — la question de savoir ce que j’allais faire des données, de quelles données j’aurais seulement besoin, ce que j’allais chercher dans ces données, et s’il est théoriquement possible de l’en tirer. Autrement dit, savoir ce que l’on cherche exactement dans les données est, dans bien des cas, plus important que de savoir comment parvenir à quelque chose. En réalité, ces questions sont inséparables, car elles s’informent mutuellement.
Ainsi, par exemple, d’excellentes connaissances du domaine sont, selon les théories actuelles de la créativité, l’une des conditions pour que quelqu’un trouve quelque chose de nouveau, d’utile et de fonctionnel, qui sont d’ailleurs les propriétés que toute production créative doit remplir. Les connaissances du domaine sont bien sûr une condition nécessaire d’une performance éminente dans toute activité humaine. Et ce sont justement les connaissances du domaine qui font de l’analyse de données bien plus qu’une simple application de méthodes mathématiques rigoureuses à un ensemble de données ; l’analyse de données exige aussi ces connaissances que le monde académique considère comme soft : une conscience de la société, de la culture et du contexte du moment du domaine que l’on va étudier, autrement dit une sorte de conscience humaniste, de soft-science. Mon hypothèse, entièrement spéculative, pour expliquer pourquoi il y a si peu de bons analystes de données est justement l’exigence peu fréquente d’être à la fois un bon mathématicien et un humaniste, d’avoir une formation informatique et mathématique alliée à une dose de saine conscience de ce qui se passe dans la société derrière la fenêtre, puis des connaissances en sociologie, en anthropologie, voire en littérature ou en philosophie, et, Dieu nous en garde, en nouveaux médias. Il faut un poète et un joueur d’échecs, un scientifique et un artiste.
Bien, qu’ai-je fait de ce wicked problem, où il existe beaucoup de solutions possibles, où la réponse n’oscille pas entre un OUI-NON binaire, mais se situe plutôt sur une échelle continue de pertinence ? Quelle question ai-je décidé d’explorer ?
Twitter est une plateforme adaptée à l’analyse textuelle, surtout parce que les messages, du fait de leur limite de 140 caractères, sont homogènes, ce qui simplifie l’analyse. Outre le message lui-même, que je désignerai ici comme le message proprement dit, un message Twitter contient aussi du texte remplissant la fonction de description du message proprement dit ; il s’agit donc de métadonnées. On considère comme telles la combinaison du signe arobase @ + nom d’utilisateur, que le message proprement dit concerne d’une manière ou d’une autre, et bien sûr aussi le signe # + un texte quelconque, c’est-à-dire la combinaison qu’on appelle aujourd’hui couramment hashtag.
Comme les hashtags sont bien souvent utilisés non comme une chaîne de caractères totalement non pertinente et sans rapport, mais comme des métadonnées qui complètent le message proprement dit par des informations contextuelles utiles, aidant les lecteurs à comprendre le message Twitter, j’ai décidé d’utiliser précisément les hashtags pour parvenir à une vue de la manière dont les gens réagissent, écrivent et donc pensent au sujet des campagnes présidentielles des candidats que j’ai choisis. Mais comment exactement les hashtags devraient-ils y être utiles, et que signifie au juste un hashtag ?
Le Web social 2.0, la folksonomie et les hashtags
D’un point de vue étymologique et linguistique, le mot hashtag est né de la combinaison des mots « hash » et « tag ». Tandis que le mot hash renvoie sans complication au signe dièse ou croisillon #, la seconde moitié de ce composé, le mot tag, est bien plus intéressante, surtout parce que les tags ont représenté un aspect important de la transformation du Web en plateforme sociale, que l’on a commencé à appeler globalement Web 2.0. Un terme autrefois si souvent employé que beaucoup le condamnaient comme un simple buzzword marketing ; il s’agissait pourtant, et il s’agit toujours, d’une désignation utile du Web à l’époque où de nouvelles technologies et de nouvelles approches de la création de sites et d’applications web ont donné naissance à des tendances et des projets qui différaient sensiblement de ce que, après l’introduction de la version 2.0, nous appelons le Web 1.0. Le résumé de tous les changements importants a été décrit par l’influent article What is Web 2.0 de Tim O’Reilly ; je me limiterai donc ici à ce qui concerne directement les tags, ou plutôt les hashtags : la folksonomie et ce qu’O’Reilly a appelé « mettre à profit l’intelligence collective ».
Bien que cela puisse paraître inimaginable aujourd’hui, la plateforme du Web n’a pas toujours été aussi interactive, réactive et ouverte aux utilisateurs. C’est pourtant compréhensible, car la créativité des créateurs de sites web est toujours allée de pair avec ce que permettait la technologie. Ainsi, par exemple, un web designer ne pouvait pas, en concevant ses pages web, envisager que son site contiendrait beaucoup de matériel photographique, jusqu’à ce qu’arrive sur le marché en 1993 le navigateur Mosaic, le premier à permettre que les éléments graphiques (par ex. les photographies, les éléments graphiques de l’interface utilisateur) ne s’affichent pas dans une nouvelle fenêtre, mais directement à l’intérieur du contenu de la page web. On peut ainsi considérer Mosaic comme le navigateur web qui a permis pour la toute première fois au Web de se rapprocher du design graphique, ce qui a en même temps fait naître une demande de web designers, d’architectes de l’information, c’est-à-dire de professionnels capables de mettre en forme ces nouvelles et extraordinaires possibilités graphiques de façon que la page web permette d’offrir aux visiteurs, rapidement et convenablement, des informations comme des expériences.
Avec l’arrivée des langages de script côté client comme Javascript, des navigateurs, de l’usage de langages de programmation et de bases de données plus adaptés, et surtout du soutien des fonctionnalités par les éditeurs de navigateurs web, sont apparus des projets web qui permettaient non seulement des interactions plus riches, mais aussi la participation de leurs utilisateurs à la création du contenu web. Alors qu’auparavant les sites web étaient statiques et servaient de substitut un peu plus coûteux aux brochures d’entreprise imprimées (la théoricienne et designer Rachel Hinman a effectivement appelé de tels sites brochureware), les sites web sont désormais devenus un espace dynamique où l’utilisateur n’était plus seulement un visiteur, mais aussi un coauteur. Cette révolution sociale de la plateforme du Web a également signifié que le Web a enfin commencé à exploiter ses plus grands atouts : l’hypertexte et les hyperliens. O’Reilly remarque dans son article que :
« Les hyperliens sont le fondement du web. Lorsque les utilisateurs ajoutent du nouveau contenu et de nouvelles pages, ceux-ci se trouvent liés à la structure [antérieure] du web par le fait que d’autres utilisateurs découvrent ce contenu et y renvoient. De même que des synapses se forment dans le cerveau et que les connexions se renforcent par la répétition ou l’intensité, les connexions du web croissent organiquement comme le résultat de l’activité collective de tous les utilisateurs du web » (O’Reilly, 2005)
Parmi les représentants prototypiques de la révolution sociale de la plateforme du Web, O’Reilly range, outre Wikipédia et Ebay, le projet de création de signets (bookmarks) autrefois populaire del.icio.us et Flickr, toujours actif et appartenant aujourd’hui à Yahoo. Les deux projets ont popularisé le concept de « tagging », c’est-à-dire qu’ils permettaient aux utilisateurs de marquer les photographies ou les signets ajoutés par des mots courts, dont le choix était entièrement entre les mains des utilisateurs, de leur créativité, de leur formation ou de leurs connaissances. Cette classification des éléments définie par les utilisateurs s’est vu attribuer le nom de folksonomy, né de l’union des mots folk (populaire) et taxonomy.
Outre le fait que les fonctionnalités sociales des projets web et les tags externalisent vers les utilisateurs la génération du contenu et sa catégorisation, démocratisant ainsi entre autres le Web en tant que tel, ils offrent aussi une vue exceptionnelle sur la pensée des différents utilisateurs, car, lorsqu’il définit des tags, l’utilisateur peut certes être influencé par les conventions du moment et par la popularité de certains tags, mais à part cela rien ne l’empêche théoriquement, sur les projets web populaires actuels permettant le (hash)tagging, de taguer à sa guise. Sur le plan pratique, l’utilisateur choisit tout de même de taguer ses photos ou ses messages de façon à exploiter au mieux toute l’essence du tagging : commenter brièvement ce dont traite l’élément, ce qu’il représente. Certains tags peuvent devenir si populaires qu’ils forment une sorte de récit cohérent ; on peut souvent le voir sur les réseaux sociaux actuels comme Twitter, qui crée dynamiquement la liste des tags les plus utilisés du moment. Leur popularité correspond souvent à un événement socioculturel important, par exemple la remise des Oscars, un scandale politique, un conflit armé ou une catastrophe naturelle. Un tel usage des (hash)tags décrit cependant déjà la situation tout à fait actuelle : Twitter n’a pas proposé les (hash)tags dès son lancement, et après leur introduction, il supposait qu’ils seraient utilisés un peu autrement.
Twitter et le hashtag
Lorsque Twitter a été lancé en 2006, il n’offrait « aucun mécanisme technique ni social permettant de répondre à un autre utilisateur, de regrouper des tweets ou d’indiquer qu’un tweet fait partie d’un sujet plus large. » (Highfield, 2015) Ce n’est qu’en 2007 que Chris Messina, alors employé de Google, a proposé une idée cohérente de la manière dont Twitter pourrait utiliser le signe « # » pour regrouper les messages Twitter. Messina s’est inspiré du protocole et du chat IRC (Internet Relay Chat), où le symbole dièse sert à désigner les canaux et les sujets, c’est-à-dire pour la même fonction que celle que Messina voulait introduire sur le réseau Twitter. L’une des raisons pour lesquelles le hashtag (hash + tag) s’est rapidement imposé était le peu de changements qu’il exigeait dans l’infrastructure existante de Twitter ; le hashtag n’exigeait pas non plus des utilisateurs des connaissances techniques en codage et en recherche. (Messina, 2007)
L’introduction du hashtag servait donc à l’origine à regrouper les messages Twitter par sujet commun. (Scott, 2015) Certains universitaires étudiant les réseaux sociaux ont cependant remarqué que dès les années 2009 et 2010, cet usage puriste des hashtags s’est rapidement transformé en « missile incontrôlé » (went rogue). D’autres affirment que les hashtags ont cessé de servir à l’organisation du contenu et se sont mués en une « tumeur linguistique ». (Vosper, 2016)
Autrement dit, le hashtag s’est transformé d’outil utilitaire en un outil par lequel les utilisateurs ont commencé à exprimer leurs émotions, sans se soucier de savoir si un tel hashtag personnel et émotionnel contribuerait à la catégorisation du message Twitter, ou bien à sa meilleure visibilité et à sa recherche.
Ce que l’analyse des hashtags sur le réseau social Twitter doit selon moi présupposer de manière inhérente, c’est le fait que, que le hashtag représente des relations émotionnelles subjectives ou, au contraire, une catégorisation objective et ciblée du message en vue d’une recherche plus facile, le hashtag choisi est nécessairement lié d’une part au message proprement dit, d’autre part aux autres tags du même message.
S’il en est ainsi, je ne considère pas les hashtags représentant des émotions comme un problème. Au contraire, l’analyse des hashtags peut révéler non seulement des sujets liés entre eux (par ex. lorsque les sujets sont indiqués par des hashtags utilisés dans un même message), mais aussi quelle attitude personnelle et quelles émotions les utilisateurs ont à l’égard d’un sujet donné (par ex. lorsqu’un utilisateur, dans un message, utilise l’un des hashtags comme représentant du sujet principal et un ou plusieurs hashtags pour exprimer une attitude personnelle et émotionnelle à l’égard de ce sujet).
Si je reviens au sujet initial de ce texte — l’analyse de l’élection présidentielle américaine —, j’ai l’intention d’utiliser les hypothèses mentionnées ci-dessus : si un message Twitter contient plusieurs hashtags, ces hashtags représenteront entre autres les relations entre les sujets principaux d’un message proprement dit concret et la relation entre les sujets principaux et les réactions subjectives et émotionnelles. Avec un nombre suffisant de messages, l’analyse devrait révéler la structure d’un réseau de relations de type sujet-sujet et sujet-réaction émotionnelle.
Méthode
Pour mon analyse, j’ai choisi quatre candidats à la présidence, deux candidats du Parti démocrate et deux candidats républicains. Ce sont Hillary Clinton, Bernie Sanders, Donald Trump et Ted Cruz. Pour chacun des candidats, j’ai choisi des hashtags adaptés, étroitement liés à leurs campagnes présidentielles. Une telle analyse n’est pas exhaustive, il existe pour un même candidat plusieurs hashtags populaires ; pour une recherche pilote, je considère les hashtags choisis comme suffisants.
J’ai obtenu les données pour les hashtags choisis à l’aide de l’application web http://socioviz.net/, pour laquelle on peut obtenir gratuitement un compte utilisateur. Celui-ci est limité par le nombre de résultats que l’application renvoie à l’utilisateur pour une seule requête. À l’heure actuelle, un utilisateur disposant d’un compte gratuit limité peut obtenir, par requête, jusqu’à 100 messages Twitter sur un intervalle de temps très limité d’une journée. Cette limite désagréable peut être en partie contournée si l’utilisateur télécharge les données séparément pour chaque jour. Malheureusement, même ainsi, il n’est pas possible de modifier l’intervalle de temps limité, de sorte que les messages Twitter d’un jour donné proviendront de l’intervalle d’une minute entre 18 h 58 et 18 h 59. Pour mon analyse, j’ai choisi les données entre le 1/4/2016 et le 6/4/2016 inclus. Au total, j’ai ainsi travaillé, pour chaque hashtag, avec 600 messages Twitter.
Hashtags choisis
- Hillary Clinton : #iamwithher
- Bernie Sanders : #feelthebern
- Donald Trump : #donaldtrump
- Ted Cruz : #tedcruz
Paramètres de Gephi
- Spatialisation : ForceAtlas 2
- Dissuader les hubs
- Mode LinLog
- Empêcher le recouvrement
- Influence du poids des arêtes 1,0
- Mise à l’échelle 2,0
- Gravité 0,2
- Filtre de plage de degré : 5 (pour #tedcruz, 12)
- Modularity Class
Paramètres de Gephi pour le « nuage de tags »
- Spatialisation : Fruchterman Reingold
- Filtre de plage de degré : 12
- Afficher les arêtes : Non
Résultats
Pour chaque candidat, j’ai exporté deux types de graphes : un graphe avec la spatialisation ForceAtlas 2 et un second avec Fruchterman Reingold, qui semble plus lisible si nous pouvons afficher les hashtags comme un « nuage de tags », sans mise en évidence de la distance par rapport au nœud central. Pour l’affichage en « nuage de tags », j’ai désactivé les arêtes et augmenté en outre la limite inférieure du filtre du degré total du nœud. Je rappelle que dans un graphe orienté (directed), où les arêtes ont une direction, ce qui est mon cas, le degré total k du nœud i se calcule comme la somme des arêtes entrantes et sortantes, ce qui s’exprime mathématiquement ainsi :

Pour chaque candidat, je donne enfin un tableau des hashtags les plus utilisés, que les utilisateurs ont employés avec le hashtag principal.
Hillary Clinton
Hashtag #iamwithher, forceatlas2, filtre de degré 5 (cliquez pour voir en pleine résolution, 8192 x 4096)
Hashtag #iamwithher, nuage de tags, filtre de degré 12 (cliquez pour voir en pleine résolution, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/iamwithher-Nodes-1.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #iamwithher, nuage de tags, filtre de degré 12, tableau des hashtags apparaissant avec le hashtag principal, classés par poids
Bernie Sanders
Hashtag #feelthebern, forceatlas2, filtre de degré 5 (cliquez pour voir en pleine résolution, 8192 x 4096)
Hashtag #feelthebern, nuage de tags, filtre de degré 12 (cliquez pour voir en pleine résolution, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/feelthebern-Nodes.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #feelthebern, nuage de tags, filtre de degré 12, tableau des hashtags apparaissant avec le hashtag principal, classés par poids
Donald Trump
Hashtag #donaldtrump, forceatlas2, filtre de degré 5 (cliquez pour voir en pleine résolution, 8192 x 4096)
Hashtag #donaldtrump, nuage de tags, filtre de degré 12 (cliquez pour voir en pleine résolution, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/donaldtrump-Nodes.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #donaldtrump, nuage de tags, filtre de degré 12, tableau des hashtags apparaissant avec le hashtag principal, classés par poids
Ted Cruz
Hashtag #tedcruz, forceatlas2, filtre de degré 5 (cliquez pour voir en pleine résolution, 8192 x 4096)
Hashtag #tedcruz, nuage de tags, filtre de degré 12 (cliquez pour voir en pleine résolution, 8192 x 4096)
[embeddoc url=“http://www.jakubferenc.cz/wordpress/wp-content/uploads/2016/04/tedcruz-Nodes.xlsx“ download=“all“ viewer=“microsoft“]
Hashtag #tedcruz, nuage de tags, filtre de degré 12, tableau des hashtags apparaissant avec le hashtag principal, classés par poids
Commentaire des données
prochainement
Bibliographie
HIGHFIELD, Tim et Tama LEAVER. 2015. A methodology for mapping Instagram hashtags. First Monday. 20(1), -. DOI: 10.5210/fm.v20i1.5563. ISSN 13960466. Disponible aussi sur : http://journals.uic.edu/ojs/index.php/fm/article/view/5563
MESSINA, Chris. 2007. Groups for Twitter: or a proposal for Twitter tag channels [en ligne]. [consulté le 2016-04-07]. Disponible sur : http://factoryjoe.com/2007/08/25/groups-for-twitter-or-a-proposal-for-twitter-tag-channels/
O’REILLY, Tim. 2005. What Is Web 2.0: Design Patterns and Business Models for the Next Generation of Software.O’Reilly.com [en ligne]. [consulté le 2016-04-07]. Disponible sur : http://www.oreilly.com/pub/a/web2/archive/what-is-web-20.html
SCOTT, Kate. 2015. The pragmatics of hashtags: Inference and conversational style on Twitter. Journal of Pragmatics. 81, 8-20. DOI: 10.1016/j.pragma.2015.03.015. ISSN 03782166. Disponible aussi sur : http://linkinghub.elsevier.com/retrieve/pii/S037821661500096X
VOSPER, Yuwa. 2016. Hashtags: Not Just Used in Social Media [en ligne]. Louisiana State University Baton Rouge, LA [consulté le 2016-04-07]. Disponible sur : https://www.academia.edu/23491466/Hashtags_Not_Just_Used_in_Social_Media







