Posons-nous une consigne : de la manière qui vous convient le mieux, notez les publications Facebook des pages que vous suivez et dont le contenu rappelle, ne serait-ce que de loin, une réaction ou une critique de l’actualité politique (autrement dit, pas de chatons ni d’analyses sophistiquées de matchs sportifs). Pourquoi cela ?
Eh bien, premièrement, vous serez sans doute surpris de constater que la sélection de ce que vous avez « aimé » au cours de l’année écoulée n’est pas aussi variée que vous le pensiez ; oui, vous facilitez ainsi la tâche à divers outils marketing qui, à l’aide d’algorithmes intelligents, se font une idée assez claire de votre personnalité. Que le machine learning et le
Big Data
soient déjà le présent du futur et un gros business n’a rien d’une nouveauté ; certaines banques commencent même à passer ainsi en revue vos données sociales pour affiner leurs algorithmes de calcul du risque, afin de savoir s’il faut vous accorder ou non ce prêt pour une Škoda neuve. Lev Manovich, superstar des milieux académiques des nouveaux médias, a quant à lui signalé sur son Twitter qu’une entreprise technologique spécialisée dans le Big Data est capable, d’après les lieux visités, d’identifier les habitudes de consommation de chaque utilisateur et de les ranger dans des cases préétablies de types de consommateurs. Pour les lecteurs familiers de la terminologie surchargée du domaine quelque peu amorphe de l’User Experience Design, il s’agit en fait de la création automatisée de
personas
, par laquelle ils remplissent même l’une des conditions fondamentales telles que les a définies le designer d’interaction Alan Cooper : que les personas soient fondés sur des données réelles d’utilisateurs réels. Sur mon Facebook, l’automate tomberait sur des bizarreries telles que le fait que je suis de sang-froid aussi bien Ádvojka et Deník Referendum que, par exemple, Parlamentní listy, voire Pravý prostor.
Pour des raisons techniques, j’ai cependant laissé de côté les médias tchèques, car je ne disposais pour l’analyse linguistique que d’un corpus (étendu) de la langue anglaise. Après avoir feuilleté des pages FB, j’ai retenu ces sources d’information plus ou moins extravagantes :
- BBC News
- Bloomberg Business
- CNN Politics
- Counter Current News
- Democracy Now
- Deutsche Welle
- Haaretz (journal israélien)
- Mondoweiss
- The New York Times Opinion
- PRESS TV (source iranienne en langue anglaise)
- Reuters
- Salon
- The Economist
- The Guardian
- The Intercept
- The New Republic
- The Washington Times
- Truthdig
- Wall Street Journal
Grâce à la Graph API de Facebook, j’ai pu télécharger plus de 1000 publications que les sites d’information que je suis avaient partagées sur leur mur en l’espace d’une semaine. Je voulais savoir quels mots-clés apparaissaient le plus souvent dans ces nouvelles à un jour et à une heure donnés. Pour l’analyse linguistique de toutes ces publications, je me suis servi de Python et de la bibliothèque TextBlob. Pour chaque publication, j’ai parcouru le titre et le chapeau et relevé tous les syntagmes nominaux (noun phrases), dont j’ai fait les mots-clés de la publication en question.
Données sources en JSON après l’analyse des syntagmes nominaux de chaque publication :
source_data_json.7z
J’ai ensuite travaillé avec le fichier JSON obtenu en JavaScript, où j’ai analysé les données et les ai visualisées de manière appropriée. Je me suis dit que, pour analyser l’apparition des mots-clés sur une période donnée, une sorte de curseur ferait bien l’affaire, d’après lequel j’afficherais les données de la visualisation.
Alors qu’au cours de la semaine les mots-clés se répartissaient uniformément entre de nombreux thèmes, dès le début de la nuit de vendredi, la réaction aux attentats terroristes de Paris commence à dominer de manière très nette.
Vous pouvez juger vous-mêmes du résultat embryonnaire :