Les outils d’intelligence artificielle ont été introduits dans cet environnement à un moment où le besoin était réel. Le risque est qu'ils se présentent comme la solution à un problème qui n'est pas le leur : que les organisations les adoptent dans l'espoir d'automatiser la tâche éditoriale fondamentale qu'est la vérification, et qu'elles soient ensuite déçues. Cet article plaide en faveur d'une relation différente : L'IA comme infrastructure d'analyse, et non comme substitut au jugement. Grâce au travail novateur du site espagnol de vérification des faits Maldita.es, nous montrerons que, plutôt que de nous dire ce qui est vrai, ces outils nous aident à voir ce qui se passe à une échelle et à une vitesse qui, sans eux, resteraient invisibles.
Un problème qui a dépassé les capacités humaines
L’intégrité de l’information a une définition précise : Il s’agit du degré selon lequel une information est exacte, traçable et présentée dans son contexte approprié. Toutes ces propriétés subissent une pression systématique de la part de l’environnement numérique, et les mécanismes en jeu sont désormais suffisamment connus pour être nommés explicitement.
Le premier mécanisme est le classement des plateformes, qui privilégie la résonance émotionnelle et le potentiel de partage. Cela peut même l'emporter sur des indicateurs plus objectifs, des critères plus objectifs, tels que la récence temporelle ou l’appartenance au réseau personnel de l’utilisateur. Il en résulte un biais structurel dans ce qui génère le plus de vues : ce ne sont pas les contenus les plus fiables, mais ceux qui suscitent le plus d'intérêt.
Le deuxième mécanisme réside dans la facilité avec laquelle un contenu peut être dissocié de sa source d'origine, de sa date ou de son contexte, ce qui rend de plus en plus difficile l'attribution de la source. Une vidéo tournée dans un pays est présentée comme provenant d'un autre ; une déclaration faite il y a des années est relayée comme s'il s'agissait d'une actualité du jour. Le problème ne réside pas dans l'erreur humaine ou la mauvaise foi dans des cas particuliers, mais dans un format qui dissocie systématiquement le contenu des métadonnées nécessaires à son évaluation.
Le troisième mécanisme de pression est l'échelle. Les outils génératifs et les infrastructures de diffusion coordonnées ont permis de réduire considérablement le coût de production et de diffusion de grands volumes de contenu. Ce qui nécessitait autrefois des ressources financières et organisationnelles importantes (par exemple une opération d’information coordonnée ou un réseau de comptes synthétiques diffusant progressivement un récit) peut désormais être tenté à faible coût et selon une approche par essai et erreur, ce qui rend la détection plus difficile. Tout comme les réseaux sociaux ont réduit le coût du partage et de la diffusion de contenus, l'IA générative permet désormais de créer à moindre coût des contenus personnalisés et de grande qualité, quel que soit le format médiatique. La surabondance informationnelle est plus facile que jamais, et les acteurs malveillants misent davantage sur le volume que sur la précision.
Pour les organismes de surveillance, cela signifie que le rythme de production de contenu a dépassé la capacité des équipes humaines à le suivre en temps réel. Une équipe d'analystes, aussi compétente soit-elle, ne peut pas traiter des milliers de publications par heure, détecter les tendances émergentes sur l'ensemble des plateformes ni assurer une surveillance continue d'un paysage informationnel en constante évolution.
Ce n'est pas un problème de ressources que l'on pourrait résoudre en embauchant davantage. Il s'agit d'un déséquilibre structurel qui nécessite des outils structurels.
L'ampleur du défi est apparue de manière évidente lors des inondations de 2024 en Espagne, qui ont fait 238 victimes. Le niveau de désinformation observé au lendemain de ces événements est pratiquement sans précédent ; il résulte à la fois de malentendus involontaires, d’intérêts partisans et de campagnes coordonnées. Pendant cet épisode, Maldita.es a reçu quatre fois plus de demandes de vérification que d'habitude : 13 000 en 7 jours. Grâce à notre outil de veille basé sur l'IA, nous avons pu regrouper ces messages en récits sous-jacents (par exemple : les inondations seraient le résultat d’un plan des élites, les autorités auraient dissimulé le nombre réel de victimes, etc.). Cela nous a permis de cerner le contexte informationnel et de l'étayer par des données empiriques, une étape cruciale avant la rédaction de rapports d'orientation sur la réglementation des plateformes, comme celui-ci.
Ce que les outils d'IA peuvent et ne peuvent pas faire
L'idée fausse la plus tenace et la plus néfaste concernant les outils d'IA dans ce domaine est qu'ils seraient capables de déterminer si une affirmation est vraie. Ils ne le peuvent pas. Ni de manière fiable, ni à grande échelle, ni d'une façon susceptible de se substituer au jugement éditorial. Du moins, pas encore. Une mauvaise définition de cette limite conduit à une conception inadéquate des outils, à une confiance mal placée et, en fin de compte, à des résultats qui sapent la crédibilité au lieu de la renforcer.
Il existe une distinction fondamentale qui a tendance à être confondue dans le débat public : la différence entre la détection de contenus synthétiques ou non authentiques et celle de contenus inexacts. Il s'agit de problèmes techniques différents qui nécessitent des solutions différentes.
Détecter une image générée de manière synthétique ou un réseau de comptes factices coordonnés restent, fondamentalement, un problème de reconnaissance de motifs qui peut être abordé à l’aide d’outils d’apprentissage automatique conçus à cet effet, tels que le filigranage, l’empreinte numérique et l’analyse comportementale.
Identifier une affirmation factuelle est un problème épistémique : cela nécessite d'avoir accès à des preuves, d'être capable d'évaluer les sources et de faire preuve de discernement pour déterminer ce qui est fiable. Les grands modèles de langage (LLM) ne sont pas conçus pour cela, et leur tendance à inventer des histoires avec aisance les rend particulièrement dangereux lorsqu’ils sont utilisés comme outils de vérification des faits.
C'est dans les tâches qui ne nécessitent pas de connaissances externes que les grands modèles de langage (LLM) et les outils d'IA associés apportent une réelle valeur ajoutée — des tâches qui relèvent fondamentalement de la transformation plutôt que de la vérification, telles que la classification en ensembles de sujets, l’étiquetage du langage, le regroupement ou la synthèse : il s’agit d’opérations qui organisent et reformulent l’information existante plutôt que d’en évaluer la véracité. Par exemple, Maldita.es participe au projet européen « Prebunking At Scale » en utilisant des grands modèles de langage (LLM) pour traiter des milliers d'allégations contenues dans des vidéos courtes provenant de TikTok, YouTube et Instagram. Celles-ci sont réparties en cinq catégories : santé, conflits, Union européenne, migrations et climat. Un outil d'IA qui traite un flux de dix mille publications issues des réseaux sociaux et les classe accomplit une tâche véritablement utile : il transforme le « bruit » en un ensemble de données structuré que les analystes peuvent exploiter. Il ne vérifie rien. Il facilite la vérification.
La conséquence concrète est claire : Dans ce domaine, les outils d'IA révèlent tout leur potentiel en tant qu'assistants analytiques (et non en tant que décideurs) capables de transformer et d'organiser les données. Tout ce qui va au-delà doit être considéré avec prudence, que ce soit dans le cadre d'un argumentaire de vente ou d'un processus de travail en rédaction.
Élaboration d'un pipeline de surveillance : Données, mémoire et bruit
Le défi pratique que pose la surveillance assistée par l'IA est d'ordre architectural avant d'être d'ordre analytique. Avant qu'un outil puisse mettre en évidence des tendances ou des récits collectifs, il a besoin d'un flux de données fiable, d'une structure permettant de stocker et de relier les informations qu'il recueille, ainsi que d'une stratégie pour gérer le bruit inhérent à tout système automatisé à grande échelle.
1) Les sources de données impliquent des compromis importants qui influencent tout ce qui se passe en aval. Les API des plateformes fournissent de grands volumes de contenu, mais cela a un coût : le rapport signal/bruit est faible, car tout le contenu n'est pas pertinent ; de plus, les contenus les plus sensibles sont souvent filtrés par les plateformes avant d'atteindre les chercheurs, et les conditions d'accès évoluent de manière imprévisible. Par ailleurs, si les API officielles sont généralement coûteuses, le crowdsourcing par les utilisateurs (lignes d'alerte, outils de signalement, canaux WhatsApp) permet d'obtenir des informations de meilleure qualité et mieux ancrées dans leur contexte, mais la couverture reste limitée et dépend de l'engagement de la communauté. La sélection par des experts fournit les données les plus fiables et les plus riches en contexte, mais elle mobilise d'importantes ressources et ne peut pas s'adapter pour couvrir de vastes environnements d'information en temps réel. Voici un exemple de base de données d'allégations provenant d'experts, développée par Maldita.es : Iberifier. Dans une perspective ibéro-américaine, cette infrastructure numérique permet aux organismes de vérification des faits de différents pays de partager et de mettre en relation leurs conclusions. La plupart des systèmes de surveillance combinent ces trois éléments, et c'est la répartition choisie entre eux qui détermine les points forts et les limites de l'outil.
2) Le stockage et la mémoire sont des éléments souvent sous-estimés d'une surveillance efficace. Une base de données qui conserve les contenus déjà analysés ne se contente pas de les archiver : elle permet une analyse cumulative. Lorsqu’une nouvelle affirmation apparaît, elle peut être mise en correspondance avec des enregistrements existants — non seulement pour éviter de dupliquer le travail, mais aussi pour mesurer sa récurrence, suivre sa viralité dans le temps et construire une vision longitudinale de l’évolution d’un récit particulier. Cette idée est au cœur de la ligne d’alerte de WhatsApp qui structure le suivi de l’information par Maldita. Les métadonnées associées à chaque élément (par exemple, la plateforme d'origine, la date, les comptes liés, les apparitions antérieures) constituent la matière première de l'enquête. Sans cette mémoire institutionnelle, le suivi est ponctuel plutôt que structurel : on peut voir ce qui est tendance aujourd’hui, mais pas comment cela s’inscrit dans la continuité de ce qui était tendance il y a six mois.
3) Il est important de noter qu’aucun pipeline de surveillance ne permet d’éliminer le bruit. Il s'agit d'une caractéristique structurelle, et non d'un bug pouvant être corrigé, notamment lorsque la source de données provient des API de la plateforme ou lorsque certains étiquetages sont automatisés. Les mesures d'atténuation disponibles sont partielles mais efficaces : des flux de travail impliquant une intervention humaine qui soumettent les contenus signalés à un examen éditorial avant qu'ils n'influencent les résultats, ou encore des bases de connaissances externes (telles que Wikidata) qui aident le système à distinguer les homonymes, à résoudre les références ambiguës et à éviter de confondre des acteurs ou des événements distincts. L'objectif n'est pas d'obtenir un système exempt de bruit, mais un système dont le bruit est suffisamment bien maîtrisé pour que le signal reste exploitable.
Des affirmations isolées aux récits sous-jacents
Les affirmations fausses ou trompeuses prises individuellement ne sont que des symptômes. La maladie sous-jacente, c’est le récit — le cadre idéologique plus large dans lequel ces affirmations prennent tout leur sens, et qui confère à la désinformation sa pérennité et son pouvoir de persuasion.
Au début, Maldita.es a repéré des affirmations isolées faisant écho à un article sur l’augmentation de la superficie de la banquise antarctique entre 2009 et 2019. Mais les menaces qui pèsent sur l'intégrité de l'information se manifestent rarement sous la forme d'éléments isolés. Le plus souvent, elles s'appuient sur une série d'affirmations apparemment factuelles qui, ensemble, constituent une vision du monde : une conception particulière de la responsabilité d'un problème, des bénéficiaires d'une politique donnée ou de la véritable signification de certains événements historiques. Plus tard dans l'année, notre rédaction a constaté l'apparition de publications affirmant que Al Gore s'était trompé en prédisant la fonte de la calotte glaciaire d'ici 2014. Chaque affirmation prise individuellement dans une telle chaîne peut être contestable, exagérée ou simplement hors contexte, mais l'effet cumulatif sur les convictions du lecteur peut être considérable. Un système de surveillance qui se contente de traiter chaque affirmation individuellement et de manière isolée (en repérant les déclarations fausses au fur et à mesure qu'elles apparaissent) passe à côté de cette structure plus profonde. C'est comme soigner les symptômes sans s'attaquer à la cause du problème.
La combinaison de bases de données de contenu et de grands modèles de langage permet d'aborder la question au niveau des récits plutôt qu'au niveau des affirmations isolées. La capacité principale réside dans le regroupement : à partir d'un vaste ensemble d'affirmations portant sur un sujet donné, un grand modèle de langage (LLM) est capable d'identifier celles qui font appel au même cadre sous-jacent, même lorsque la formulation, les acteurs ou les contextes spécifiques diffèrent. Cela permet de surmonter une limite fondamentale de l'analyse humaine : aucune équipe d'analystes n'est capable de garder simultanément dans sa mémoire de travail des milliers d'affirmations, d'en suivre les liens et d'identifier le schéma qui les relie entre elles à travers le temps et l'espace. Le regroupement informatique et l'étiquetage assisté par l'IA repoussent les limites de ce qui est possible sur le plan cognitif. Cette technologie nous a permis de repérer et de démanteler un récit qui remettait en cause la crise climatique actuelle en s'appuyant sur des affirmations concernant la taille des calottes glaciaires.
L'identification des récits récurrents permet également de détecter des tendances dont l'intérêt pour l'enquête dépasse le cadre d'un simple article : lorsque le même angle de présentation apparaît dans plusieurs régions géographiques en peu de temps, cela constitue souvent un indice qui mérite d'être approfondi. Les récits ne se propagent pas au hasard : ils sont souvent lancés par des acteurs qui ont intérêt à promouvoir un certain point de vue. Lorsqu'elle est détectée de manière systématique plutôt que de façon ponctuelle, la récurrence transnationale devient un fil conducteur à suivre. Pour suivre ce genre de fils de discussion, Maldita.es gère une base de données d’affirmations financée par National Endowment for Democracy , dans laquelle des organisations d'Amérique latine et d'Europe de l'Est anticipent et suivent les opérations d'information russes.
Passer de la surveillance à l'action
Une analyse qui se limite à une base de données ne change rien. Le dernier défi de conception, et sans doute le plus important, dans la surveillance assistée par l’IA consiste à relier le pipeline analytique à des résultats réellement exploitables par les organisations, ce qui implique de réfléchir attentivement à la nature de ces organisations et à leurs besoins.
Les besoins varient d'un utilisateur final à l'autre. Les chercheurs souhaitent souvent disposer de données brutes exportables, généralement sous forme de fichiers CSV comportant des métadonnées complètes, filtrables par date, plateforme et thème, qu’ils peuvent intégrer dans leurs propres flux de travail analytiques. Les rédactions recherchent généralement des outils plus visuels et plus faciles à utiliser, par exemple des tableaux de bord mettant en évidence les tendances émergentes, des alertes configurables signalant les pics d'activité sur des sujets particuliers, ou encore des interfaces permettant aux journalistes d'explorer les données sans avoir à rédiger de requêtes. Les organisations de la société civile actives dans le domaine de la communication publique peuvent avoir besoin d'une approche encore différente. Un outil de suivi conçu sans tenir compte de ses utilisateurs ne sera pas utilisé, quelle que soit la qualité de l'analyse sur laquelle il repose.
Les outils conçus autour de jeux de données en temps réel et en constante évolution nécessitent également une maintenance continue, ce qui n'est pas le cas des projets d'analyse ponctuels. Contrairement à une enquête sur une fuite de documents, qui porte sur un ensemble de données fixe et dont la fin est clairement définie, un système de surveillance fonctionne sur un flux qui ne s'arrête jamais. Les définitions des thèmes doivent être réajustées à mesure que l'environnement de l'information évolue. Les pipelines de traitement par IA doivent être surveillés afin de détecter les dérives et ajustés à mesure que les usages et les patterns linguistiques évoluent. Il est nécessaire de gérer la consommation des ressources, car une analyse continue à grande échelle assistée par l'IA a un coût réel. Il ne s’agit pas de problèmes à résoudre au moment du lancement, mais de responsabilités opérationnelles continues.
La valeur la plus durable d'un système de surveillance bien conçu ne réside pas dans un résultat isolé : ni dans une enquête particulière, ni dans un rapport sur les tendances, ni dans un outil de contre-communication. C'est la mémoire institutionnelle et l'intégration des processus de travail qu'elle permet au fil du temps. Les organisations qui ont intégré des outils de surveillance dans leurs processus éditoriaux et qui ont articulé leurs flux de travail quotidiens autour des informations fournies par ces systèmes réagissent plus rapidement aux menaces émergentes, en s'appuyant sur davantage d'éléments concrets et en ayant une meilleure compréhension de l'évolution des discours qu'elles suivent. Les connaissances accumulées au sein d'un système bien entretenu finissent, avec le temps, par constituer un avantage concurrentiel dans l'environnement informationnel au sens large.
Votre avis compte
Que pensez-vous de ce texte ? Prenez 30 secondes pour nous faire part de vos commentaires et nous aider à créer un contenu utile pour la société civile !
Dernière mise à jour le 8 octobre 2026, afin de refléter les évolutions les plus récentes.
Mentions légales
Ce document a été élaboré dans le cadre de l'initiative L’IA au service du changement social au sein du Digital Activism Program de TechSoup, avec le soutien de Google.org.
L'auteur a utilisé l'IA pour créer ce contenu. Toutefois, l'intégralité de cet article a été conçue, révisée et vérifiée par l'auteur et l'équipe de TechSoup.
Les outils d'IA évoluent rapidement, et bien que nous fassions tout notre possible pour garantir la fiabilité des informations que nous fournissons, il peut arriver que certains éléments ne soient plus à jour. Si vous constatez qu'une information n'est plus à jour, merci de nous le signaler à l'adresse contact@hive-mind.community
