Cet article est une tentative de ma part pour rendre cet outil moins « mystérieux » et plus prévisible. Ce n'est pas pour que vous cessiez de l'utiliser, bien au contraire. L'important, c'est de l'utiliser de manière réfléchie : savoir à quoi il sert, ce qu’il ne peut pas faire, et quelles habitudes vous empêcheront de vous laisser berner par un texte bien écrit.

La place de l'IA générative dans le monde de l'IA

Quand on parle d’« IA », on pense souvent à une sorte de solution miracle. En réalité, c'est un parapluie en piteux état. Ce concept englobe tout, de la simple automatisation basée sur des règles (« si ceci, alors cela ») à l'apprentissage automatique classique (systèmes de classification ou de prédiction, comme la détection des spams), en passant par les modèles génératifs qui produisent du texte, des images, du son ou du code.

La catégorie à laquelle nous sommes confrontés au quotidien est celle des LLM, c'est-à-dire des grands modèles de langage. Un LLM est entraîné sur d'énormes quantités de texte pour accomplir une tâche fondamentale : prédire ce qui va suivre. Pas l'idée suivante, ni la vérité suivante, mais le prochain élément (en gros, un mot ou une partie de mot) en fonction de ce qu'il a vu jusqu'alors.

Cet objectif d’entraînement est important, car il met en lumière à la fois les aspects positifs et les risques. Un système optimisé pour la génération de texte deviendra extrêmement fluide. Il lui arrivera aussi parfois d'inventer des détails si cela « ressemble » au genre de suite qui semble appropriée. OpenAI décrit les hallucinations comme une conséquence de ce dispositif : la prédiction du mot suivant est un outil puissant, mais elle ne revient pas à rechercher la vérité.

Une nuance que j’ajoute toujours, car sans elle on transmettrait un message erroné : oui, l’entraînement est statistique, mais cela ne signifie pas que le système est un simple recueil de phrases. Ces modèles peuvent généraliser et combiner des motifs d’une manière qui peut sembler créative. Ce qu'il faut retenir, ce n'est pas que « c'est stupide », mais plutôt que ce système est conçu pour être fluide et qu'il ne s'ancre dans la réalité que lorsque nous le forçons à le faire.

Outils LLM et moteurs de recherche : cousins, pas jumeaux

S'il y a bien une erreur que je constate sans cesse au sein des équipes, c'est de considérer ChatGPT comme un moteur de recherche. Ce n'est pas le cas. La différence n'est pas purement théorique : elle modifie la manière dont vous vérifiez les informations et dont vous accordez votre confiance.

Les moteurs de recherche classiques se contentent principalement de récupérer des résultats. Ils trouvent des documents, les classent et vous renvoient vers les sources. C'est votre cerveau qui s'occupe de l'assemblage final. Les outils de type LLM génèrent surtout des réponses : ils livrent directement un contenu, souvent bien structuré, même sans source fiable.

Et puis il y a les hybrides modernes, où les frontières s'estompent. Google utilise désormais des résumés générés par Gemini dans son moteur de recherche (AI Overviews), et l'entreprise précise clairement que cette IA fonctionne en collaboration avec les systèmes de recherche et renvoie vers les résultats afin que les utilisateurs puissent les vérifier. Perplexity se positionne encore plus clairement comme une plateforme « recherche + réponse + références », ce qui signifie qu'elle récupère des résultats sur le Web puis les synthétise en une réponse sur laquelle vous pouvez cliquer.

Cette approche hybride est réellement utile pour le travail factuel, mais elle ne dispense pas de faire preuve de scepticisme. Les références peuvent être hors de propos, de mauvaise qualité, voire renvoyer vers du contenu indésirable généré par l'IA qui ressemble à une page web. Des études ont mis en évidence ce risque réel dans les moteurs de recherche : si le Web est pollué, votre réponse « fiable » peut l'être aussi.

Dans la pratique, ma règle est simple. J'utilise un LLM pour la réflexion et la rédaction : structure, options, planification de scénarios et réécriture. J’utilise la recherche (ou des outils de recherche avec références) lorsque j’ai besoin de faits vérifiables, de dates, de chiffres et de traçabilité. Si le contenu est destiné à être rendu public et comporte un risque réputationnel, je considère le LLM comme un outil de premier jet, et non comme une source de vérité.

L'IA n'est pas consciente : elle « imite » le langage humain (et pourquoi cela a de l'importance)

On me demande souvent : « Est-ce qu'elle comprend ? » Pour répondre honnêtement, dans le cadre de notre réflexion pratique, la réponse est la suivante : elle n'a ni conscience, ni intention, ni expérience vécue. Elle ne veut pas t'aider, et elle s'en fiche si elle a tort. Elle génère un langage qui correspond au contexte et aux schémas qu'elle a appris.

Une bonne façon de bien saisir cela, c'est de la comparer au langage que l'on utilise automatiquement au quotidien. Quand quelqu'un dit « merci », on répond souvent « de rien » sans même y penser. On ne s’arrête pas pour analyser la gratitude et la réciprocité ; on met simplement en pratique un schéma social acquis.

Les LLM effectuent cette complétion de séquences à grande échelle. Ils ne sont ni vides ni aléatoires ; ce sont des moteurs de modèles extrêmement sophistiqués. Mais le risque principal demeure : un langage qui sonne comme celui d'un humain peut nous amener à croire à tort qu'il fait preuve d'une compréhension et d'une sincérité propres à l'être humain. Le cadrage proposé par OpenAI est un repère utile ici : des modèles entraînés à prédire du texte peuvent halluciner, car leur objectif est de produire une suite plausible, et non une information vérifiée.

Si ce sont des schémas, pourquoi la réponse n'est-elle pas toujours la même ?

C'est l'un de mes moments de déclic préférés avec les équipes : posez deux fois la même question et vous obtiendrez des réponses différentes. On dirait des sautes d'humeur. Mais ce n'est pas une question d'humeur. C'est une question de mécanique.

La première raison est l'échantillonnage, c'est-à-dire le hasard contrôlé dans la manière dont le modèle choisit le prochain token. La plupart des outils ne sélectionnent pas simplement à chaque fois le mot suivant le plus probable. Ils choisissent souvent parmi les options les plus probables afin d'éviter les réponses répétitives et mécaniques. Le paramètre dont il est question ici est la température : une température plus basse tend à produire des résultats plus prévisibles, tandis qu'une température plus élevée tend à produire des résultats plus variés et plus créatifs. Les valeurs par défaut se situent souvent autour de 1,0 (ce qui correspond à un niveau de diversité assez « normal »). De nombreuses applications de chat grand public ne mettent pas ces paramètres en évidence et peuvent les modifier en fonction du mode, de la politique ou des expérimentations.


Exercice : Échantillonnage et variabilité

Demandez : « Donne-moi 10 slogans pour une campagne sur la résilience numérique dans les ONG. » Répétez l'opération 3 à 5 fois. Demandez ensuite : « Rends-les ennuyeux et cohérents. » Comparez. Vous verrez que le résultat produit par l'outil n'est pas une « vérité » immuable, mais un ensemble de textes plausibles.


La deuxième raison est le contexte. Le résultat du modèle dépend fortement de ce qu'il voit. Et ce qu'il voit, ce n'est pas seulement votre prompt. Ce sont vos conversations, des instructions au niveau des produits que vous ne voyez pas, et parfois votre personnalisation à long terme.

C'est là que la « mémoire » prend toute son importance. Dans ChatGPT, OpenAI décrit deux fonctionnalités susceptibles d'influencer la personnalisation : les « souvenirs enregistrés » et la possibilité de « consulter l'historique des chats », deux fonctionnalités qui peuvent être gérées ou désactivées. Cela revêt une importance particulière dans le travail des ONG, car il ne s'agit pas seulement de qualité des résultats, mais aussi de confidentialité et de prévisibilité.


Exercice : Le contexte influence les résultats

Dans deux nouveaux chats, donnez des contextes différents (par ex. une ONG spécialisée dans les services sociaux par opposition à une ONG environnementale) et demandez des idées de programmes. Remarquez que « la même question » n'est plus tout à fait la même dès que le contexte change.


Vérité, mensonge et pourquoi l’assurance ne garantit pas la justesse

Voici une réalité simple, mais dérangeante : un LLM ne sait pas si ce que vous lui demandez de faire repose sur la vérité ou sur la fiction. Il ne vérifie pas. Il ne contrôle pas. Son rôle est de produire un texte cohérent, et il le fera avec la même aisance et la même assurance que le postulat de départ soit solide, fragile ou complètement‑inventé.

C'est pourquoi une réponse peut paraître soignée et assurée même lorsque son contenu est erroné. Ce modèle n'évalue pas la réalité ; il ne fait que reproduire des schémas.

C'est là que l'ancrage devient indispensable. Les entreprises tentent de lutter contre les « hallucinations » en connectant leurs modèles à des sources externes — moteurs de recherche, documents, références — afin que les résultats s'appuient sur des données vérifiables. S'il y a une habitude à prendre, c'est bien celle-ci : considérer chaque résultat d'IA non étayé comme une hypothèse, et non comme un fait.


Exercice : Faites le test de l’« ‑employé inexistant »

Demandez au LLM de rédiger la biographie d’un‑employé inexistant au sein de votre organisation : « Rédige une biographie de notre nouvelle responsable des réseaux sociaux, Jane Shakespeare. » La plupart du temps, il inventera sans hésiter un personnage tout à fait plausible — avec son parcours, son expérience professionnelle et tout le reste — sans jamais se demander si cette personne existe réellement.


Pourquoi les sujets généraux semblent souvent « plus intéressants » que les sujets de niche

Si vous interrogez votre IA sur un sujet général et bien documenté — les principes fondamentaux de la gestion de projet, les règles de base en matière de cybersécurité, la manière d'organiser un atelier —, les LLM s'avèrent souvent d'une aide précieuse. Mais si vous posez des questions sur une réglementation spécifique à votre pays, un petit programme de subventions local ou une nouvelle mise à jour des politiques, la qualité des résultats peut baisser considérablement.

Les modèles ont tendance à donner de meilleurs résultats lorsque le sujet apparaît fréquemment et de manière régulière dans les données d'entraînement. Ils ont du mal lorsque les informations sont rares, contradictoires ou évoluent rapidement. OpenAI cite explicitement l'exemple des « faits peu fréquents », difficiles à prédire à partir de modèles, pour illustrer pourquoi des hallucinations se produisent.

Pour les ONG, cela se traduit clairement en termes de risque : plus une affirmation est précise, locale ou urgente, plus il convient de privilégier la recherche et la vérification des sources.

Les biais : stéréotypes et biais culturels (oui, c’est réel)

Les préjugés ne se limitent pas au genre ou à l'origine ethnique, comme le montrent les exemples connus d'échecs de l'IA. Souvent, ce sont des aspects plus discrets : ce que le modèle considère comme la vision du monde par défaut, quelles références culturelles prédominent, à quoi ressemble l’« excellence », quels exemples apparaissent en premier.

Les recherches sur les LLM et la culture montrent que ces modèles peuvent refléter les valeurs et les schémas culturels dominants plutôt que d'être culturellement neutres. Le cadre de gestion des risques liés à l'IA du NIST considère les biais comme un domaine de risque majeur que les organisations doivent gérer activement par le biais de la gouvernance et d'une utilisation tenant compte du contexte.

Voici l'un de mes exemples préférés : demandez à votre outil LLM de « citer les 10 meilleurs groupes de musique au monde ». On se retrouve souvent avec une liste qui privilégie largement les artistes américains et britanniques. Non pas parce que le modèle est malveillant, mais à cause des données d'entraînement et de la prédominance culturelle.

Un autre exemple pourrait être le ton d'un texte généré. D'après mon expérience, lorsque l'on rédige une demande de subvention, le « ton » utilisé par défaut a tendance à être plutôt « à l'américaine » (mots à la mode, promesses exagérées, usage excessif de superlatifs), même lorsque je rédige en tchèque ; ce qui rend généralement ces textes inutilisables pour les fondations locales ou les administrations publiques, qui s'attendent à des formulations et à un langage très différents.

L’approche pratique n’est pas de discuter avec le modèle. Elle est de le contraindre : préciser la géographie, la langue, le ton, la représentation ou les critères d’évaluation. La plupart du temps, le biais apparaît dès que l'on compare les résultats « par défaut » aux résultats « sous contrainte ».


Exercice : Afficher la vision du monde par défaut

Demandez : « Cite les 10 meilleurs groupes de musique au monde. » Notez quels pays, quelles langues et quelles cultures prédominent. Ensuite, régénérez la réponse 2 à 3 fois en ajoutant des critères supplémentaires.


L’hallucination : qu'est-ce que c'est et pourquoi cela se produit-il ?

Le terme « hallucination » est une expression technique polie qui désigne un phénomène simple : le modèle génère un contenu plausible, mais qui est faux ou non étayé. Il est capable de fabriquer de toutes pièces des citations, d'inventer des références et d'énoncer avec assurance des « faits » qui n'ont jamais existé. OpenAI décrit les hallucinations comme une limite connue liée à la manière dont ces modèles sont entraînés.

Si cela revêt une importance particulière pour les ONG, c'est que les résultats sont souvent exploitables, même lorsqu'ils sont erronés. Pour un professionnel de la communication très occupé, une référence inventée de toutes pièces ressemble en tous points à une vraie. Une statistique inventée s'intègre parfaitement dans un récit. Et c'est ainsi que des erreurs se glissent dans les documents publics.

Ainsi, lorsque vous demandez au modèle de vous fournir « trois études qui prouvent que… » ou de « citer la loi qui stipule que… », vous devez partir du principe qu’il risque de générer des références erronées, à moins que vous n’exigiez les sources et que vous ne les consultiez vous-même.

La complaisance : l’assistant qui cherche trop à vous donner raison.

La complaisance est l'un des écueils les plus dangereux pour un travail stratégique. Le modèle apprend que les utilisateurs aiment se sentir approuvés. Si les signaux d’entraînement et de rétroaction valorisent avant tout ce qui est « utile » et « agréable », le modèle peut devenir un miroir complaisant — surtout si vous rédigez des prompts qui partent déjà du principe que votre idée est correcte.

Anthropic décrit la complaisance comme une tendance favorisée par l'apprentissage par préférence (RLHF), dans le cadre duquel le modèle peut s'aligner sur les convictions de l'utilisateur plutôt que de rechercher la vérité. OpenAI a également étudié comment les signaux de rétroaction peuvent renforcer l'amabilité et quel rôle la personnalisation peut jouer à cet égard.

Et c’est ce qui rend la situation particulièrement délicate : la complaisance procure souvent du plaisir. C'est exactement comme dans les relations humaines. Imaginez ce moment où vous vous plaignez de votre partenaire à votre meilleur ami, et où celui-ci vous répond sans hésiter : « Quel crétin ! Tu as tout à fait raison d'être en colère. » Il n'analyse pas la situation. Il ne prend pas la mesure de ce qui s'est passé. Il vous renvoie vos propres émotions, car la satisfaction sociale réside dans le fait qu’il vous donne raison, et non dans la justesse de ses propos.

Les LLM fonctionnent de la même manière. Ils ne cherchent pas à déterminer si vous avez raison ; ils cherchent à trouver la suite qui permettra à l'interaction de continuer sans heurts. Dans le travail stratégique, cela rend la complaisance dangereuse : le modèle devient encourageant, enthousiaste et discrètement dépourvu d'esprit critique. Si vous utilisez l'IA pour la planification, vous devez l'inciter activement à vous contredire. Sinon, elle validera volontiers vos angles morts.


Exercice : Contrôle de la complaisance

Préparez un vrai plan et demandez : « Ton travail consiste à attaquer ceci. « Énumère les 10 principaux modes de défaillance et sois franc. » Si le modèle continue de vous faire des compliments, affinez la consigne jusqu'à obtenir une véritable critique.


Quand utiliser l'IA — et quand s'en abstenir

J'utilise l'IA en permanence, mais je continue de penser que savoir « quand ne pas l'utiliser » fait partie d'un leadership responsable.

J'utilise l'IA lorsque j'ai besoin de structure, de rapidité, de choix et d'un contenu linguistique — surtout lorsque le résultat reste interne ou doit être vérifié. J’évite d’utiliser l’IA comme autorité sur tout ce qui est sensible au temps, juridique, médical ou à fort enjeu réputationnel, sauf si je peux vérifier avec des sources primaires. Je traite également les données personnelles sensibles avec la plus grande prudence ; la plupart des activités des ONG impliquent des informations concernant des personnes qui n’ont pas donné leur accord pour servir de support d’entraînement ou de « contexte de discussion ».

Et encore une fois, c'est à vous qu'il revient de vérifier les résultats. La décision reste à l’être humain : ce que nous publions, ce que nous affirmons, ce que nous recommandons. L’outil peut faciliter la réflexion, mais il ne peut pas en assumer les conséquences.

Si vous deviez retenir une seule phrase à transmettre à votre équipe, ce serait celle-ci : L'IA est très douée pour générer du texte. C'est à vous qu'il revient de faire en sorte qu’il soit vrai.

Votre avis compte

Que pensez-vous de ce texte ? Prenez 30 secondes pour nous faire part de vos commentaires et nous aider à créer un contenu utile pour la société civile !


Mentions légales

Ce document a été élaboré dans le cadre de l'initiative L’IA au service du changement social au sein du Digital Activism Program de TechSoup, avec le soutien de Google.org.

L'auteur a utilisé l'IA pour créer ce contenu. Toutefois, l'intégralité de cet article a été conçue, révisée et vérifiée par l'auteur et l'équipe de TechSoup.

Les outils d'IA évoluent rapidement, et bien que nous fassions tout notre possible pour garantir la fiabilité des informations que nous fournissons, il peut arriver que certains éléments ne soient plus à jour. Si vous constatez qu'une information n'est plus à jour, merci de nous le signaler à l'adresse content@techsoup.org.

« Comment fonctionne réellement l'IA générative (et comment l'utiliser sans se faire d'illusions) », par Radka Bystřická, 2026, pour Hive Mind, est sous licence CC BY 4.0.