Accueil

La Clinique de l'IA

Pangram détecte-t-il vraiment bien les textes écrits par l’IA ?

Certains événements littéraires récents ont mis en lumière Pangram, un logiciel de détection de contenu généré par intelligence artificielle. Il vous suffit de coller quelques paragraphes, de cliquer et d’obtenir le résultat en quelques secondes. Mais cela ne marche pas toujours très bien. 

Le Journal du Net a voulu en avoir le cœur net et a fourni à Pangram plus d’une centaine de textes : certains écrits par des humains, d’autres par des IA, d’autres encore réécrits et retouchés plusieurs fois. Bilan : Pangram tient la route. Mais il se fait aussi parfois avoir.

Comment ça marche ?

L’outil a été lancé en 2023 par deux anciens de Stanford. Il sert à estimer si un texte sort probablement d’un grand modèle de langage type ChatGPT ou Claude.

Pangram fonctionne essentiellement par statistiques : comme l’indique le JDN, « Il analyse notamment la régularité des constructions, la distribution du vocabulaire, la structure des phrases ou encore la manière dont les idées s’enchaînent. » Puis il compare avec la masse de textes, humains et artificiels, sur lesquels il a été entraîné.

L’entreprise affiche des chiffres qui font rêver : 0,0041 % de faux positifs sur les textes humains en anglais, 0,0026 % en français. Cela semble inattaquable sur le papier, mais la réalité est toutefois quelque peu différente.

Avec des textes 100 % humains, il ne se trompe presque jamais

Premier test : 85 textes dont on est sûr qu’ils ont été écrits par des humains. Des travaux universitaires publiés avant ChatGPT, des articles, des fiches pratiques, des textes historiques.

Une seule erreur. Et pas n’importe laquelle : une interview enregistrée, transcrite automatiquement avec Whisper, puis retravaillée à la main. Impossible de savoir ce qui a fait tiquer le détecteur. Mais l’exemple montre bien qu’entre « écrit par un humain » et « écrit par une IA », il y a aujourd’hui toute une zone grise. On corrige une IA, une IA reformule notre prose, un logiciel transcrit et quelqu’un repasse derrière… Au bout du compte, qui tient vraiment la plume ?

Face à un texte d’IA brut, il ne se laisse pas avoir

Deuxième test : le JDN a demandé à des modèles récents d’écrire des textes, en insistant pour qu’ils sonnent le plus humain possible.

Peine perdue. Pangram les a tous repérés. Même après une retouche humaine, le score restait haut. Glisser quelques fautes, changer deux ou trois tournures, ça ne suffit pas à effacer les traces statistiques.

Plutôt une bonne nouvelle pour les détecteurs, donc. Sauf que le JDN ne s’est pas arrêté là.

Quand l’IA bosse comme un vrai rédacteur, il ne voit plus rien

Troisième test, plus retors. Au lieu d’un simple « écris-moi un article sur tel sujet », le JDN a fait travailler plusieurs agents à la chaîne. Le premier cherchait l’info. Le deuxième rédigeait. Le troisième vérifiait les faits, coupait les conclusions creuses et nourrissait le texte avec les sources.

Là, Pangram a décroché. Dans certains tests, le score est tombé à 12 %. Après relecture et fact-checking, à 0 %.

Ce qui trompe le détecteur, ce n’est donc pas un vocabulaire plus recherché. C’est la matière : des infos réelles, vérifiées, remises dans leur contexte. Tous ceux qui écrivent avec une IA l’ont remarqué : laissée seule face à une page blanche, elle brode des généralités. Donnez-lui du concret, et elle devient précise.

Alors, on peut lui faire confiance ?

Comme indice, oui. Pangram repère plutôt bien les tics statistiques des textes générés. Pour un premier tri, face à un texte trop lisse ou qui tourne en rond, il a son utilité.

Comme preuve, c’est une autre histoire. Le test du JDN le montre dans les deux sens : un texte d’IA bien travaillé peut passer pour humain, et un texte humain passé par quelques outils automatiques peut se faire épingler.

Au fond, la vraie question n’est pas technique. Prenez un article dont l’IA a pondu le premier jet. Un humain change l’angle, reprend l’intro, vérifie les infos, ajoute des exemples et réécrit la moitié des phrases. C’est encore un texte d’IA ? Bon courage pour trancher.

Ce qu’un détecteur ne mesurera jamais

Pangram peut dire à quel point un texte ressemble à ce que produisent les modèles. Il ne dira jamais s’il est bon. S’il donne envie de lire jusqu’au bout. S’il sonne comme l’entreprise qui le signe.

Pour une marque, se demander si Pangram va griller son texte, c’est un peu passer à côté. Mieux vaut se demander si un concurrent aurait pu publier exactement le même.

Un texte peut passer tous les détecteurs du monde et rester parfaitement fade. Un autre, né avec l’aide d’une IA, peut devenir unique s’il est repris par quelqu’un qui connaît la boîte, ses clients, son ton, et ce qu’elle a vraiment à raconter.

Voyez Pangram comme un thermomètre. Il vous dit qu’il y a de la fièvre. Pour savoir ce qu’a le patient, il faudra quand même quelqu’un pour l’ausculter.