Test de l'outil de détection d'IA générative Pangram avec un corpus utilisé dans deux expériences antérieures.
En 2023, j'avais fait un premier test avec GPTZero. Mes résultats ont été publiés dans La Conversation sous le titre révélateur de « J’ai testé un outil de détection de ChatGPT : j’ai perdu mon temps ».
Pour faire cette expérience, j'avais utilisé un corpus de 900 textes :
-
300 textes en français
-
300 textes en anglais
-
300 textes traduits du français vers l’anglais à l’aide de l’API de DeepL.
Tous ces groupes de 300 textes étaient structurés de la même manière :
-
100 articles écrits par des journalistes, publiés au cours des cinq dernières années et moissonnés dans les sites web de différents médias canadiens (le texte complet des articles a été tronqué aux 100 premiers caractères par respect pour la propriété intellectuelle des éditeurs concernés; l'URL vous permet tout de même d'accéder au texte complet utilisé dans le cadre de cet exercice).
-
100 articles générés en partie par GPT-3 (à l'époque). J’ai pris la première partie d’autres articles et j’ai demandé à GPT de les compléter avec une commande (prompt) ressemblant à : « Voici le début d’un article, dont le titre est X. Complétez-le avec 1500 à 2500 caractères, pour publication dans un journal canadien. »
-
100 articles générés entièrement par GPT-3 à partir de titres d'autres articles encore avec une commande qui ressemblait à : « Rédigez, pour publication dans un journal canadien, un article de 4500 à 5000 caractères dont le titre est X. »
Le code et les données de cette expérience sont accessibles sur un autre de mes répertoires Github.
L'année suivante, à l'occasion de la conférence « Les opportunités pédagogiques de l’IA générative en enseignement supérieur : mirage et réalités », organisée en avril 2024 à l'UQAM, j'ai présenté les résutats d'une deuxième expérience qui ressemblait à la première à ces différences près :
-
J'ai utilisé un corpus en français seulement (pas de textes en anglais, ni de traductions du français vers l'anglais), donc de 300 textes.
-
J'ai utilisé GPT-4, fraîchement sorti du four d'OpenAI pour générer les 100 textes « moitié moitié » et les 100 textes « IA », en plus d'utiliser les mêmes 100 textes humains.
Les résultats, accessibles via Archipel, ne permettaient pas d'accroître la confiance envers ces outils.
Quand toute la controverse entourant l'auteur Thélyson Orélien a éclaté, j'ai voulu tester la fiabilité de Pangram. Mon hypothèse?
J'ai donc repris mon corpus de 2024 et l'ai soumis à l'API de Pangram.
Cet outil donne plusieurs résultats après avoir analysé un texte. Il le classe dans l'une ou l'autre de trois catégories : Human; Mixed; AI.
Il donne aussi des probabilités que le texte ait été généré par l'IA (le paramètre est fraction_ai), écrit avec l'assistance de l'IA (fraction_ai_assisted) ou rédigé par un être humain (fraction_human).
Le script orelien.py analyse chacun des 300 textes, un corpus à la fois, et produit un fichier avec, notamment, la catégorie dans laquelle il a classé chaque texte. J'ai mis les résultats bruts dans le fichier pangram_gpt-4.csv. Mais voici un tableau résumant ces résultats :
| Corpus ⬇️ \ Catégorie ➡️ | Human | Mixed | AI | Fiabilité |
|---|---|---|---|---|
| 1 journaliste | 100 | 100% | ||
| 2 moitié (GPT-4) | 3 | 97 | 97% | |
| 3 GPT-4 | 100 | 100% |
J'avoue avoir été bluffé! Mais si c'était parce que Pangram avait analysé des texte générés avec un vieux modèle? GPT-4 date de 2024, après tout. Cela fait des millénaires en années d'IAG.
J'ai donc généré (au moyen des scripts redaction-2-moitie.py et redaction-3-ia.py) de nouveaux corpus en utilisant le modèle GPT-6-Luna :
Les résultats bruts se trouvent dans le fichier pangram_gpt-6.csv et sont tout aussi bons :
| Corpus ⬇️ \ Catégorie ➡️ | Human | Mixed | AI | Fiabilité |
|---|---|---|---|---|
| 1 journaliste | 100 | 100% | ||
| 2 moitié (GPT-6) | 2 | 98 | 98% | |
| 3 GPT-6 | 100 | 100% |
Impressionnant, certes. Mais il ne faut jamais perdre de vue que de faux positifs sont toujours possibles, comme l'a constaté François Cardinal.
Rapport technique complet de la version 4 de Pangram (juillet 2026; en anglais) : https://arxiv.org/abs/2607.27183