Skip to content
jhroyPublic

About

Expérience sur la fiabilité de Pangram reliability experiment.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Repository files navigation

Logo de Pangram

Pangram est-il fiable?

Test de l'outil de détection d'IA générative Pangram avec un corpus utilisé dans deux expériences antérieures.

Fiabilité discutable des outils de détection de l'IA

En 2023, j'avais fait un premier test avec GPTZero. Mes résultats ont été publiés dans La Conversation sous le titre révélateur de « J’ai testé un outil de détection de ChatGPT : j’ai perdu mon temps ».

Pour faire cette expérience, j'avais utilisé un corpus de 900 textes :

  • 300 textes en français

  • 300 textes en anglais

  • 300 textes traduits du français vers l’anglais à l’aide de l’API de DeepL.

Tous ces groupes de 300 textes étaient structurés de la même manière :

  • 100 articles écrits par des journalistes, publiés au cours des cinq dernières années et moissonnés dans les sites web de différents médias canadiens (le texte complet des articles a été tronqué aux 100 premiers caractères par respect pour la propriété intellectuelle des éditeurs concernés; l'URL vous permet tout de même d'accéder au texte complet utilisé dans le cadre de cet exercice).

  • 100 articles générés en partie par GPT-3 (à l'époque). J’ai pris la première partie d’autres articles et j’ai demandé à GPT de les compléter avec une commande (prompt) ressemblant à : « Voici le début d’un article, dont le titre est X. Complétez-le avec 1500 à 2500 caractères, pour publication dans un journal canadien. »

  • 100 articles générés entièrement par GPT-3 à partir de titres d'autres articles encore avec une commande qui ressemblait à : « Rédigez, pour publication dans un journal canadien, un article de 4500 à 5000 caractères dont le titre est X. »

Le code et les données de cette expérience sont accessibles sur un autre de mes répertoires Github.

Même constat en 2024

L'année suivante, à l'occasion de la conférence « Les opportunités pédagogiques de l’IA générative en enseignement supérieur : mirage et réalités », organisée en avril 2024 à l'UQAM, j'ai présenté les résutats d'une deuxième expérience qui ressemblait à la première à ces différences près :

Les résultats, accessibles via Archipel, ne permettaient pas d'accroître la confiance envers ces outils.

Qu'en est-il en 2026 avec Pangram?

Quand toute la controverse entourant l'auteur Thélyson Orélien a éclaté, j'ai voulu tester la fiabilité de Pangram. Mon hypothèse?

Note

HYPOTHÈSE : Pangram est aussi 💩 que les autres.

J'ai donc repris mon corpus de 2024 et l'ai soumis à l'API de Pangram.

Cet outil donne plusieurs résultats après avoir analysé un texte. Il le classe dans l'une ou l'autre de trois catégories : Human; Mixed; AI.

Il donne aussi des probabilités que le texte ait été généré par l'IA (le paramètre est fraction_ai), écrit avec l'assistance de l'IA (fraction_ai_assisted) ou rédigé par un être humain (fraction_human).

Le script orelien.py analyse chacun des 300 textes, un corpus à la fois, et produit un fichier avec, notamment, la catégorie dans laquelle il a classé chaque texte. J'ai mis les résultats bruts dans le fichier pangram_gpt-4.csv. Mais voici un tableau résumant ces résultats :

Corpus ⬇️ \ Catégorie ➡️ Human Mixed AI Fiabilité
1 journaliste 100 100%
2 moitié (GPT-4) 3 97 97%
3 GPT-4 100 100%

Pangram est-il aussi fiable avec des modèles contemporains?

J'avoue avoir été bluffé! Mais si c'était parce que Pangram avait analysé des texte générés avec un vieux modèle? GPT-4 date de 2024, après tout. Cela fait des millénaires en années d'IAG.

J'ai donc généré (au moyen des scripts redaction-2-moitie.py et redaction-3-ia.py) de nouveaux corpus en utilisant le modèle GPT-6-Luna :

Les résultats bruts se trouvent dans le fichier pangram_gpt-6.csv et sont tout aussi bons :

Corpus ⬇️ \ Catégorie ➡️ Human Mixed AI Fiabilité
1 journaliste 100 100%
2 moitié (GPT-6) 2 98 98%
3 GPT-6 100 100%

Impressionnant, certes. Mais il ne faut jamais perdre de vue que de faux positifs sont toujours possibles, comme l'a constaté François Cardinal.

Pour en savoir plus

Rapport technique complet de la version 4 de Pangram (juillet 2026; en anglais) : https://arxiv.org/abs/2607.27183

About

Expérience sur la fiabilité de Pangram reliability experiment.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages