Les détecteurs de contenus générés par intelligence artificielle, comme Pangram, sont au cœur d'une controverse après les accusations portées contre le roman C'était ça ou mourir de Thélyson Orélien. Ces outils, qui prétendent identifier les textes rédigés par IA, affichent des performances impressionnantes, mais les experts appellent à la prudence.
Une accusation fondée sur un logiciel de détection
Le compte anonyme Balance ton Claude a accusé sur X, en début de semaine, le roman de Thélyson Orélien, lauréat du prix Roman Fnac et en lice pour le Goncourt, d'avoir été « presque intégralement » écrit par IA. Pour étayer ses propos, le compte s'est appuyé sur Pangram, un logiciel de détection de textes, qui estime notamment que les deux premiers chapitres sont générés par IA à 100 % et 91 %. L'auteur et son éditeur Grasset contestent ces affirmations.
Depuis, les vérifications avec des détecteurs d'IA se multiplient. Mais que valent réellement ces outils ? Ophélie Fraisier-Vannier, enseignante-chercheuse en informatique à l'université de Toulouse et membre de l'Institut de recherche en informatique de Toulouse (Irit), explique à Midi Libre que « Pangram détecte des caractéristiques statistiques, généralement des mots, expressions ou patterns plus fréquemment présents qu'attendus ». Thierry Poibeau, chercheur au CNRS, ajoute que les tournures ternaires sont « très fréquentes dans les textes générés, parce que les outils avaient été entraînés sur des textes scientifiques américains ou des romans américains, dans lesquels il y avait beaucoup de structures ternaires ».
Des performances contestées par les chercheurs
Pangram revendique un taux de faux positif d'environ 0,0041 %. Une performance qu'Ophélie Fraisier-Vannier juge « surprenante », même si elle reconnaît que l'outil « est reconnu comme généralement très fiable ». Elle rappelle toutefois que « comme pour tous les modèles statistiques, les faux positifs et faux négatifs existent ». Le logiciel reste « très utile pour donner des indications ».
Difficile aussi de mesurer précisément sa fiabilité sans connaître les textes sur lesquels le logiciel a été entraîné. « Il est très dur d'en dire plus sans connaître le détail de l'évaluation : le nombre et les caractéristiques des textes utilisés pour entraîner et tester l'outil », souligne la chercheuse. CheckNews, le service de vérification de Libération, a passé l'intégralité du roman dans Pangram et GPTZéro : environ 97 % du texte ressort comme généré par IA pour le premier et 100 % pour le second. Des chiffres qui renforcent les soupçons mais qui ne sont pas infaillibles.
Une « boîte noire » difficile à interpréter
Sur son site, Pangram affirme que son outil est capable de détecter dans 9 999 cas sur 10 000 si un texte est entièrement généré par IA, assisté par IA ou écrit par un humain. Mais Ophélie Fraisier-Vannier estime que « au vu du fonctionnement des détecteurs, je ne pense pas qu'ils font la différence entre un texte entièrement généré par IA et un texte reformulé ou retravaillé avec, ou alors pas de manière très certaine ». Pour elle, Pangram reste une « boîte noire indiquant un score de probabilité » et « ne permet techniquement pas d'affirmer sans doute possible qu'un texte est ou n'est pas rédigé par IA ».
Cette affaire soulève des questions plus larges sur l'usage de ces outils dans le monde littéraire et éditorial, alors que les accusations se multiplient et que la confiance dans les détecteurs d'IA est mise à l'épreuve.



