Image

Controverse Thélyson Orélien : ce qu’il faut savoir sur Pangram

 

Tout lire sur: Radio-Canada Livres

Source du texte: Lecture

La version audio de cet article est générée par la synthèse vocale, une technologie basée sur l’intelligence artificielle.

Le détecteur d’IA Pangram qui a plongé l’écrivain canado-haïtien dans la controverse est-il fiable? Plusieurs médias et commentateurs sur les réseaux sociaux ont mentionné le faible taux de faux positifs qu’affirme avoir Pangram – c’est-à-dire la proportion de textes écrits par des humains que le système identifie faussement comme étant de l’IA – est de 1 sur 10 000.

Les Décrypteurs en ont discuté avec la professeure Marzena Karpinska, de l’Université Simon Fraser, en Colombie-Britannique. Elle et son équipe ont été les premières à tester la fiabilité de Pangram, en 2024. Leur hypothèse de départ était que les détecteurs de textes générés par l’IA n’étaient pas dignes de confiance. À la lumière de leurs tests, c’était effectivement le cas pour la plupart des systèmes – à l’exception de Pangram.

Dans ce papier, ils ont déterminé que Pangram avait un taux de faux positifs de 2 %. Marzena Karpinska assure cependant que le détecteur s’est grandement amélioré dans les deux ans depuis leurs tests initiaux.

Publicité

La chercheuse souligne que le taux de faux positifs de l’outil sur des textes en français est aujourd’hui de 0,0026 %. Pour des textes littéraires en anglais, le taux de faux positifs est pour ainsi dire de 0 %, selon elle. Il n’existe toutefois pas de données spécifiquement pour les textes littéraires en français.

Pour des textes littéraires, Pangram a un taux de faux positifs beaucoup plus bas, très proche de 0 %, contrairement à d’autres textes, comme des recettes, des blogues ou des articles de nouvelles ou encore des articles scientifiques, explique-t-elle. Les textes littéraires divergent beaucoup plus dans leur forme les uns des autres que d’autres textes, comme des articles de journaux. Or, l’IA a tendance à toujours reproduire les mêmes schèmes, ce qui fait en sorte que ses textes sont plus faciles à détecter.

Plusieurs médias ont soumis des portions du roman C’était ça ou mourir de l’écrivain québécois d’origine haïtienne Thélyson Orélien à Pangram ainsi qu’à d’autres détecteurs d’IA. Ils ont constaté que les résultats divergeaient grandement.

Mme Karpinska soutient toutefois que Pangram est fondamentalement différent des autres détecteurs d’IA. Pour l’entraîner, ses concepteurs ont pris des millions de textes écrits par des humains, puis ont demandé à plusieurs modèles d’IA de reformuler ces mêmes textes. Ils ont ensuite entraîné Pangram sur ces exemples. Cela permet à l’IA de mesurer statistiquement comment des textes humains divergent de ceux composés par l’IA.

J’ai beaucoup de confiance envers Pangram, en particulier pour des textes plus longs, dit-elle, en ajoutant que plus un texte est long, moins il est probable que Pangram donne un faux positif.

Publicité

Un professeur d’analyse de données à l’université Vrije Universiteit Brussel, Filip van Droogenbroeck, a tenu des propos semblables dans un récent article de Libération (nouvelle fenêtre).

Le professeur Droogenbroeck a mené un travail comparant des textes humains à des textes modifiés par l’IA, comme le fait Pangram, et en vient au même constat que Marzena Karpinska : les faux positifs sont extrêmement rares, a-t-il déclaré au quotidien français.

C’était ça ou mourir passé au crible

Nous avons acheté une version électronique de C’était ça ou mourir et soumis le texte intégral à Pangram. Résultat : 94 % du texte a été généré à l’aide de l’IA, selon le détecteur.

Une capture d'écran d'un résultat du détecteur d'IA Pangram, qui indique que 94 % du texte est de l'IA.

94% du roman « C’était ça ou mourir » a été généré à l’aide de l’intelligence artificielle, selon un test effectué avec Pangram. « Du contenu généré par IA apparaît tout au long » de l’oeuvre, selon l’outil.

Photo : Capture d’écran Pangram

Ce résultat indique que le texte n’a pas été purement généré par IA, ce qui est logique. Générer quelques centaines de pages à l’aide d’une seule invite (prompt) n’est pas un scénario plausible. Donc, il y a sans doute du fignolage humain là-dedans que le modèle détecte. Il faut aussi noter que Pangram est conçu pour être très conservateur, indique Mme Karpinska.

Là encore, la chercheuse tempère son propos. Nous ne pouvons pas dire avec 100 % de certitude que c’est de l’IA. Nous pouvons dire qu’il y a une très forte probabilité que ce texte ait été produit avec une importante assistance de l’IA, juge-t-elle.

Nous avons fait le même exercice avec les seuls autres romans nommés au prix Goncourt qui étaient disponibles en version numérique au Québec, soit six œuvres au total. Tous ont obtenu la cote 100 % humain de Pangram.

_iframe]:mx-auto [&_>_iframe]:block [&_>_iframe]:w-full »>

Une défense boiteuse, selon des experts

Plusieurs explications ont été émises, à la fois par Thélyson Orélien lui-même, par ses éditeurs et sur les réseaux sociaux, pour tenter de discréditer les résultats de Pangram. Nous avons demandé à Mme Karpinska ce qu’elle en pensait.

M. Orélien émet l’hypothèse que son style caribéen aurait pu fausser les résultats de Pangram. C’est difficile à croire, juge la chercheuse. Elle fait remarquer que, même lorsqu’on traduit le texte en anglais, Pangram détermine qu’il a été écrit par l’IA. Or, ce n’est pas le cas pour des textes écrits par des humains qu’on traduit de la même façon, selon ses recherches.

Même son de cloche du côté de Filip van Droogenbroeck, dans Libération : Pangram a délibérément entraîné son détecteur sur des données multilingues, y compris des langues sous-représentées, a-t-il expliqué au journal.

Nous avons soumis huit livres écrits par des auteurs d’origine haïtienne (Lyonel Trouillot, Marie-Célie Agnant et Jacques Roumain, entre autres) et par un auteur canadien d’origine africaine (Blaise Ndala), au détecteur Pangram. Toutes ces œuvres ont été détectées comme 100 % humains.

_iframe]:mx-auto [&_>_iframe]:block [&_>_iframe]:w-full »>

Les Éditions du Boréal, qui ont édité C’était ça ou mourir au Québec, ont offert leur soutien à Thélyson Orélien suivant les allégations selon lesquelles l’auteur aurait eu recours à l’IA générative, dans un communiqué diffusé mardi. Ce travail éditorial a été mené avec la plus grande rigueur, sans aucune intervention de l’IA, pouvait-on y lire.

Dans une entrevue accordée à La Presse, l’écrivain affirme que le premier manuscrit pour son roman a été complété en 2019 – avant même que des outils comme ChatGPT existent – et qu’il n’a jamais utilisé l’IA pour écrire. Il a affirmé mardi au quotidien Libération qu’il est en train de monter un dossier pour prouver le tout.

La Bible générée par l’IA, selon Pangram?

Grasset, l’éditeur de C’était ça ou mourir en France, a affirmé dans un communiqué diffusé mardi que les détecteurs d’IA identifient des textes humains, comme la Bible, comme étant de l’IA. Selon la maison d’édition, cela démontrerait leur manque de fiabilité.

Marzena Karpinska explique qu’il est possible, si on soumet de très courts extraits de vieux textes, comme la Bible ou la Déclaration de l’indépendance des États-Unis, que certains détecteurs les identifient comme étant générés par l’IA.

La raison est simple : ces textes apparaissent maintes fois dans les banques d’entraînement des grands modèles de langage, puisqu’ils ont été cités d’innombrables fois dans de nombreuses œuvres. Certains détecteurs déterminent alors que le texte ressemble à de l’IA. Mais ce n’est pas un problème avec Pangram, selon Mme Karpinska.

Nous avons effectué le test en soumettant des chapitres entiers de la Bible à Pangram. Résultat : 100 % humain. Nous avons aussi soumis une sélection de neuf titres classiques de la littérature française à Pangram, de Maupassant à Baudelaire, en passant par Boris Vian et Michel Foucault. Là encore, 100 % humain, dans tous les cas.

_iframe]:mx-auto [&_>_iframe]:block [&_>_iframe]:w-full »>

Un internaute a fait remarquer que, en changeant quelques mots dans un paragraphe de C’était ça ou mourir, Pangram affirme que le texte est 100 % humain, arguant que cela démontrait la nature aléatoire du détecteur.

Là encore, cela ne surprend pas Mme Karpinska. C’est de cette façon que les gens essaient d’humaniser le texte pour échapper à la détection. C’est plus facile de tromper Pangram de cette façon, parce que l’outil est optimisé pour offrir un taux minime de faux positifs, tout en augmentant la chance de faux négatifs, explique-t-elle.

Radio-Canada a tenté à plusieurs reprises depuis hier de contacter Thélyson Orélien, sans succès. Son éditeur québécois, Boréal, décline toute demande d’entrevue jusqu’à nouvel ordre.

Il y a 2 heuresArts
Il y a 3 heuresAccidents et catastrophes
Il y a 1 heureCrime sexuel
Il y a 10 heuresChasse et pêche
Il y a 8 heuresAccidents et catastrophes

Dans cet article

Décrypteurs

No books found for your query.

C’était ça ou mourir

No books found for your query.

Libération

No books found for your query.

.

No books found for your query.

C’était ça ou mourir

No books found for your query.

C’était ça ou mourir

No books found for your query.

prompt

No books found for your query.

Libération

No books found for your query.

:

No books found for your query.

C’était ça ou mourir

No books found for your query.

La Presse

No books found for your query.

Libération

No books found for your query.

C’était ça ou mourir

No books found for your query.

C’était ça ou mourir

No books found for your query.

C’était ça ou mourir

No books found for your query.

No books found for your query.

Palmarès des livres au Québec