Quelle est la fiabilité des détecteurs d'IA ? La réponse courte
Si vous cherchez un détecteur IA fiable, voici la réponse courte : les détecteurs d'IA sont assez précis pour donner un indice utile, pas assez pour servir de preuve. Ils s'en sortent le mieux sur les longs brouillons d'IA non retouchés. Ils sont moins bons sur les textes courts, les brouillons retouchés, les textes qui mêlent parties humaines et parties IA, et l'anglais formel ou écrit par des non-natifs. Il leur arrive aussi de signaler un texte qu'une personne a écrit entièrement seule. La confiance que mérite un score dépend du texte et de l'outil.
C'est aussi ainsi que nous présentons notre propre détecteur d'IA gratuit : un repère, pas un verdict. Nous n'avons pas encore publié notre propre test de précision, et cette page n'en cite donc aucun. Tout ce qui suit vient de recherches publiées et de ce que les éditeurs de détecteurs ont dit de leurs propres outils. Pour comprendre la mécanique derrière les scores, commencez par comment fonctionnent les détecteurs d'IA.
Faux positifs et faux négatifs : un exemple chiffré
Un détecteur peut se tromper dans deux sens. Un faux positif, c'est un texte humain signalé comme IA. Un faux négatif, c'est un texte IA qui passe pour humain. Les deux tirent en sens contraire. Réglez un outil pour attraper plus d'IA, et il signale plus d'humains. Réglez-le pour protéger les humains, et davantage d'IA passe entre les mailles.
Un pourcentage seul cache ce que cela signifie pour de vraies personnes, alors faisons le calcul. Les chiffres sont inventés pour l'exemple et ne décrivent aucun outil réel. Imaginons qu'un établissement vérifie 1 000 dissertations : 100 ont été écrites avec l'IA, 900 sans. Le détecteur repère 90 % des dissertations IA et signale à tort 1 % des dissertations humaines.
- Il signale 90 des 100 dissertations IA et en laisse passer 10. Ces 10 sont des faux négatifs.
- Il signale aussi 9 des 900 dissertations humaines. Ces 9 sont des faux positifs.
- Sur les 99 dissertations signalées, 9 appartiennent à des étudiants qui n'ont rien fait de mal : environ un signalement sur onze.
Supposons maintenant que seules 20 des 1 000 dissertations aient été écrites avec l'IA. Le même outil en signale 18, plus environ 10 des 980 dissertations humaines. Plus d'un tiers des signalements sont désormais faux, et le détecteur n'a pas changé du tout. Seule la composition des copies a changé. « 1 % de faux positifs » ne veut donc jamais dire « un signalement a 99 % de chances d'être juste ».
Les détecteurs d'IA sont-ils fiables ? Ce que disent les études publiées
OpenAI a retiré son propre classificateur de texte IA
OpenAI a lancé un AI Text Classifier en janvier 2023. Sur son propre jeu de test, il identifiait correctement 26 % des textes écrits par IA comme « probablement écrits par une IA » et étiquetait les textes humains comme IA dans 9 % des cas. Le 20 juillet 2023, OpenAI l'a mis hors ligne en invoquant son faible taux de précision. L'entreprise à l'origine de ChatGPT n'a pas réussi à construire un détecteur de texte qu'elle acceptait de garder en service.
Stanford : les auteurs non anglophones signalés bien plus souvent
Une équipe de Stanford menée par Weixin Liang et James Zou a testé sept détecteurs très utilisés sur 91 rédactions du TOEFL écrites par des non-anglophones et 88 rédactions de collégiens américains (eighth grade, l'équivalent de la 4e). Les détecteurs étaient quasi parfaits sur les copies des collégiens, mais ont étiqueté en moyenne 61 % des rédactions du TOEFL comme IA. Sur les 91, 89 ont été signalées par au moins un détecteur.
La cause probable tient au vocabulaire : les personnes dont le vocabulaire anglais est plus restreint choisissent des mots plus prévisibles, exactement ce que les détecteurs interprètent comme de l'IA. Quand les chercheurs ont demandé à ChatGPT d'enrichir le vocabulaire de ces mêmes rédactions, le taux moyen de faux positifs est passé de 61 % à 12 %. Les détecteurs réagissaient au style, pas à l'identité de l'auteur.
Un test de 14 outils : « ni précis ni fiables »
Une équipe internationale menée par Debora Weber-Wulff a testé 14 outils de détection, 12 accessibles au public plus Turnitin et PlagiarismCheck, sur des textes humains, générés par IA, retouchés, paraphrasés et traduits automatiquement. Aucun n'a atteint 80 % de précision, et seuls cinq ont dépassé 70 %. Les outils penchaient vers l'étiquette « humain » : ils laissaient passer l'IA plus souvent qu'ils n'accusaient des personnes. Les textes humains traduits automatiquement provoquaient tout de même des faux positifs, et la retouche ou la paraphrase de textes IA dégradait nettement la détection. Les auteurs ont conclu que ces outils ne sont « ni précis ni fiables ».
Ce que Turnitin dit de son propre taux de faux positifs
Turnitin publie ses propres chiffres. Dans une mise à jour de mai 2023, son directeur produit indiquait que le taux de faux positifs par document est inférieur à 1 % pour les documents où l'outil trouve plus de 20 % d'écriture IA. Environ 4 % des phrases qu'il surligne peuvent avoir été écrites par un humain, la plupart juste à côté de vrai texte IA. Turnitin a aussi observé davantage de faux positifs quand il détectait moins de 20 % d'IA, et il a donc commencé à marquer ces scores d'un astérisque.
Turnitin rappelle aux enseignants que son taux de faux positifs n'étant pas nul, ils doivent exercer leur propre jugement et tenir compte de ce qu'ils savent de l'étudiant et du contexte du devoir.
Des universités qui ont désactivé la détection de l'IA
En août 2023, l'université Vanderbilt a désactivé le détecteur d'IA de Turnitin. Son raisonnement était arithmétique : Vanderbilt avait soumis 75 000 travaux à Turnitin en 2022, si bien qu'un taux de faux positifs de 1 % aurait pu signifier environ 750 travaux étiquetés à tort. L'université citait aussi le biais contre les auteurs non anglophones et le peu d'explications fournies par Turnitin sur le fonctionnement de l'outil.
En Australie, l'université Curtin a désactivé la même fonction à compter du 1er janvier 2026, tout en gardant la détection de similitudes habituelle de Turnitin.
Ce qui fait varier la fiabilité d'un détecteur d'IA
Les résultats publiés concordent avec le fonctionnement des détecteurs. Accordez moins de confiance à un score dans ces cas :
- La longueur. Un texte court porte peu de signal. OpenAI jugeait son classificateur très peu fiable en dessous de 1 000 caractères, et Turnitin a relevé son minimum de 150 à 300 mots pour la même raison. Notre détecteur n'attribue aucun score en dessous de 40 mots.
- La retouche. Chaque phrase réécrite par une personne dilue le signal. Dans le test des 14 outils, la précision chutait nettement sur les textes IA retouchés à la main ou paraphrasés.
- La langue. Beaucoup de détecteurs sont conçus surtout pour l'anglais. OpenAI indiquait que son classificateur était nettement moins bon dans les autres langues, et le nôtre fonctionne lui aussi mieux sur l'anglais : sur un texte en français, son score est moins fiable. Les textes traduits automatiquement ajoutent des faux positifs.
- L'écriture formelle ou très codifiée. Comptes rendus de TP, textes juridiques, lettres de motivation et dissertations au plan imposé suivent des modèles, et un modèle est prévisible. C'est aussi le cas des textes écrits par des personnes au vocabulaire anglais plus restreint, comme l'a montré l'étude de Stanford.
- Le mélange de texte humain et IA. Un brouillon dont vous avez écrit certains paragraphes et l'IA les autres est difficile à noter. Turnitin a constaté que la plupart de ses faux positifs au niveau des phrases se trouvaient juste à côté de vrai texte IA, à la jonction entre les deux.
Si vos propres textes sont souvent signalés, notre guide sur les textes humains détectés comme IA explique les causes habituelles.
Les détecteurs d'IA peuvent-ils se tromper ? Bien utiliser un score
Oui, dans les deux sens, comme le montrent les données ci-dessus. Un score fonctionne le mieux comme un élément parmi d'autres, jamais comme tout le dossier.
Si vous êtes étudiant ou élève
- Gardez une trace de votre façon d'écrire : brouillons, notes, sources consultées et historique des versions dans Google Docs ou Word. Cela en dit plus sur l'auteur d'un texte que n'importe quel score.
- Connaissez les règles de votre cours sur l'IA. Si vous avez utilisé l'IA d'une manière autorisée, expliquez comment.
- Si votre propre travail est signalé, demandez quel outil et quel score ont été utilisés, renvoyez aux chiffres de faux positifs publiés cités plus haut, et proposez de montrer vos brouillons ou de parler du sujet de vive voix.
- Vérifier vous-même un brouillon montre quelles phrases ressemblent à de l'IA pour un détecteur donné. Cela ne vous dit pas comment un autre outil le notera, et cela ne remplace jamais le respect des règles de votre établissement.
Si vous êtes enseignant
- Voyez un score comme une raison d'y regarder de plus près, jamais comme la conclusion. Turnitin lui-même vous laisse cette décision.
- Comparez avec ce que vous savez : les travaux précédents de l'étudiant, ce qu'il écrit en classe, ses brouillons, et sa capacité à expliquer son raisonnement.
- Soyez particulièrement prudent avec les textes courts, les scores faibles, les auteurs non anglophones et les devoirs très codifiés, là où les faux positifs sont les plus probables.
- Fixez les attentes avant le devoir : quels usages de l'IA sont autorisés, et ce qui se passe si un détecteur signale quelque chose.
Notre page sur les détecteurs d'IA pour enseignants en dit plus sur l'usage d'un détecteur en classe.