1. Introduction : du soupçon au dossier
Un pourcentage arrive avant le dossier. Qui note voit la part classée comme générée, sans brouillon, sans la conversation d’écriture et sans ce que l’étudiant peut expliquer. Le nombre peut rester dans la salle de cours ou entrer dans une procédure, avec des effets sur la note, le dossier et la confiance. Le faux positif retombe sur une personne ; le faux négatif laisse passer un texte qu’on ne pourra peut-être pas soutenir. Ce n’est pas le même dommage.
Le problème ne naît pas avec cette interface. Cotton et al. (2024), comme cadre conceptuel, voient dans les interfaces conversationnelles et dans GPT-3 un double visage : plus de participation, de collaboration et d’accessibilité, et aussi une malhonnêteté difficile à détecter. Il n’y a pas dans leur texte d’essai à vérité connue ; il y a une proposition de politiques, de formation et de plus d’une méthode de prévention. Birks et Clare (2023) ajoutent que l’inconduite n’est pas nouvelle et qu’il existe des cadres de prévention, enracinés dans la prévention du délit, utiles aussi lorsqu’un modèle de langage la facilite. Ils concluent sur un agenda de recherche, non sur une sanction type.
La question de la revue adopte la forme PCC. La population est celle des textes académiques d’étudiants de l’enseignement supérieur et, comme transfert, d’autres écrits académiques déjà éprouvés avec des détecteurs. Le concept est la classification automatique de l’auctorialité humaine face à l’auctorialité générée. Le contexte est l’évaluation et les procédures d’intégrité. « Les détecteurs fonctionnent-ils ? » mélange des produits, des unités et des définitions de l’erreur que les études ne partagent pas. La question qui organise l’article est celle de savoir ce qu’un score peut prouver lorsqu’il faut trancher un cas.
La thèse est restrictive. Sous contrôle, l’exactitude s’est améliorée et, dans les textes entiers, plusieurs faux positifs sont devenus rares ; l’incohérence, la chute face à la paraphrase, la difficulté avec les hybrides et un biais possible envers les scripteurs non natifs persistent. Le score ouvre une conversation et ne clôt pas un dossier. Ce qui suit marque chaque affirmation comme constat empirique, cadre conceptuel ou inférence de conception.
2. Contexte : trois vagues d’études sur les détecteurs
Il n’y a pas une ligne droite, mais trois vagues : celle de 2023 demande si l’on distingue le texte humain du texte généré ; la deuxième s’attache au biais et au contournement ; celle de 2025-2026 revient sur les produits commerciaux et sur le texte hybride, humanisé ou édité. Il ne faut pas confondre deux plans. L’exactitude de benchmark est une fréquence à provenance connue. La valeur probatoire est ce qu’un score autorise à dire d’une personne, sans cette vérité et avec une conséquence. Un excellent banc d’essai peut ne pas être la preuve d’une violation.
Weber-Wulff et al. (2023) testent 12 outils publics plus Turnitin et PlagiarismCheck, et demandent s’ils séparent le texte humain de celui de ChatGPT et si la traduction automatique et l’obfuscation altèrent la détection. Le constat : ils ne sont ni exacts ni fiables, ils biaisent vers le jugement « humain » et se dégradent avec l’obfuscation. Elkhatat et al. (2023), avec quinze paragraphes du modèle 3.5 et quinze du modèle 4 sur les tours de refroidissement, cinq témoins et les outils OpenAI, Writer, Copyleaks, GPTZero et CrossPlag, réussissent mieux sur le 3.5 que sur le 4 et produisent des faux positifs ainsi qu’une incertitude sur l’humain. Walters (2023), avec 16 détecteurs et trois groupes de 42 essais, trouve une exactitude élevée de Copyleaks, Turnitin et Originality.ai, et l’échec de la majorité des 13 autres face au modèle 4 ; le paiement n’améliore que peu. Dalalah et Dalalah (2023) n’entrent que par le titre, sans résumé ni résultat.
La deuxième vague change de question. Liang et al. (2023) rapportent, comme constat empirique, que les détecteurs classent fréquemment comme générée l’écriture non native de l’anglais, avec un risque de la marginaliser dans l’évaluation. Le résumé n’apporte pas de taux reproductible. Perkins et al. (2024b) confrontent six détecteurs à un contenu modifié pour contourner la détection (n = 805) et trouvent une chute d’exactitude de 17,4 % face à des techniques simples. Ils concluent qu’on ne peut pas les recommander pour déterminer des violations, à cause de l’exactitude et du risque d’accusation fausse, bien qu’ils puissent soutenir l’apprentissage si l’usage n’est pas punitif.
Van Vlasselaer et al. (2026), Malik et Amjad (2025) et Hyatt et al. (2025) mesurent de nouveau l’exactitude sur un texte qui n’est plus pur ; les chiffres viennent ensuite, et non comme un slogan. Barrot et Aranda (2025) n’entrent que par le titre, sans résumé : distinguer ce qui est produit par l’étudiant, ce qui est édité et ce qui est généré. Comme inférence de lecture, et non comme méta-analyse, aucun dispositif n’observe à la fois la provenance, l’autorisation, la compréhension et la conséquence.
3. Méthode : revue critique PRISMA-lite avec lecture probatoire
C’est une synthèse narrative, non une méta-analyse : il n’existe pas d’unité commune de texte, de modèle ni de seuil. Le 9 octobre 2026, l’API REST de Crossref a été consultée, sans Scopus, Web of Science, ERIC ni PsycInfo : 16 requêtes de 60 lignes, articles de revue depuis 2021. De 960 notices, 892 sont restées après dédoublonnage. L’éligibilité demandait des auteurs, une année, un terme d’IA générative dans le titre et un autre de détection, d’intégrité ou d’écriture, et écartait l’image, le deepfake, le code, l’audio ou la vidéo et la désinformation. Les exclusions — 45, 292, 101 et 17 — et les 437 éligibles figurent dans le Tableau 1.
| Étape | Notices | Critère appliqué |
|---|---|---|
| Identification dans l’API REST de Crossref | 960 | 16 requêtes, 60 lignes ; article de revue ; publication depuis 2021 |
| Après dédoublonnage | 892 | Notices répétées entre requêtes éliminées |
| Exclusion automatique : sans auteurs | 45 | Sans auctorialité enregistrée |
| Exclusion automatique : sans terme d’IA générative dans le titre | 292 | Le titre ne nomme pas l’IA générative, un LLM, ChatGPT ou le texte généré |
| Exclusion automatique : sans terme d’intégrité, de détection ou d’écriture | 101 | Ni le titre ni la revue ne situent la détection, l’intégrité, le plagiat, l’évaluation, l’écriture ou les étudiants |
| Exclusion automatique : autre modalité | 17 | Image, code, audio ou vidéo, désinformation |
| Éligibles pour le tri | 437 | Résultat du filtre automatique |
| Exclus lors du tri manuel | 414 | Titre et résumé, selon les critères déclarés dans le texte |
| Inclus depuis l’amorçage | 23 | Tri de l’ensemble éligible |
| Inclus par recherche ciblée | 1 | Perkins et al. (2024b), vérifié dans Crossref le 9 octobre 2026 |
| Corpus inclus | 24 | 20 avec résumé via Crossref, OpenAlex ou Semantic Scholar ; 4 avec le titre seul |
Le tri manuel, en une seule passe et sans double tri, a exclu 414 des 437 : corrections et errata, prépublications en double, actes de colloque, revues sans évaluation par les pairs vérifiable ou d’indexation douteuse, adoption sans intégrité ni détection, classifieurs sans écriture étudiante et opinion sans argument. Il en est resté 23 issus de l’amorçage, plus Perkins et al. (2024b) par recherche ciblée et vérification dans Crossref. Ce sont 24 sources : 20 avec résumé et 4 avec le titre seul — Jiang et al. (2024), Dalalah et Dalalah (2023), Barrot et Aranda (2025) et Zhang et Lv (2026). Il n’y a pas eu d’outil formel de risque de biais.
La lecture probatoire pose trois questions : quel texte est entré — humain, intégralement généré, édité, hybride ou humanisé — ou si le travail est un cadre, des voix ou une politique ; quelle erreur le résumé déclare, sans inventer un pourcentage ; et si cela suffit pour un cas individuel. Cela ne suffit pas lorsque la vérité est fabriquée, et encore moins lorsque le fonds réel ne la possède pas. Aucune étude n’observe à la fois l’autorisation, la compréhension et la conséquence. La santé comportementale et les admissions entrent comme transfert, non comme tâche de cours.
4. Exactitude sous contrôle : ce qui a changé entre 2023 et 2026
Le Tableau 2 rassemble les études dont le résumé récupéré fait état d’une performance. Ce n’est pas un classement : les lignes ne partagent ni la longueur, ni le modèle, ni l’année, ni la définition de la réussite. On les lit comme des dispositifs, et l’interprétation sépare cette exactitude de la valeur probatoire.
| Étude | Outils | Textes évalués | Ce qui est rapporté (selon le résumé) |
|---|---|---|---|
| Weber-Wulff et al. (2023) | 12 publics, plus Turnitin et PlagiarismCheck | Texte humain et de ChatGPT ; aussi traduction automatique et obfuscation | Ni exacts ni fiables. Biais vers le classement comme texte humain. L’obfuscation dégrade la performance de manière significative |
| Elkhatat et al. (2023) | OpenAI, Writer, Copyleaks, GPTZero et CrossPlag | 15 paragraphes du modèle 3.5, 15 du modèle 4 et 5 témoins humains | Plus d’exactitude avec le modèle 3.5 qu’avec le 4. Faux positifs et classements incertains dans les témoins humains |
| Walters (2023) | 16 détecteurs ; se distinguent Copyleaks, Turnitin et Originality.ai | 42 essais de ChatGPT-3.5, 42 de ChatGPT-4 et 42 humains sans IA | Ces trois-là, exactitude élevée sur les trois ensembles. La majorité des 13 autres échoue face au modèle 4. Le paiement n’améliore que légèrement |
| Gosling et al. (2024) | Détecteur d’IA associé à Turnitin | 160 réponses étudiantes et 160 de ChatGPT, avec 16 prompts | Scores du texte généré significativement plus élevés. Les scores humains, tous à zéro |
| Malik et Amjad (2025) | Turnitin, ZeroGPT, GPTZero et Writer AI | ChatGPT, Perplexity et Gemini, en original et après Grammarly, Quillbot et édition humaine de 10 % à 20 % | Turnitin, le plus exact et le plus consistant, avec un score d’IA de 100 % même avec des techniques adversariales. Quillbot affecte surtout ZeroGPT, GPTZero et Writer AI. Le même modèle et le même outil donnent des scores distincts selon le fichier. Perplexity se détecte mieux ; Gemini obtient un score plus bas |
| Van Vlasselaer et al. (2026) | GPTZero, Pangram, Copyleaks et Turnitin | 160 documents synthétiques à vérité connue (humain, IA, hybride et humanisé) et 1163 thèses de master de 2024-2025 sans vérité connue | Pangram est supérieur sur l’IA pure, hybride et humanisée. Les autres sous-estiment, surtout avec le modèle le plus avancé. Toutes réussissent le texte humain. Faux positifs rares. Dans les thèses, Pangram marque 45,5 %, en général à des niveaux bas ou modérés |
| Popkov et Barrett (2025) | Un détecteur gratuit et Originality.AI | 100 articles humains de 2016-2018 et 200 textes de chatbot (100 de ChatGPT et 100 de Claude) | Faux positifs et faux négatifs problématiques, payants ou gratuits. Médiane de 27,2 % du texte humain marqué comme IA par le détecteur gratuit. Originality.AI réussit mieux et reste limité face à Claude |
| Zhao et al. (2024) | Modèles spécifiques de domaine, non un détecteur universel | 3755 lettres de recommandation et 1973 déclarations d’intention de cycles supérieurs de Fordham, avec des contreparties de GPT-3.5 Turbo | Un détecteur général et universel semble hors de portée actuelle. Des modèles spécialisés peuvent atteindre une exactitude élevée sur ce matériel d’admission |
| Hyatt et al. (2025) | Détecteurs en ligne, seuls et par consensus | Écriture d’étudiants STEM, humaine et générée | Chaque détecteur varie. Ensemble, ils informent lorsque l’intuition humaine échoue. Le consensus réduit les faux positifs presque à zéro |
L’amélioration, comme constat empirique, est réelle et n’est pas linéaire. Weber-Wulff et al. (2023) ne décrivent ni le zéro de Gosling et al. (2024), ni les 100 % de Turnitin chez Malik et Amjad (2025), ni les faux positifs rares de Van Vlasselaer et al. (2026), ni le consensus de Hyatt et al. (2025). Un détecteur singulier n’est pas non plus de mise : Walters (2023) a opposé trois outils capables à une majorité des treize autres, inefficace face au modèle 4. Le faux positif n’est pas clos. Malik et Amjad (2025) voient des scores distincts dans des fichiers du même modèle. Popkov et Barrett (2025), dans des revues de santé comportementale, trouvent une médiane de 27,2 % de texte humain marqué par un détecteur gratuit et un Originality.AI meilleur, limité face à Claude. Zhao et al. (2024) obtiennent une exactitude élevée avec des modèles de domaine — 3755 lettres et 1973 déclarations, contreparties de GPT-3.5 Turbo — et laissent hors de portée un détecteur universel. Cela reste un benchmark.
La limite est de conception. Sauf les 1163 thèses, il y a une vérité connue, mais l’on n’observe ni la consigne ni la compréhension. Pangram marque 45,5 % de ces thèses, à des niveaux en général bas ou modérés, sans vérité connue : ce sont des drapeaux, non une prévalence. L’inférence de conception est que mieux classer un texte pur ne tranche pas un cas. Le score mesure une ressemblance ; la violation unit la personne, la consigne et la compréhension.
5. Faux positifs, scripteurs non natifs et taux de base
L’équité n’est pas un appendice de l’exactitude. Liang et al. (2023) documentent, comme constat empirique, que les détecteurs classent fréquemment comme générée l’écriture non native de l’anglais, avec un risque de marginaliser ces scripteurs. Le résumé ne donne pas de chiffre reproductible. Cela interdit néanmoins de lire « faux positif rare » comme si l’erreur était bien répartie : rare dans l’agrégat peut être fréquent chez qui écrit dans une langue qui n’est pas la première.
Jiang et al. (2024) formulent la question là où il importerait le plus de la clore : savoir si, en détectant des essais de ChatGPT dans une évaluation d’écriture à grande échelle, il y a un biais contre les locuteurs non natifs de l’anglais. Il n’y a pas eu de résumé. Leur attribuer un oui ou un non serait inventer un constat. Le titre maintient le débat ouvert. Le silence ne réfute pas Liang et al. (2023) et ne le confirme pas non plus.
Il existe une contre-preuve, et elle ne dissout pas le problème. Gosling et al. (2024) laissent à zéro les 160 textes humains. Van Vlasselaer et al. (2026) voient une réussite sur le texte entièrement humain et des faux positifs rares, avec une amélioration par rapport aux études antérieures. Cela empêche de dire que tout détecteur marque trop. Cela n’annule pas Liang et al. (2023) : ces résumés ne séparent pas la prose native et la prose non native. Popkov et Barrett (2025), avec une médiane de 27,2 % dans des articles de 2016-2018, montrent que « rare » dépend de l’outil, du genre et de l’année. Les données sont en tension.
L’exemple montre le taux de base, non une université. Avec un faux positif bas, la majorité non générée produit des innocents dont le score ne se distingue pas de la réussite, et personne n’indique quelle marque compte parmi les 9,5. Sanctionner d’après le nombre les atteint. Les 45,5 % de Van Vlasselaer et al. (2026) ne sont pas les 5 % de l’hypothèse, et le presque zéro de Hyatt et al. (2025) ne met pas non plus un nom sur le cas. L’inférence de conception : le nombre ouvre la révision et ne la clôt pas, d’autant plus si l’erreur pèse sur les scripteurs non natifs (Liang et al., 2023).
6. Contournement, textes hybrides et frontière mouvante de l’auctorialité
Un détecteur peut réussir contre le texte semblable à son entraînement et échouer contre celui que l’on modifie en quelques minutes. Perkins et al. (2024b) le mesurent : six détecteurs, n = 805 et une chute de 17,4 % face à des techniques simples, avec le refus déjà cité de les employer pour déterminer des violations et l’ouverture à un usage non punitif. Weber-Wulff et al. (2023) avaient placé la même fragilité en s’interrogeant sur la traduction automatique et l’obfuscation, et en concluant que l’obfuscation dégrade la performance à l’intérieur d’un verdict de manque d’exactitude et de fiabilité. Le contournement n’est pas un constat tardif.
Malik et Amjad (2025) laissent Turnitin à 100 % après Grammarly, Quillbot et une édition de 10 % à 20 % ; ZeroGPT, GPTZero et Writer AI chutent surtout avec Quillbot, et Gemini obtient un score plus bas que Perplexity. Le même modèle et le même outil ne donnent pas le même nombre dans des fichiers distincts. Sur 160 documents, Van Vlasselaer et al. (2026) incluent l’hybride — des passages générés à l’intérieur d’un texte humain — et l’humanisé — réécrit avec un prompt pour paraître étudiant — : Pangram maintient l’exactitude et les trois autres sous-estiment, surtout avec le modèle le plus avancé. Ce faux négatif ne s’efface pas parce qu’un outil, dans ce banc, voit bien le mélange.
Barrot et Aranda (2025) n’apportent pas de résultat ; leur objet nomme trois classes qu’un pourcentage écrase : produit par l’étudiant, édité avec l’IA et généré. Wright (2026), dans une analyse de politique et non d’exactitude, soutient que depuis 2023 beaucoup de normes ne séparent pas la génération du contenu évalué d’usages non génératifs — reconnaissance optique, voix vers texte, reconnaissance de l’écriture. Selon ce qu’il rapporte, 94 % des 50 principales universités des États-Unis disposaient de guides à l’intention du corps enseignant. Avoir un guide n’est pas distinguer la transcription de la génération.
L’inférence de conception est que l’auctorialité n’est déjà plus binaire. L’hybride, les trois classes de l’objet de Barrot et Aranda (2025) et la distinction de Wright (2026) entre génération et simple conversion de format montrent plus de deux composantes. Lire le pourcentage comme l’une de deux cases impose au dossier une ontologie que cette littérature abandonne. Le score, lorsqu’il dit quelque chose, dit une ressemblance : il ne dit pas qui a décidé, avec quelle autorisation et avec quelle compréhension.
7. Le jugement enseignant face au score
Si le logiciel ne clôt pas le cas, il reste l’œil de qui note. Perkins et al. (2024a) l’éprouvent avec 22 soumissions de ChatGPT conçues pour rendre la détection difficile et avec 15 enseignants, à côté de soumissions authentiques. Le constat empirique coupe court à l’optimisme : Turnitin marque 91 % des soumissions, mais seulement 54,8 % du contenu ; le personnel signale 54,5 % à la procédure ; les moyennes sont de 52,3 et 54,4. La marque du document, la couverture du texte et la note ne sont pas le même fait, et près de la moitié du matériel expérimental n’arrive pas au dossier.
Ni l’œil ni le logiciel ne sont l’étalon-or. Hyatt et al. (2025) montrent que, dans l’agrégat, les détecteurs avertissent lorsque l’intuition échoue et que le consensus réduit les faux positifs presque à zéro. Guan et Han (2025), avec n = 156 étudiants STEM en deux groupes — avec modèle de langage ou écriture indépendante —, évaluent un détecteur et une enquête de conscience éthique. Le résumé ne donne ni chiffres d’exactitude ni chiffres d’enquête. Le constat est la limitation de ces outils dans le cours d’écriture, où le style s’apprend et où un classifieur peut confondre apprentissage et substitution.
L’inférence de conception est que ni l’œil ni le programme, seuls, ne soutiennent une détermination. La discordance entre la marque, la couverture du texte et le signalement enseignant est un motif d’interroger, non un ex aequo que l’on rompt en faveur de la sanction. Le consensus aide là où l’intuition échoue et ne connaît pas la consigne (Hyatt et al., 2025 ; Guan et Han, 2025).
8. De détecter à valider : auctorialité épistémique et soutenance orale
Ebrahimzadeh et al. (2026) changent l’unité. Comme cadre de validité, ils demandent ce qui se passe si, sans surveillance, l’on remet un texte généré que l’on ne comprend pas. L’intégrité de coauctorialité, qu’ils proposent comme source de preuve de validité, est violée dans cet acte. Le développement est un prototype, « AI Viva » : soutenance orale et questions de compréhension, avec une rétroaction quantitative et dialogique. La validation est préliminaire et d’experts, non un essai de cohorte. Le tournant — de la chasse au fichier vers la vérification de la propriété épistémique — est pris ici comme cadre, non comme efficacité démontrée.
Hutson et al. (2026) mesurent ce tournant dans un pilote. Integrevise apparie l’écrit à une viva brève : il ne détecte ni ne note. Dans une université privée d’arts libéraux du Midwest, l’automne 2025 et le printemps 2026 sont des cycles distincts, non une cohorte, et les données sont préliminaires. Il y a eu 52 vivas. Sur sept répondants, 14,3 % ont convenu que l’oralité aidait à penser plus à fond et 57,1 % étaient en désaccord. Dans 20 vivas sur 52, soit 38,5 %, il n’y a pas eu de commentaires. Le qualitatif suggère des lacunes que l’écrit ne montre pas. Ils demandent de poursuivre la recherche, non de clore une politique.
L’alternative a elle aussi un coût, et ses données sont faibles. Les 57,1 % de désaccord face aux 14,3 % d’accord, sur sept voix, avertissent que la soutenance orale peut ne pas être vécue comme une façon de penser plus à fond et peut devenir un second examen. Perkins et al. (2024a) recommandent moins de tâches imitables par un outil, ou des évaluations qui incluent l’IA, et davantage de formation. Cela est cohérent avec le cadre d’Ebrahimzadeh et al. (2026) et ce n’est pas une efficacité démontrée. L’inférence de conception est modeste : vérifier la compréhension répond à ce que le score ne nomme pas, et c’est aujourd’hui une hypothèse, non une amélioration automatique.
9. Politique institutionnelle : finalité, proportionnalité et procédure équitable
Taylor et LaCroix (2026), comme cadre conceptuel, soutiennent que savoir si l’usage de l’IA générative est une inconduite dépend de la finalité de l’université. Ils lisent l’augmentation apparente des cas comme une incohérence — enthousiasme technologique, influence des entreprises et norme qui poussent dans des sens différents — dans laquelle l’étudiant rend des comptes pour des conduites que l’institution a façonnées. L’analyse des déclarations de mission trouve un écart entre l’idéal et la pratique. Sans aligner mission, pédagogie et technologie, il n’y a pas d’exigence crédible d’intégrité, et un détecteur hérite de cette incohérence.
Ying (2026) apporte le constat d’une revue de portée de 38 études empiriques. Il existe une zone grise éthique : l’étudiant n’est ni un récepteur passif ni un contrevenant sans frein, mais un agent qui interprète l’usage licite. Il y a en même temps un écart entre la conscience et la pratique, et des rationalisations de cet écart. Les voix dépendent de facteurs démographiques, psychologiques et contextuels. Comme lecture de ce constat, une politique unique reste courte : sanctionner la zone grise sans l’entendre punit des négociations que les étudiants vivent comme ambiguës.
Zhang et Lv (2026) n’entrent que par le titre : un commentaire, sans résumé, selon lequel la détection peut saper l’intégrité. Il n’y a pas de donnée à leur attribuer. L’énoncé alerte dans le sens du risque d’accusation fausse (Perkins et al., 2024b) et du biais (Liang et al., 2023). Birks et Clare (2023) relient l’inconduite facilitée par l’IA à des cadres de prévention déjà employés pour l’inconduite classique : la réponse commence par l’occasion et la consigne, non par le châtiment. La prévention situationnelle est ici une inférence de conception, non un constat mesuré par eux.
Il n’en sort pas une norme validée, mais une inférence de conception. Le score n’est pas une preuve unique. La personne marquée peut expliquer les versions, le format, la transcription, l’édition, l’aide et la consigne qu’elle a crue en vigueur. Le registre des versions, si la tâche est une tâche de processus, se prévoit dans l’évaluation et ne s’improvise pas après le soupçon. La conversation précède la sanction et celle-ci, si elle survient, répond à la compréhension, à l’autorisation, au processus et au texte. Cet ensemble n’est pas mis à l’épreuve dans les 24 études. L’appeler bonne pratique avérée excéderait le corpus.
L’inférence pour les universités mexicaines et latino-américaines est de transfert : il n’y a pas de donnée et l’on n’invoque aucune norme. Aucune source n’évalue de détecteurs en espagnol, et le Tableau 2 décrit des textes en anglais, alors que dans la région l’on écrit en espagnol et, en cycle supérieur, souvent en anglais comme langue seconde. Transposer le seuil importe le biais de Liang et al. (2023) sur un terrain non mesuré ; Jiang et al. (2024) laissent la question ouverte même en anglais. Cela n’autorise ni l’enthousiasme ni l’interdiction. Le pourcentage ne voyage pas seul jusqu’à la sanction.
10. Discussion : un indice n’est pas une preuve
Un score dépend de l’année, du produit, du modèle et du fait que le texte soit pur, édité, hybride ou humanisé. En laboratoire, avec une vérité connue, certains produits réussissent et d’autres marquent de la prose humaine ou sous-estiment la prose générée. Dans le dossier manquent la vérité et souvent le processus, et la conséquence est de trop. L’indice est une raison de ne pas classer le doute ; la preuve serait une raison suffisante d’une violation. Le score n’y parvient pas. La Figure 1, schéma inféré et non protocole évalué, ordonne le passage afin que la décision ne saute pas du pourcentage à la sanction. Chaque échelon répond à une question que le précédent ne tranche pas.
| Échelon | Question à laquelle il répond | Données du corpus | Usage défendable (hypothèse de conception) |
|---|---|---|---|
| Score du détecteur | Le texte ressemble-t-il, selon l’outil, à une classe générée ? | Amélioration sur texte pur et faux positifs rares dans des dispositifs récents ; échecs de 2023 et incohérence entre fichiers (Gosling et al., 2024 ; Van Vlasselaer et al., 2026 ; Hyatt et al., 2025 ; Weber-Wulff et al., 2023 ; Malik et Amjad, 2025) | Ouvrir une révision. Ne pas déterminer la violation |
| Contraste avec l’historique et les brouillons | Le texte s’accorde-t-il avec la trajectoire d’écriture et avec les versions de la tâche ? | Les bancs d’essai jugent le texte clos, presque toujours avec une vérité fabriquée (Walters, 2023 ; Zhao et al., 2024). Wright (2026) sépare la conversion de format de la génération | Demander une explication de processus avant de lire le score comme une substitution de l’auctorialité |
| Conversation avec l’étudiant | Peut-il rendre compte des décisions du texte et de l’autorisation qu’il a cru avoir ? | Zone grise et agentivité étudiante (Ying, 2026). Le personnel a signalé 54,5 % des soumissions expérimentales (Perkins et al., 2024a) | Entendre l’explication avant toute sanction |
| Vérification de la compréhension ou soutenance orale | Comprend-il et peut-il soutenir ce qu’il a mis sous son nom ? | L’intégrité de coauctorialité est violée lorsqu’on remet ce que l’on ne comprend pas ; la viva reçoit une validation experte préliminaire (Ebrahimzadeh et al., 2026). Pilote mixte : 14,3 % d’accord et 57,1 % en désaccord, avec sept répondants (Hutson et al., 2026) | Vérifier l’auctorialité épistémique sans tenir la soutenance orale pour efficace |
| Décision proportionnée | Quelle réponse convient à la finalité formative et au doute qui demeure ? | L’inconduite dépend de la finalité (Taylor et LaCroix, 2026). La prévention précède la sanction (Birks et Clare, 2023). La détection peut nuire à l’intégrité (objet de Zhang et Lv, 2026) | Sanctionner seulement si l’ensemble soutient la violation. Le score isolé ne suffit pas |
Si la tâche interdisait de générer, ignorer un score élevé serait aussi peu sérieux que de lui obéir, et Gosling et al. (2024) avertissent que la voie technique ne suffit pas. Les échelons suivants couvrent l’histoire que le texte ne raconte pas (Wright, 2026), le signalement instable (Perkins et al., 2024a), la norme que l’étudiant interprète déjà (Ying, 2026), la vérification encore privée d’efficacité démontrée (Ebrahimzadeh et al., 2026 ; Hutson et al., 2026) et la finalité qui définit la faute (Taylor et LaCroix, 2026). Sanctionner sur le seul indice réalise le risque qu’énoncent Zhang et Lv (2026).
Un indice n’est pas une preuve, pour quatre raisons. Le benchmark a une vérité connue et le cas n’en a pas ; même en 2023, l’exactitude n’était pas uniforme (Elkhatat et al., 2023 ; Walters, 2023). Le taux de base marque des innocents et le score ne dit pas lequel l’est. La paraphrase, l’hybride et la transcription font que le même pourcentage couvre des faits distincts. Certifier un apprentissage exige que la personne soutienne le travail. Rien n’oblige à éteindre les détecteurs ; il faut, en revanche, que le nombre ne soit pas le dernier mot. Cotton et al. (2024), comme cadre, demandaient plus d’une méthode, et l’échelle ne feint pas que chaque échelon soit mesuré.
11. Limites
Le corpus est seulement celui de Crossref : Scopus, Web of Science, ERIC et PsycInfo n’y sont pas entrés, et la prédominance anglophone est celle de ce qui a été récupéré, non celle de la lecture. La généralisation au Mexique et à l’Amérique latine est inférentielle, et aucune source n’évalue de détecteurs en espagnol. Les outils vont plus vite que la revue : se servir de Weber-Wulff et al. (2023) ou d’Elkhatat et al. (2023), qui évaluent des générations telles que GPT-3.5 et GPT-4, pour décrire un produit de 2026 serait aussi erroné que se servir de Van Vlasselaer et al. (2026) pour réhabiliter le parc de 2023. Le Tableau 2 est une série de fenêtres, non une fiche en vigueur.
Les ensembles synthétiques permettent l’exactitude ; les 1163 thèses, sans vérité connue, permettent de décrire des drapeaux et non de les vérifier. Quatre sources n’entrent qu’avec le titre — Jiang et al. (2024), Dalalah et Dalalah (2023), Barrot et Aranda (2025) et le commentaire de Zhang et Lv (2026) — et rien de ce qui est dit n’excède cet objet. Il n’y a eu ni double tri ni outil de risque de biais. La santé comportementale et les admissions sont un transfert, non la salle de cours d’un premier cycle. La synthèse renonce à un chiffre unique d’exactitude du champ : avec ces dispositifs, il serait plus précis dans la forme que dans la signification.
12. Conclusions
La question qui demeure n’est pas de savoir si, sur des textes purs, un détecteur sépare l’humain du généré : certains le peuvent, et d’autres cessent de le pouvoir si changent le modèle, la paraphrase ou l’hybride. La question est de savoir ce qu’une université fait du nombre lorsqu’il désigne une personne. La réponse du corpus est étroite. Le nombre est un indice : il ouvre une révision, il ne déclare pas la violation, il ne désigne pas l’innocent et il ne certifie pas que celui qui remet comprenne ce qui est remis.
Il y a une amélioration sous contrôle qu’il serait déloyal de nier, et il y a en même temps une instabilité d’un fichier à l’autre, une fragilité face à l’hybride et à la paraphrase, des marques sur la prose non native et, hors de la salle de cours, du texte humain signalé par des détecteurs qui, dans d’autres dispositifs, n’échouent presque pas. Ne citer que l’amélioration, c’est vendre un produit. Ne citer que l’échec, c’est nier l’amélioration. Aucune des deux séries ne convertit le benchmark en preuve d’un dossier.
Qui note ne corrige pas ce champ à soi seul : dans les soumissions conçues pour échapper à la détection, la marque, la couverture et le signalement n’ont pas coïncidé, et les notes sont restées presque égales. Vérifier que la personne soutient ce qu’elle signe est cohérent avec le dommage qui importe, et cette vérification arrive avec des données faibles — un prototype d’experts et un pilote de perceptions mixtes. La recommander est une inférence de conception. La tenir pour une solution déjà évaluée répéterait le raccourci du détecteur qui « fonctionne déjà ».
Sans finalité, le détecteur surveille des conduites que l’institution aide à produire (Ying, 2026). Que le score ne soit pas une preuve unique, que le processus puisse s’expliquer et que la conversation précède la sanction est une condition de conception, non une loi du corpus. Au Mexique et en Amérique latine, cela pèse davantage par manque de donnée : un seuil d’anglais, appliqué à l’espagnol ou à l’anglais comme langue seconde, répète un biais qui n’a pas été mesuré. Si l’indice ne survit pas au processus et à l’explication, il n’y a pas de sanction attribuée au nombre.
Laboratoire éditorial de NEXTECH.IA / Ingeniero Mitre
Références
- Barrot, J. S., & Aranda, M. R. R. (2025). Efficacy of AI-Text Detection Tools in Distinguishing Student-Produced, AI-Edited, and AI-Generated Essays. Technology, Knowledge and Learning. https://doi.org/10.1007/s10758-025-09884-0
- Birks, D., & Clare, J. (2023). Linking artificial intelligence facilitated academic misconduct to existing prevention frameworks. International Journal for Educational Integrity, 19(1), Article 20. https://doi.org/10.1007/s40979-023-00142-3
- Cotton, D. R. E., Cotton, P. A., & Shipway, J. R. (2024). Chatting and cheating: Ensuring academic integrity in the era of ChatGPT. Innovations in Education and Teaching International, 61(2), 228–239. https://doi.org/10.1080/14703297.2023.2190148
- Dalalah, D., & Dalalah, O. M. A. (2023). The false positives and false negatives of generative AI detection tools in education and academic research: The case of ChatGPT. The International Journal of Management Education, 21(2), 100822. https://doi.org/10.1016/j.ijme.2023.100822
- Ebrahimzadeh, M., Shibani, A., & Shum, S. B. (2026). Coauthorship integrity: Reconceptualising assessment validity for the age of generative artificial intelligence. Computers and Education: Artificial Intelligence, 10, 100609. https://doi.org/10.1016/j.caeai.2026.100609
- Elkhatat, A. M., Elsaid, K., & Almeer, S. (2023). Evaluating the efficacy of AI content detection tools in differentiating between human and AI-generated text. International Journal for Educational Integrity, 19(1), Article 17. https://doi.org/10.1007/s40979-023-00140-5
- Gosling, S. D., Ybarra, K., & Angulo, S. K. (2024). A widely used Generative-AI detector yields zero false positives. Aloma: Revista de Psicologia, Ciències de l'Educació i de l'Esport, 42(2), 31–43. https://doi.org/10.51698/aloma.2024.42.2.31-43
- Guan, Q., & Han, Y. (2025). From AI to authorship: Exploring the use of LLM detection tools for calling on “originality” of students in academic environments. Innovations in Education and Teaching International, 62(5), 1514–1528. https://doi.org/10.1080/14703297.2025.2511062
- Hutson, J., Poyer, K., Ogoe, E., & Atologun, K. A. (2026). Beyond AI Detection: A Pilot Study of IntegreviseTM and Viva-Based Verification of Student Understanding in AI-Mediated Assessment. Trends in Higher Education, 5(3), 59. https://doi.org/10.3390/higheredu5030059
- Hyatt, J.-P. K., Bienenstock, E. J., Firetto, C. M., Woods, E. R., & Comus, R. C. (2025). Using aggregated AI detector outcomes to eliminate false positives in STEM-student writing. Advances in Physiology Education, 49(2), 486–495. https://doi.org/10.1152/advan.00235.2024
- Jiang, Y., Hao, J., Fauss, M., & Li, C. (2024). Detecting ChatGPT-generated essays in a large-scale writing assessment: Is there a bias against non-native English speakers? Computers & Education, 217, 105070. https://doi.org/10.1016/j.compedu.2024.105070
- Liang, W., Yuksekgonul, M., Mao, Y., Wu, E., & Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7), 100779. https://doi.org/10.1016/j.patter.2023.100779
- Malik, M. A., & Amjad, A. I. (2025). AI vs AI: How effective are Turnitin, ZeroGPT, GPTZero, and Writer AI in detecting text generated by ChatGPT, Perplexity, and Gemini? Journal of Applied Learning and Teaching, 8(1), 91–101. https://doi.org/10.37074/jalt.2025.8.1.9
- Perkins, M., Roe, J., Postma, D., McGaughran, J., & Hickerson, D. (2024a). Detection of GPT-4 Generated Text in Higher Education: Combining Academic Judgement and Software to Identify Generative AI Tool Misuse. Journal of Academic Ethics, 22(1), 89–113. https://doi.org/10.1007/s10805-023-09492-6
- Perkins, M., Roe, J., Vu, B. H., Postma, D., Hickerson, D., McGaughran, J., & Khuat, H. Q. (2024b). Simple techniques to bypass GenAI text detectors: implications for inclusive education. International Journal of Educational Technology in Higher Education, 21(1), Article 53. https://doi.org/10.1186/s41239-024-00487-w
- Popkov, A. A., & Barrett, T. S. (2025). AI vs academia: Experimental study on AI text detectors’ accuracy in behavioral health academic writing. Accountability in Research, 32(7), 1072–1088. https://doi.org/10.1080/08989621.2024.2331757
- Taylor, T. B., & LaCroix, T. (2026). Purpose before policy: academic integrity, generative AI, and rhetorical stance. Higher Education. https://doi.org/10.1007/s10734-026-01706-1
- Van Vlasselaer, M., Van Droogenbroeck, F., & Spruyt, B. (2026). Who wrote this? Evaluating the reliability of AI detection tools in higher education. International Journal for Educational Integrity, 22(1), Article 16. https://doi.org/10.1007/s40979-026-00226-w
- Walters, W. H. (2023). The Effectiveness of Software Designed to Detect AI-Generated Writing: A Comparison of 16 AI Text Detectors. Open Information Science, 7(1), Article 20220158. https://doi.org/10.1515/opis-2022-0158
- Weber-Wulff, D., Anohina-Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero-Dib, J., Popoola, O., Šigut, P., & Waddington, L. (2023). Testing of detection tools for AI-generated text. International Journal for Educational Integrity, 19(1), Article 26. https://doi.org/10.1007/s40979-023-00146-z
- Wright, C. (2026). Transcription is not generation: distinguishing non-generative AI tool use from academic misconduct in higher education assessment. International Journal for Educational Integrity, 22(1), Article 24. https://doi.org/10.1007/s40979-026-00234-w
- Ying, J. (2026). Academic Integrity in the Age of Generative AI: a Scoping Review of Research on Higher Education Student Voices. Journal of Academic Ethics, 24(3), Article 78. https://doi.org/10.1007/s10805-026-09752-1
- Zhang, S., & Lv, X. (2026). AI detection risks undermining academic integrity. Nature Human Behaviour, 10(8), 1395–1396. https://doi.org/10.1038/s41562-026-02528-y
- Zhao, Y., Borelli, A., Martinez, F., Xue, H., & Weiss, G. M. (2024). Admissions in the age of AI: detecting AI-generated application materials in higher education. Scientific Reports, 14(1), Article 26411. https://doi.org/10.1038/s41598-024-77847-z