1. Introduction et problème

Avant la sonnerie, dans un cours d’histoire du secondaire, l’écran assemble trois objets. Un chat répond sur un épisode du passé avec le ton d’une leçon. En marge, un score de confiance du modèle. Dessous, un plan déjà séquencé pour l’heure suivante. Le contrat appelle l’ensemble agent autonome et laisse à l’enseignant un bouton d’acceptation. La scène n’est pas une donnée de terrain de cet article : c’est le plafond d’exhibition que le marché traite déjà comme un appui. Rien n’est écrit, avant l’usage, sur ce qui compte comme réponse acceptable. Il n’y a pas de trace pour lire le cadrage. Il n’y a pas de garantie d’arrêter l’explication si l’attribution de responsabilité est fausse. Il n’y a pas de nom pour qui répond, ni de seuil où la décision revient à une personne.

La thèse ne tient pas dans le titre court. Ces quatre objets ne constituent pas un appui professionnel si le protocole de supervision manque. Le métier est le jugement qui délègue, corrige ou arrête. Fisher (2024) soutient, comme thèse philosophique et non comme essai de classe, qu’un modèle peut émettre un contenu propositionnel devant une question de fait sans en avoir évalué la vérité : la fluidité n’est pas une norme de véracité. Papaioannou (2026) montre, dans une étude qualitative comparée sur 1922 en Asie Mineure, que la langue du prompt s’associe à la terminologie, à l’attribution de responsabilité et au cadrage historiographique. Statut : argument dans un cas, constat empirique de cadrage dans l’autre. Aucun ne prouve qu’un chat « enseigne déjà ». Ils demandent autre chose : si l’on a délégué un acte enseignant ou si l’on a exhibé une surface qui parle comme un enseignant.

Le texte s’appuie sur deux distinctions de la série et ne les refait pas. Le 16 septembre 2026, le harnais a été compris comme la couche qui transforme la capacité générative en travail : outils bornés, état, vérificateurs, arrêt du système. Le 18 septembre, l’évaluation des agents a été comprise comme la couche qui mesure si ce travail est fiable face à un critère extérieur à la prose du modèle. Ni l’une ni l’autre n’est le jugement de qui a un groupe, un curriculum et une responsabilité. La supervision humaine dans la boucle (human-in-the-loop, HITL) est la troisième couche : la gouvernance. Un système peut produire du travail et ne pas mériter la délégation. Il peut avoir été mesuré sur une autre distribution et échouer dans cette explication, avec ce groupe. Inférence de conception, non constat propre : sans la troisième couche il y a un produit et une métrique ; il n’y a pas d’appui professionnel.

Six substitutions illégitimes organisent le problème. Appeler autonomie ce qui exige encore une personne responsable : Nemoto (2026) propose des agents au statut ontologique non résolu, qui entrent pourtant dans une relation soutenue avec qui les utilise. Traiter le copilote comme un substitut : Kim et al. (2026) montrent que la collaboration humain–IA, comme condition, n’homogénéise pas la valorisation des machine teachers. Confondre littératie et clics. Lire une évaluation d’agent comme un jugement situé. Croire que le harnais gouverne déjà l’acte éducatif. Promouvoir le score au rang de critère : Zhai et al. (2024) définissent la surdépendance comme l’acceptation du dialogue artificiel sans le questionner quand on ne sait pas en évaluer la fiabilité. Zhang et Tur (2024) enregistrent les plans comme une affordance citée et, dans le même mouvement, des préoccupations. L’affordance n’est pas le métier. Cet article sépare artefacts et jugement, ne feint pas des protocoles que le corpus n’a pas mesurés et propose quatre épreuves qui ne sont pas une norme. On n’invente ni tailles d’échantillon, ni d, ni r, ni AUC, ni pourcentages, ni DOI.

2. État de l'art : pratique située contre artefact

Le discours de l’« enseignant d’IA » écrase quatre strates qu’il ne faut pas mêler : conception centrée sur la personne (Alfredo et al., 2024 ; Brusilovsky, 2024 ; Dakshit et al., 2026 ; Kotsis et Stylos, 2026) ; métier de qui forme (MacPhail et al., 2026 ; Moorhouse et Kohnke, 2024 ; Wan et Gu, 2026) ; littératie critique, non dextérité d’interface (Nabhan et Habók, 2026 ; Baran et al., 2026 ; Zhang et Samsudin, 2026 ; Anders et Dux Speltz, 2025 ; Brünner et al., 2025 ; Traga Philippakos et Rocconi, 2025 ; Haroud et Saqri, 2025) ; et limite du modèle quand on le fait parler comme un enseignant (Papaioannou, 2026 ; Nemoto, 2026 ; Kudina et de Boer, 2025 ; Fisher, 2024 ; Zhai et al., 2024 ; Yan et al., 2024 ; Kim et al., 2026 ; Zhang et Tur, 2024). L’artefact vit dans l’annonce. La pratique située vit dans l’identité, dans la formation et dans le protocole.

Alfredo et al. (2024) passent en revue l’analytique et l’IA éducatives centrées sur la personne : exclure enseignants et étudiants de la conception nourrit la méfiance, et l’équilibre entre contrôle humain et automatisation reste ouvert. Brusilovsky (2024) rappelle que ce contrôle a été pionnier en éducation puis s’est retrouvé derrière le travail analogue sur les systèmes de recommandation. Dakshit et al. (2026) proposent PEARL —personnalisation, explicabilité, attribution, représentation et agence située— illustré par un tuteur simulé, non par un veto de classe. Kotsis et Stylos (2026) lisent le règlement européen sur l’IA avec les STEM : transparence, responsabilité et supervision humaine conditionnent la pédagogie et l’agence, et traitent l’IA comme actrice épistémique. La norme n’est pas encore le protocole d’un établissement ; elle rend illégitime d’appeler autonome ce qu’elle veut sous la vigilance de personnes.

Le métier ne commence pas au bouton. MacPhail et al. (2026) décrivent, par des entretiens dans cinq juridictions, les formateurs d’enseignants basés à l’école : responsabilité du rôle, hétérogénéité, disposition à travailler avec qui se forme, et besoins de développement que le poste ne résout pas. Ce n’est pas une étude d’IA. C’est le sujet qu’un copilote ne télécharge pas. Moorhouse et Kohnke (2024) écoutent des formateurs d’anglais dans la formation initiale des enseignants de langues à Hong Kong : ils anticipent des effets sur le curriculum, l’enseignement et l’évaluation, et la majorité déclare un manque de confiance et de compétence. Wan et Gu (2026) passent en revue l’apprentissage dialogique humain–machine et le lient à la pédagogie, à l’environnement et à la plateforme. Le dialogue n’est pas, à lui seul, la capacité professionnelle. Il y a pratique située quand le formateur reste le sujet du curriculum. Il y a artefact quand le plan généré occupe sa place.

La littératie du corpus est déjà un jugement, non un clic. Nabhan et Habók (2026) valident le cadre ED-AI pour des enseignants de langues : connaissance, évaluation, collaboration, contextualisation, autonomie de l’enseignant —non du modèle— et éthique. On n’importe pas les coefficients. Baran et al. (2026) conçoivent une formation critique sans un effet que ce texte citerait. Zhang et Samsudin (2026) comparent une pédagogie de genre intégrée à l’IA et un programme générique, de la familiarité à la criticité, sans tailles d’effet importées. Anders et Dux Speltz (2025) joignent littératies fonctionnelle, critique et créative à planifier, itérer et évaluer, du côté de l’étudiant. Brünner et al. (2025) rendent visibles probabilité, contexte et manipulation. Traga Philippakos et Rocconi (2025) séparent l’outil, la confiance déclarée et le besoin de formation. Haroud et Saqri (2025) séparent appui et remplacement. Yan et al. (2024), Kudina et de Boer (2025), Lemasters et Hurshman (2025) et Balducci (2024) fixent le sol —prudence éthique, langage fonctionnalisé, oralité, tâches avec processus— sans installer eux-mêmes un protocole de veto.

3. Méthode de revue

On a mené une revue narrative critique, non une méta-analyse ni un taux de « succès du copilote ». L’argument est de catégorie : ce qui compte comme appui quand un enseignant supervise un système, et ce qui reste un artefact. La fenêtre est 2021–2026. Si l’année d’impression diverge de l’année en ligne, on cite l’impression : Wan et Gu (2026) ; Lemasters et Hurshman (2025) ; Kudina et de Boer (2025) ; Yan et al. (2024) ; Zhang et Tur (2024). Inclusion : travaux à comité de lecture avec DOI Crossref vérifié le 22 septembre 2026, créneau 09:02 America/Mexico_City, sur la supervision humaine, la littératie enseignante, l’IA éducative centrée sur la personne, l’agence enseignante ou les limites du modèle dans un rôle d’enseignement. Ont été exclus les axes d’éducation de la petite enfance déjà publiés dans la série, les catalogues sans article et tout chiffre absent des sources. Les vingt-quatre entrées de fuentes.md ont été utilisées. Aucun auteur, revue ni DOI n’a été ajouté.

Chaque source est marquée d’un de trois statuts. Constat empirique : ce qui a été observé. Cadre : argument ou revue qui n’essaie pas les quatre épreuves. Inférence de conception : ce que cet article conclut et ne peut attribuer comme résultat de la source. Sans étude qui les égale à un appui, chat, score, plan, étiquette ou tableau sont un plafond de catégorie. Il n’y a pas de PRISMA propre. Les épreuves de la section 7 sont des hypothèses, non une norme. Produire du travail n’est pas gouverner l’acte enseignant.

4. Axe 1. Les artefacts ne constituent pas un appui

L’appui que cet axe nie n’est pas celui d’un adulte dans une salle de petite enfance. C’est celui qu’un fournisseur déclare en disant que l’enseignant « a déjà un copilote ». Le chat qui « enseigne » est le premier artefact. Fisher (2024) fixe la limite : devant une question de fait, le modèle peut lâcher un contenu sans en avoir évalué la vérité. Si le locuteur n’est pas sous cette norme, il y a théâtre d’explication. Papaioannou (2026) ajoute un constat de cadrage : la langue du prompt s’associe au nom de l’épisode, à qui porte la responsabilité et à l’historiographie. Le chat hérite d’un cadre ; il ne « couvre pas le sujet ». Zhang et Tur (2024) cartographient plans et matériaux comme usages cités, non comme verdict que le plan est l’acte d’enseigner. L’appui commence là où quelqu’un du métier accepte ou rejette ce cadre.

Le score de confiance n’est pas un critère écrit avant l’usage. C’est un signal du système sur sa propre sortie, ou une métrique de plateforme : ce corpus n’audite pas un produit et n’invente pas de seuil. Zhai et al. (2024) montrent le raccourci. La surdépendance consiste à accepter la recommandation du dialogue sans question, surtout quand évaluer la fiabilité est difficile. Un score élevé réduit la question juste quand la question est le métier. Yan et al. (2024) laissent la rétroaction automatique et la notation parmi les défis pratiques et éthiques : qu’un système note ne signifie pas que l’enseignant a fixé quelle erreur ne se délègue pas. Confiance du modèle et critère enseignant ne sont pas convertibles. L’une parle du système. L’autre parle de cette situation, de cette source et de cette conséquence si le cadre est faux.

Le plan généré n’hérite pas non plus du métier. Wan et Gu (2026) lient les affordances du dialogue humain–machine à la pédagogie, à l’environnement et à la plateforme. Un fichier téléchargé hors de cette conception n’hérite pas de la relecture. Moorhouse et Kohnke (2024) entendent des formateurs qui voient curriculum, enseignement et évaluation déjà affectés et qui, pour la plupart, ne se sentent pas compétents : le plan déplacerait l’écart vers le bouton d’acceptation. Haroud et Saqri (2025) maintiennent séparés appui et remplacement. Un plan qui occupe le critère a changé de côté même si la brochure dit appui. Balducci (2024) rappelle que la sûreté de la tâche dépend de l’authenticité, de la collaboration et du processus, non de la fluidité. Le plan peut être un intrant. Exhibé comme la classe, c’est un artefact.

L’agent « autonome », et l’AI teacher ou machine teacher de catalogue, ferment faussement l’agence. Nemoto (2026) propose l’indétermination, non une intentionnalité résolue. Kim et al. (2026), dans deux expériences avec des étudiants de premier cycle aux États-Unis, rapportent que la valorisation diffère selon le genre et que la différence est plus marquée sous l’étiquette de collaboration humain–IA. Statut : perception étudiante, non audit de protocole. Kudina et de Boer (2025) ajoutent que fonctionnaliser le langage amincit le jugement. Le tableau sans protocole et le bouton qui n’arrête pas l’acte complètent la série. Alfredo et al. (2024) demandent un contrôle réel, non un graphique qui cache la trace. Dakshit et al. (2026) demandent des décisions traçables. Fluidité pour véracité, score pour critère, plan pour métier, étiquette pour agence, tableau pour supervision et bouton pour veto : aucune de ces substitutions n’est dans le corpus.

5. Axe 2. Le métier relationnel dans le jardin

L’intitulé appartient au moule de la série. Le référent, non. Il n’y a pas ici de salle de petite enfance. Le terrain est la relation entre une personne responsable et un système qui produit du texte, des plans et des scores. Il y a métier quand cette personne fixe le critère avant de déléguer, lit la trace, peut opposer un veto, nomme le responsable et sait à quel seuil la décision cesse d’être celle du modèle. MacPhail et al. (2026) décrivent, sans parler d’IA, le sujet : responsabilité du rôle, hétérogénéité, disposition à travailler avec qui se forme, et développement professionnel que le poste ne résout pas. Un copilote ne recrute pas cette identité. Le HITL la protège ; il ne la convertit pas en opération d’interface.

Le premier geste est le critère préalable, non l’impression de la démo. Anders et Dux Speltz (2025) montrent, du côté de l’étudiant, que planifier inclut le savoir de domaine et des critères avant d’itérer. Cette taxonomie d’humain dans la boucle n’est pas un protocole enseignant : l’apprenant tient le cycle. Nabhan et Habók (2026) incluent évaluation et éthique à côté de la connaissance, de la collaboration, de la contextualisation et de l’autonomie professionnelle : être formé, dans ce cadre, c’est évaluer, non appuyer sur le bouton. Baran et al. (2026) placent la criticité dans la formation des formateurs. Traga Philippakos et Rocconi (2025) séparent connaître les outils et déclarer une confiance du besoin de formation. Le critère s’écrit comme erreur intolérable —donnée fausse, attribution injuste, tâche que les élèves devaient faire, évaluation qui ne se délègue pas— et non comme score.

Le deuxième geste est la trace. Papaioannou (2026) montre que cadrage et attribution sont dans la sortie et changent avec la langue de la question : qui ne lit pas accepte le miroir. Dakshit et al. (2026) demandent des décisions traçables pour étudiants, enseignants et administration. PEARL se démontre par simulation ; le principe n’est pas pour autant validé comme pratique d’établissement. Alfredo et al. (2024) lient la confiance à la participation à la conception et au déploiement. La trace minimale est ce qui a été dit, avec quelle consigne et ce qui est resté dehors, non un résumé de participation. Yan et al. (2024) rappellent que questionner, rétroagir ou noter avec un modèle ne devient pas inoffensif par l’adoption. Sans trace, il y a foi dans la fluidité, non revue.

Le troisième geste est le veto dans l’instant, non un réglage d’administrateur. Brusilovsky (2024) reprend le contrôle de l’apprenant comme dette de recherche : il voisine le veto et n’est pas le veto. L’étudiant peut vouloir diriger sa trajectoire, et l’enseignant doit pouvoir couper une explication fausse. Kotsis et Stylos (2026) situent la supervision humaine sous le règlement sur l’IA dans les STEM européens : la norme demande la vigilance de personnes et ne dessine pas un bouton. Zhai et al. (2024) décrivent le coût de ne pas pouvoir refuser la recommandation. Kim et al. (2026) montrent que l’étiquette de collaboration n’égalise pas les perceptions. Le veto n’est pas une moyenne de satisfaction.

Attribution et escalade vont ensemble. Nemoto (2026) empêche de charger la faute professionnelle sur une agence indéterminée. Fisher (2024) empêche de traiter le modèle comme un locuteur qui aurait déjà évalué la vérité. Kudina et de Boer (2025) décrivent l’amincissement de qui devait juger. Le nom de qui adopte la sortie, et de qui révise si elle entre dans l’évaluation ou dans un contenu sensible, s’écrit hors du modèle. Balducci (2024) et Lemasters et Hurshman (2025) ne décrivent pas un seuil de copilote : ils poussent des tâches à processus humain et, en philosophie, une oralité que le modèle ne soutient pas en silence. Noter, certifier, traiter un dommage, sortir du curriculum ou contredire une source contraignante escalade vers une personne nommée, avec la coupe décidée avant et non quand le score paraît haut.

Le sixième geste est la littératie critique. Zhang et Samsudin (2026) opposent discipline et genre textuel à un programme générique. Brünner et al. (2025) rendent visibles probabilité, contexte et manipulation. Haroud et Saqri (2025) maintiennent le remplacement distinct de l’appui. Moorhouse et Kohnke (2024) situent l’écart dans la confiance et la compétence des formateurs : la réponse est la formation, non l’abdication du curriculum. Savoir quoi ne pas déléguer, comment lire une trace, quand arrêter et à qui revient la responsabilité est la littératie qui compte. Un cours de consignes peut hausser la confiance déclarée et laisser le protocole absent. L’enseignant utilise, corrige ou éteint. Il n’est pas client d’une fonction.

6. Contraste. Frontières de catégorie

La supervision humaine n’est pas une autonomie timide. Nemoto (2026) laisse l’agence indéterminée. Kotsis et Stylos (2026) exigent la supervision comme condition de l’agence enseignante sous le règlement, non comme le petit caractère d’un agent qui « n’a plus besoin » de l’enseignant. Kim et al. (2026) étudient des machines qui enseignent comme perception étudiante : ce rôle n’est pas un poste. Appeler le copilote autonome et ajouter « avec un humain dans la boucle » en note de bas de page efface la frontière au lieu de la franchir. Le HITL nie que le système soit le sujet de l’acte.

Copilote et substitut se séparent par qui peut dire non. Haroud et Saqri (2025) traitent appui et remplacement comme des catégories que enseignants et étudiants ne vivent pas de la même façon. Moorhouse et Kohnke (2024) laissent curriculum, enseignement et évaluation à des formateurs affectés et souvent peu préparés : le sujet reste le formateur. Zhang et Tur (2024) peuvent enregistrer une aide à planifier sans faire du modèle le planificateur responsable. Le copilote produit des intrants sous un critère d’autrui. Le substitut occupe le critère.

Littératie et entraînement au clic ne coïncident pas non plus. Nabhan et Habók (2026) désagrègent connaissance, évaluation, collaboration, contextualisation, autonomie enseignante et éthique : « je sais utiliser l’outil » n’épuise pas le construit. Baran et al. (2026), Zhang et Samsudin (2026) et Brünner et al. (2025) cherchent criticité située, probabilité, contexte et manipulation, non une familiarité générique. Anders et Dux Speltz (2025) exigent des critères posés par la personne avant d’itérer. Finir un atelier sur « je peux déjà générer le plan » peut être une littératie fonctionnelle et rester un analphabétisme de gouvernance.

L’évaluation d’un agent n’est pas le jugement professionnel, et le harnais n’est pas la gouvernance. Au sens du 18 septembre, l’évaluation mesure la fiabilité sur une distribution de tâches, non dans cette heure. Yan et al. (2024) accumulent des défis qu’une ligne de résultats ne ferme pas : être bien mesuré à générer des items n’autorise pas à noter là où le seuil n’est pas écrit. Au sens du 16 septembre, le harnais produit du travail avec outils, état, vérification et arrêt technique. Cet arrêt obéit à un budget ou à un vérificateur. Il ne sait pas une source contraignante, ni une relation où il convient de ne pas déléguer même si le vérificateur est au vert. On peut avoir harnais et évaluation et ne pas avoir d’appui.

Le score n’est pas le critère d’acceptation. Zhai et al. (2024) lient la surdépendance à la difficulté d’évaluer la fiabilité. Dakshit et al. (2026) demandent explicabilité et décisions justifiables, non un scalaire qui remplace le jugement. Un score peut être un indice ; il n’est pas le critère qui devait s’écrire d’abord. D’autres frontières internes s’écrasent avec la même hâte. L’humain dans la boucle d’Anders et Dux Speltz (2025) est l’étudiant qui s’autorégule. Le contrôle de l’apprenant chez Brusilovsky (2024) n’est pas le veto enseignant. L’agence de PEARL n’est pas l’attribution institutionnelle. Le dialogue de Wan et Gu (2026) peut former ; il ne gouverne pas. L’oralité de Lemasters et Hurshman (2025) et les principes de tâche de Balducci (2024) sont des coupes humaines d’un autre grain : elles n’installent pas, seules, la revue des traces. La catégorie est conjonctive. Il manque une pièce et le système retombe en artefact, même si la diapositive dit copilote.

7. Quatre épreuves d'appui (non un artefact)

Ce qui suit est une inférence de conception de cet article, ancrée dans le corpus et livrée par aucune source comme norme. Ce n’est pas une norme, pas une rubrique validée, et cela ne note pas des produits. Si un chat, un score, un plan, un agent « autonome », un tableau ou un bouton ne passe pas les quatre épreuves, il ne peut être déclaré appui professionnel.

7.1. Épreuve du critère d’acceptation préalable à l’usage, non du score ni de la démo. Anders et Dux Speltz (2025) placent les critères avant d’itérer. Nabhan et Habók (2026) traitent l’évaluation comme dimension de la littératie, non comme accessoire. Baran et al. (2026) inscrivent la criticité dans la formation des formateurs. Traga Philippakos et Rocconi (2025) séparent connaître l’outil et être formé pour le juger. L’épreuve est remplie quand, avant de déléguer, est écrit quelle sortie est acceptable, quelle erreur ne se délègue pas et quels usages sont hors champ, par exemple certifier ou clore un différend de faits. Si le seul critère est un score élevé ou une démo impressionnante, l’épreuve échoue. Le critère parle du curriculum et du dommage possible, non de l’assurance subjective du modèle.

7.2. Épreuve de traces révisables par l’enseignant, non du tableau de participation. Dakshit et al. (2026) exigent des décisions traçables. Papaioannou (2026) montre que le cadre voyage dans la sortie. Alfredo et al. (2024) lient le contrôle à la participation réelle, non à un graphique agrégé. Yan et al. (2024) laissent ouverts les défis de questionner, rétroagir et noter : inspecter fait partie de la réponse éthique. L’épreuve est remplie quand l’enseignant peut lire ce qui a été demandé, ce que le système a répondu, quels outils sont intervenus s’il y en a eu et quelle version est arrivée aux élèves. S’il ne voit que participation, temps d’écran ou « confiance moyenne », il y a surveillance d’exhibition, non revue.

7.3. Épreuve du droit de veto et d’arrêt, non de l’étiquette de collaboration. Brusilovsky (2024) rappelle que le contrôle n’est pas donné par le mot collaboratif, et que le contrôle de l’apprenant n’épuise pas le veto enseignant. Kotsis et Stylos (2026) font de la supervision humaine une condition de l’agence, non un mode optionnel. Zhai et al. (2024) décrivent le coût de ne pas pouvoir refuser la recommandation. Kim et al. (2026) montrent que la collaboration étiquetée n’efface pas les différences de valorisation : le goût d’une partie du groupe n’est pas une licence pour continuer. L’épreuve est remplie quand l’enseignant peut empêcher qu’une sortie arrive, ou la retirer, sans attendre un autre cycle d’achat et sans que le système traduise la coupe en préférence de style. Si arrêter exige un privilège que l’enseignant de classe n’a pas, ou si le bouton ne fait que confirmer ce qui est déjà livré, il y a chorégraphie.

7.4. Épreuve d’attribution explicite de responsabilité et de seuil d’escalade. Nemoto (2026) n’offre pas de sujet à qui charger la faute professionnelle. Fisher (2024) n’offre pas de locuteur qui aurait évalué la vérité. Kudina et de Boer (2025) décrivent l’amincissement de qui devait juger. MacPhail et al. (2026) rappellent que la responsabilité de rôle est une identité, non une signature au pied d’un plan. Moorhouse et Kohnke (2024) laissent les formateurs sujets du curriculum : l’écart demande de la formation, non la cession du nom. Balducci (2024) et Lemasters et Hurshman (2025) maintiennent des coupes humaines dans la tâche et dans l’oralité. L’épreuve est remplie s’il est écrit qui répond et quand on escalade vers une personne nommée —noter, dommage, sortie du curriculum, source contraignante, désaccord que la trace ne résout pas—. « L’IA est responsable », sans nom ni seuil, est une décharge.

Les quatre se lisent ensemble. Un critère sans trace ne s’applique pas. Une trace sans veto est une archive. Un veto sans attribution ne dit pas qui soutiendra la coupe demain. Un seuil sans critère préalable s’invente sous pression, quand le score invite le plus à ne pas penser. Un plan, un dialogue de formation (Wan et Gu, 2026), un cycle étudiant (Anders et Dux Speltz, 2025), une explicabilité à la manière de PEARL (Dakshit et al., 2026) ou une mesure de fiabilité faite dans une autre couche peuvent vivre dans le métier comme pièces subordonnées. Aucune, seule, n’est un appui. L’autonomie de catalogue ne les transforme pas en détail pour plus tard.

8. Discussion

Trois tensions organisent la discussion. La première oppose exhiber des artefacts et exercer le métier. Fisher (2024), Papaioannou (2026), Nemoto (2026) et Kim et al. (2026) ne disent pas la même chose : absence d’évaluation de la vérité, cadrages qui bougent avec la langue, agence non résolue, collaboration qui n’égalise pas les perceptions. Le marché les écrase dans « l’enseignant d’IA est arrivé ». La pièce peut être vraie dans son domaine. « Pièce = appui professionnel » ne l’est pas. Zhang et Tur (2024) peuvent lister le plan parmi les affordances sans autoriser cette équation. Wan et Gu (2026) peuvent montrer un dialogue utile pour former sans faire du chat le formateur.

La deuxième oppose les couches antérieures de la série à la gouvernance. Le harnais produit un travail vérifiable. L’évaluation mesure la fiabilité sur une distribution. Les deux peuvent être bien faites et l’acte de cette heure rester indélégable : parce que le cadre attribue mal une responsabilité historique (Papaioannou, 2026), parce que qui utilise le système ne détecte pas la faille (Zhai et al., 2024), parce que l’évaluation n’a pas été redessinée (Balducci, 2024 ; Lemasters et Hurshman, 2025), ou parce que le règlement demande supervision et agence enseignante qu’un mode autonome contredit (Kotsis et Stylos, 2026). Acheter un harnais et acheter une évaluation n’achète pas le HITL. Omettre la troisième couche —« le modèle est déjà fiable, donc il appuie déjà »— est un biais d’exhibition, non une conclusion des revues.

La troisième oppose littératie critique et confiance de clic. Moorhouse et Kohnke (2024) trouvent des formateurs qui anticipent l’impact et ne se sentent pas compétents : c’est une donnée, non un échec moral. La réponse cohérente avec Baran et al. (2026), Zhang et Samsudin (2026), Brünner et al. (2025) et Nabhan et Habók (2026) est une formation qui inclut évaluation, éthique, contexte et criticité située. L’incohérente est un atelier de consignes qui hausse la confiance déclarée (Traga Philippakos et Rocconi, 2025) et appelle cela littératie. Haroud et Saqri (2025) montrent que l’ouverture à adopter ne se distribue pas également entre étudiants et enseignants, et que appui et remplacement ne sont pas synonymes. Confondre enthousiasme d’usage et protocole laisse l’établissement gouverné par qui veut le plus déléguer.

Les épreuves lisent ces tensions comme hypothèses, non comme constat de classe. PEARL est une simulation (Dakshit et al., 2026). MacPhail et al. (2026) n’ont pas étudié de copilotes. L’humain dans la boucle d’Anders et Dux Speltz (2025) est étudiant, et le contrôle de Brusilovsky (2024) est un agenda de recherche, non un bouton de veto. Critère, trace, veto et nom avec seuil sont une candidature à l’appui. Chat, score, plan, étiquette, tableau ou bouton, seuls, sont de la consommation.

9. Limites

La revue est narrative. Elle n’estime pas d’effets combinés et n’applique pas de PRISMA propre. On n’invente ni tailles d’échantillon, ni d, ni r, ni AUC, ni pourcentages, même si certaines sources en rapportent. Nabhan et Habók (2026) valident un construit ; ils ne classent pas les enseignants. Zhang et Samsudin (2026) se lisent pour le passage de la familiarité à la criticité, non pour un effet importé. Kim et al. (2026) parlent d’étudiants de premier cycle, non du corps enseignant. Moorhouse et Kohnke (2024) recueillent des perceptions à Hong Kong. Papaioannou (2026) est un cas historiographique. Brünner et al. (2025) et Baran et al. (2026) conçoivent de la formation ; ils n’auditent pas des produits.

D’autres sources sont un sol ou un voisin, non une preuve directe du protocole. MacPhail et al. (2026) étudient l’identité des formateurs basés à l’école. Fisher (2024), Nemoto (2026) et Kudina et de Boer (2025) argumentent. Balducci (2024) donne un avis sur les tâches. Lemasters et Hurshman (2025) proposent un tournant oral. Dakshit et al. (2026) simulent PEARL. Anders et Dux Speltz (2025) documentent des pratiques étudiantes. Brusilovsky (2024) passe en revue le contrôle de l’apprenant. Alfredo et al. (2024), Yan et al. (2024), Zhang et Tur (2024), Zhai et al. (2024) et Wan et Gu (2026) cartographient des champs ; ils ne certifient pas un copilote. Kotsis et Stylos (2026) analysent norme et agence dans les STEM européens, non un protocole d’établissement. Haroud et Saqri (2025) et Traga Philippakos et Rocconi (2025) décrivent perceptions et besoins, non le respect des quatre épreuves.

Dans ce kit, aucun essai n’égale chat, score, plan ou étiquette d’autonomie à un appui avec critère, trace, veto et attribution. Cette absence est un plafond de catégorie, non une magnitude de dommage. On n’audite pas de contrats et on ne condamne pas de marques. Les quatre épreuves ne sont pas un instrument validé. Le mot « jardin » de l’intitulé 5 ne transfère pas de constats de petite enfance : cet article n’étudie pas ce niveau. Le corpus est en anglais et cette synthèse est une traduction éditoriale. La pile harnais, évaluation et HITL est une distinction de la série, non un résultat empirique des vingt-quatre sources.

10. Conclusions

Un chat qui « enseigne », un score, un plan ou un agent « autonome » ne constituent pas un appui professionnel si la supervision enseignante manque. Ni un tableau, ni un bouton d’acceptation. Le métier est le jugement qui délègue, corrige ou arrête. Fisher (2024), Papaioannou (2026), Nemoto (2026), Zhai et al. (2024), Kim et al. (2026) et Zhang et Tur (2024) fixent le plafond : fluidité sans évaluation de la vérité, cadrage dans la sortie, agence indéterminée, surdépendance, collaboration qui n’égalise pas les perceptions, et plans qui sont une affordance de la littérature, non le métier.

Là où il y a métier, il y a sujet et protocole. MacPhail et al. (2026) et Moorhouse et Kohnke (2024) laissent la responsabilité à qui forme, même s’il se sent peu sûr : la réponse est la formation, non la cession. Nabhan et Habók (2026), Baran et al. (2026), Zhang et Samsudin (2026), Brünner et al. (2025), Anders et Dux Speltz (2025), Traga Philippakos et Rocconi (2025) et Haroud et Saqri (2025) déplacent la littératie du clic vers l’évaluation, l’éthique, la criticité et la distinction entre appui et remplacement. Alfredo et al. (2024), Brusilovsky (2024), Dakshit et al. (2026) et Kotsis et Stylos (2026) demandent contrôle, supervision et décisions traçables. Yan et al. (2024), Kudina et de Boer (2025), Lemasters et Hurshman (2025), Balducci (2024) et Wan et Gu (2026) empêchent de fermer le problème avec un rôle de catalogue.

La pile ne se substitue pas de l’intérieur. Le harnais produit du travail. L’évaluation mesure la fiabilité. La supervision humaine gouverne la délégation en situation, avec quatre épreuves conjonctives : critère préalable, traces que l’enseignant peut revoir, droit de veto et attribution explicite avec seuil d’escalade. Là où les sources n’ont pas mesuré ce protocole, cet article ne le tient pas pour mesuré. Là où elles ont mesuré cadrages, perceptions, construits ou arguments, on ne les traduit pas en « l’agent appuie déjà ». Convertir un système génératif en appui, c’est exercer le jugement sur le moment où il sert, où on le corrige et où on l’arrête. Le reste est chat, score, plan ou autonomie de marketing. Ce n’est pas le métier, et il ne doit pas être présenté comme ce qu’il n’est pas.

Laboratorio Editorial de NEXTECH.IA / Ingeniero Mitre.

Références

  1. Alfredo, R., Echeverria, V., Jin, Y., Yan, L., Swiecki, Z., Gašević, D., y Martinez-Maldonado, R. (2024). Human-centred learning analytics and AI in education: A systematic literature review. Computers and Education: Artificial Intelligence, 6, Article 100215. https://doi.org/10.1016/j.caeai.2024.100215
  2. Anders, A. D., y Dux Speltz, E. (2025). Developing generative AI literacies through self-regulated learning: A human-centered approach. Computers and Education: Artificial Intelligence, 9, Article 100482. https://doi.org/10.1016/j.caeai.2025.100482
  3. Balducci, B. (2024). AI and student assessment in human-centered education. Frontiers in Education, 9, Article 1383148. https://doi.org/10.3389/feduc.2024.1383148
  4. Baran, E., Dilek, M., Ziba, M., y Xiao, X. (2026). Human-centered AI for teacher educators: Designing professional learning for critical AI literacy. Computers and Education Open, 11, Article 100399. https://doi.org/10.1016/j.caeo.2026.100399
  5. Brünner, B., Schön, S., y Ebner, M. (2025). From Gretel to Strudelcity: Empowering teachers regarding generative AI for enhanced AI literacy with CollectiveGPT. Education Sciences, 15(2), Article 206. https://doi.org/10.3390/educsci15020206
  6. Brusilovsky, P. (2024). AI in education, learner control, and human-AI collaboration. International Journal of Artificial Intelligence in Education, 34(1), 122–135. https://doi.org/10.1007/s40593-023-00356-z
  7. Dakshit, S., Mokhtari, K., y Khalid, A. (2026). Designing understandable and fair AI for learning: The PEARL framework for human-centered educational AI. Education Sciences, 16(2), Article 198. https://doi.org/10.3390/educsci16020198
  8. Fisher, S. A. (2024). Large language models and their big bullshit potential. Ethics and Information Technology, 26(4), Article 67. https://doi.org/10.1007/s10676-024-09802-5
  9. Haroud, S., y Saqri, N. (2025). Generative AI in higher education: Teachers’ and students’ perspectives on support, replacement, and digital literacy. Education Sciences, 15(4), Article 396. https://doi.org/10.3390/educsci15040396
  10. Kim, J., Spence, P. R., y Kelly, S. (2026). Machine teachers and human-AI collaboration: Student differences in perceptions of AI-based education. Interactive Learning Environments. Advance online publication. https://doi.org/10.1080/10494820.2026.2667455
  11. Kotsis, K. T., y Stylos, G. (2026). The AI Act and the future of STEM education in Europe: Rethinking pedagogy, assessment, and teacher agency. Frontiers in Education, 11, Article 1845045. https://doi.org/10.3389/feduc.2026.1845045
  12. Kudina, O., y de Boer, B. (2025). Large language models, politics, and the functionalization of language. AI and Ethics, 5(3), 2367–2379. https://doi.org/10.1007/s43681-024-00564-w
  13. Lemasters, R., y Hurshman, C. (2025). A shift towards oration: Teaching philosophy in the age of large language models. AI and Ethics, 5(2), 1203–1215. https://doi.org/10.1007/s43681-024-00455-0
  14. MacPhail, A., Vanassche, E., Guberman, A., Czerniawski, G., y Boks-Vlemmix, J. (2026). School-based teacher educators’ professional identity and professional needs. Teaching and Teacher Education, 176, Article 105523. https://doi.org/10.1016/j.tate.2026.105523
  15. Moorhouse, B. L., y Kohnke, L. (2024). The effects of generative AI on initial language teacher education: The perceptions of teacher educators. System, 122, Article 103290. https://doi.org/10.1016/j.system.2024.103290
  16. Nabhan, S., y Habók, A. (2026). Language teachers’ AI literacy: A psychometric study based on the ED-AI framework. Computers and Education: Artificial Intelligence, 10, Article 100583. https://doi.org/10.1016/j.caeai.2026.100583
  17. Nemoto, R. (2026). Continuous intentionality and indeterminate agency in large language models. AI and Ethics, 6(3), Article 322. https://doi.org/10.1007/s43681-026-01181-5
  18. Papaioannou, C. (2026). Language and the framing of historical narrative in large language models: The case of Asia Minor (1922). AI and Ethics, 6(3), Article 262. https://doi.org/10.1007/s43681-026-01138-8
  19. Traga Philippakos, Z. A., y Rocconi, L. (2025). AI literacy: Elementary and secondary teachers’ use of AI-tools, reported confidence, and professional development needs. Education Sciences, 15(9), Article 1186. https://doi.org/10.3390/educsci15091186
  20. Wan, P., y Gu, X. (2026). Developing teachers’ professional abilities: A systematic review of human-machine dialogic learning for teacher education. Interactive Learning Environments, 34(2), 615–639. https://doi.org/10.1080/10494820.2025.2507280
  21. Yan, L., Sha, L., Zhao, L., Li, Y., Martinez-Maldonado, R., Chen, G., Li, X., Jin, Y., y Gašević, D. (2024). Practical and ethical challenges of large language models in education: A systematic scoping review. British Journal of Educational Technology, 55(1), 90–112. https://doi.org/10.1111/bjet.13370
  22. Zhang, P., y Tur, G. (2024). A systematic review of ChatGPT use in K-12 education. European Journal of Education, 59(2), Article e12599. https://doi.org/10.1111/ejed.12599
  23. Zhang, Y., y Samsudin, M. A. (2026). From familiarity to criticality: Cultivating EFL teachers’ AI literacy through an AI-integrated genre-based pedagogy. Education Sciences, 16(1), Article 150. https://doi.org/10.3390/educsci16010150
  24. Zhai, C., Wibowo, S., y Li, L. D. (2024). The effects of over-reliance on AI dialogue systems on students’ cognitive abilities: A systematic review. Smart Learning Environments, 11(1), Article 28. https://doi.org/10.1186/s40561-024-00316-7