1. Introducción y problema

Antes del timbre, en una clase de historia de secundaria, la pantalla junta tres objetos. Un chat responde sobre un episodio del pasado con tono de lección. Al margen, un score de confianza del modelo. Debajo, un plan ya secuenciado para la hora siguiente. El contrato llama al conjunto agente autónomo y al docente le deja un botón de aceptar. La escena no es un dato de campo de este artículo: es el límite de exhibición que el mercado trata como apoyo. No está escrito, antes del uso, qué cuenta como respuesta aceptable. No hay traza para leer el encuadre. No hay garantía de detener la explicación si la atribución de responsabilidad es falsa. No hay nombre de quien responde ni umbral en el que la decisión vuelve a una persona.

La tesis no cabe en el título breve. Esos cuatro objetos no constituyen apoyo profesional si falta el protocolo de supervisión. El oficio es el juicio que delega, corrige o detiene. Fisher (2024) argumenta, como tesis filosófica y no como ensayo de aula, que un modelo puede emitir contenido proposicional ante una pregunta de hecho sin haber evaluado su verdad: la fluidez no es norma de veracidad. Papaioannou (2026) muestra, en un estudio cualitativo comparado sobre 1922 en Asia Menor, que la lengua del prompt se asocia con la terminología, la atribución de responsabilidad y el encuadre historiográfico. Estatus: argumento en un caso, hallazgo empírico de encuadre en el otro. Ninguno prueba que un chat «ya enseña». Preguntan otra cosa: si se delegó un acto docente o si se exhibió una superficie que habla como docente.

El texto se apoya en dos distinciones de la serie y no las rehace. El 16 de septiembre de 2026 el arnés se entendió como la capa que vuelve trabajo la capacidad generativa: herramientas acotadas, estado, verificadores, parada del sistema. El 18 de septiembre la evaluación de agentes se entendió como la capa que mide si ese trabajo es fiable frente a un criterio externo a la prosa del modelo. Ninguna es el juicio de quien tiene un grupo, un currículo y una responsabilidad. La supervisión humana en el bucle (human-in-the-loop, HITL) es la tercera capa: gobernanza. Un sistema puede producir trabajo y no merecer delegación. Puede haber sido medido en otra distribución y fallar en esta explicación, con este grupo. Inferencia de diseño, no hallazgo propio: sin la tercera capa hay producto y hay métrica; no hay apoyo profesional.

Seis sustituciones ilegítimas organizan el problema. Llamar autonomía a lo que exige una persona responsable: Nemoto (2026) propone agentes de estatus ontológico no resuelto, que aun así entran en relación sostenida con quien los usa. Tratar al copiloto como sustituto: Kim et al. (2026) muestran que la colaboración humano–IA, como condición, no homogeniza la valoración de los machine teachers. Confundir alfabetización con clics. Leer una evaluación de agente como juicio situado. Creer que el arnés ya gobierna el acto educativo. Promover el score a criterio: Zhai et al. (2024) definen la sobredependencia como aceptar el diálogo artificial sin cuestionarlo cuando no se sabe valorar la fiabilidad. Zhang y Tur (2024) registran planes como asequibilidad citada y, a la vez, preocupaciones. La asequibilidad no es el oficio. Este artículo separa artefactos y juicio, no finge protocolos que el corpus no midió y propone cuatro pruebas que no son norma. No se inventan tamaños de muestra, d, r, AUC, porcentajes ni DOI.

2. Estado del arte: práctica situada vs artefacto

El discurso de «docente de IA» aplasta cuatro estratos que conviene no mezclar: diseño centrado en la persona (Alfredo et al., 2024; Brusilovsky, 2024; Dakshit et al., 2026; Kotsis y Stylos, 2026); oficio de quien forma (MacPhail et al., 2026; Moorhouse y Kohnke, 2024; Wan y Gu, 2026); alfabetización crítica, no destreza de interfaz (Nabhan y Habók, 2026; Baran et al., 2026; Zhang y Samsudin, 2026; Anders y Dux Speltz, 2025; Brünner et al., 2025; Traga Philippakos y Rocconi, 2025; Haroud y Saqri, 2025); y límite del modelo cuando se lo hace hablar como docente (Papaioannou, 2026; Nemoto, 2026; Kudina y de Boer, 2025; Fisher, 2024; Zhai et al., 2024; Yan et al., 2024; Kim et al., 2026; Zhang y Tur, 2024). El artefacto vive en el anuncio. La práctica situada vive en la identidad, en la formación y en el protocolo.

Alfredo et al. (2024) revisan analítica e IA centradas en la persona: excluir a docentes y estudiantes del diseño alimenta desconfianza, y queda pendiente equilibrar control humano y automatización. Brusilovsky (2024) recuerda que ese control fue pionero en educación y luego quedó detrás del trabajo análogo en recomendadores. Dakshit et al. (2026) proponen PEARL —personalización, explicabilidad, atribución, representación y agencia situada— ilustrado con un tutor simulado, no con un veto de aula. Kotsis y Stylos (2026) leen el Reglamento europeo de IA junto a STEM: transparencia, responsabilidad y supervisión humana condicionan pedagogía y agencia, y tratan a la IA como actora epistémica. La norma no es todavía el protocolo de un centro; sí vuelve ilegítimo llamar autónomo a lo que quiere bajo vigilancia de personas.

El oficio no empieza en el botón. MacPhail et al. (2026) describen, con entrevistas en cinco jurisdicciones, a los formadores basados en la escuela: responsabilidad de rol, heterogeneidad, disposición a trabajar con quien se forma y necesidades de desarrollo. No es un estudio de IA. Es el sujeto que un copiloto no descarga. Moorhouse y Kohnke (2024) escuchan a formadores de inglés en la formación inicial de Hong Kong: anticipan efectos sobre currículo, enseñanza y evaluación, y la mayoría declara falta de confianza y de competencia. Wan y Gu (2026) revisan el aprendizaje dialógico humano–máquina y lo atan a pedagogía, entorno y plataforma. El diálogo no es, por sí, la capacidad profesional. Hay práctica situada cuando el formador sigue siendo el sujeto del currículo. Hay artefacto cuando el plan generado ocupa su lugar.

La alfabetización del corpus ya es juicio, no clic. Nabhan y Habók (2026) validan el marco ED-AI para docentes de lenguas: conocimiento, evaluación, colaboración, contextualización, autonomía del docente —no del modelo— y ética. No se importan coeficientes. Baran et al. (2026) diseñan formación crítica sin un efecto que este texto cite. Zhang y Samsudin (2026) comparan pedagogía de género integrada con IA y un programa genérico, de la familiaridad a la criticidad, sin tamaños de efecto importados. Anders y Dux Speltz (2025) unen alfabetización funcional, crítica y creativa con planear, iterar y evaluar, del lado del estudiante. Brünner et al. (2025) hacen ver probabilidad, contexto y manipulación. Traga Philippakos y Rocconi (2025) separan herramienta, confianza declarada y necesidad de formación. Haroud y Saqri (2025) separan apoyo y sustitución. Yan et al. (2024), Kudina y de Boer (2025), Lemasters y Hurshman (2025) y Balducci (2024) fijan el suelo —cautela ética, lenguaje funcionalizado, oralidad, tareas con proceso— sin instalar ellos mismos un protocolo de veto.

3. Método de revisión

Se hizo una revisión narrativa crítica, no un metaanálisis ni una tasa de «éxito del copiloto». El argumento es de categoría: qué cuenta como apoyo cuando un docente supervisa un sistema y qué queda en artefacto. La ventana es 2021–2026. Si el año de impresión diverge del año en línea, se cita el de impresión: Wan y Gu (2026); Lemasters y Hurshman (2025); Kudina y de Boer (2025); Yan et al. (2024); Zhang y Tur (2024). Inclusión: pares con DOI Crossref verificado el 22 de septiembre de 2026, slot 09:02 America/Mexico_City, sobre supervisión humana, alfabetización docente, IA centrada en la persona, agencia o límites del modelo en un rol de enseñanza. Se excluyeron los ejes de educación inicial de la serie, los catálogos sin artículo y cualquier cifra ausente de las fuentes. Se usaron las veinticuatro entradas de fuentes.md. No se añadieron autores, revistas ni DOI.

Cada fuente se marca con uno de tres estatus. Hallazgo empírico: lo observado. Marco: argumento o revisión que no ensaya las cuatro pruebas. Inferencia de diseño: lo que este artículo concluye y no puede atribuir como resultado. Sin un estudio que los equivalga a apoyo, chat, score, plan, etiqueta o tablero son límite de categoría. No hay PRISMA propio. Las pruebas de la sección 7 son hipótesis, no norma. Producir trabajo no es gobernar el acto docente.

4. Eje 1. Los artefactos no constituyen apoyo

El apoyo que este eje niega no es el de un adulto en un aula infantil. Es el que un proveedor declara al decir que el docente «ya tiene copiloto». El chat que «enseña» es el primer artefacto. Fisher (2024) fija el límite: ante una pregunta de hechos, el modelo puede soltar contenido sin haber evaluado su verdad. Si el hablante no está bajo esa norma, hay teatro de explicación. Papaioannou (2026) añade un hallazgo de encuadre: la lengua del prompt se asocia con el nombre del episodio, con quién carga la responsabilidad y con la historiografía. El chat hereda un marco; no «cubre el tema». Zhang y Tur (2024) mapean planes y materiales como usos citados, no como veredicto de que el plan sea el acto de enseñar. El apoyo empieza donde alguien con oficio acepta o rechaza ese marco.

El score de confianza no es un criterio escrito antes del uso. Es una señal del sistema sobre su salida, o una métrica de plataforma: este corpus no audita un producto ni inventa un umbral. Zhai et al. (2024) muestran el atajo. La sobredependencia es aceptar la recomendación del diálogo sin pregunta, sobre todo cuando valorar la fiabilidad es difícil. Un score alto reduce la pregunta justo cuando la pregunta es el oficio. Yan et al. (2024) dejan la retroalimentación automática y la calificación entre los retos prácticos y éticos: que un sistema puntúe no significa que el docente haya fijado qué error no se delega. Confianza del modelo y criterio docente no son convertibles. Una habla del sistema. El otro habla de esta situación, esta fuente y esta consecuencia si el marco es falso.

El plan generado tampoco hereda el oficio. Wan y Gu (2026) atan las asequibilidades del diálogo humano–máquina a pedagogía, entorno y plataforma. Un archivo descargado al margen de ese diseño no hereda la revisión. Moorhouse y Kohnke (2024) escuchan a formadores que ven currículo, enseñanza y evaluación ya afectados y que, en su mayoría, no se sienten competentes: el plan desplazaría la brecha al botón de aceptar. Haroud y Saqri (2025) mantienen separados apoyo y sustitución. Un plan que ocupa el criterio cruzó de lado aunque el folleto diga apoyo. Balducci (2024) recuerda que la seguridad de la tarea depende de autenticidad, colaboración y proceso, no de la fluidez. El plan puede ser insumo. Exhibido como la clase, es artefacto.

El agente «autónomo», y el AI teacher o machine teacher de catálogo, cierran en falso la agencia. Nemoto (2026) propone indeterminación, no intencionalidad resuelta. Kim et al. (2026), en dos experimentos con estudiantes de grado en Estados Unidos, reportan que la valoración difiere por género y que la diferencia es más marcada bajo la etiqueta de colaboración humano–IA. Estatus: percepción estudiantil, no auditoría de protocolo. Kudina y de Boer (2025) añaden que funcionalizar el lenguaje adelgaza el juicio. El tablero sin protocolo y el botón que no detiene el acto completan la serie. Alfredo et al. (2024) piden control real, no un gráfico que esconde la traza. Dakshit et al. (2026) piden decisiones rastreables. Fluidez por veracidad, score por criterio, plan por oficio, etiqueta por agencia, tablero por supervisión y botón por veto: ninguna sustitución está en el corpus.

5. Eje 2. El oficio relacional en el jardín

El rótulo es del molde de la serie. El referente, no. No hay aula de educación inicial. El terreno es la relación entre una persona responsable y un sistema que produce texto, planes y puntuaciones. Hay oficio cuando esa persona fija el criterio antes de delegar, lee la traza, puede vetar, nombra al responsable y sabe en qué umbral la decisión deja de ser del modelo. MacPhail et al. (2026) describen, sin hablar de IA, al sujeto: responsabilidad de rol, heterogeneidad, disposición a trabajar con quien se forma y desarrollo profesional que el cargo no resuelve. Un copiloto no recluta esa identidad. El HITL la protege; no la convierte en operación de interfaz.

El primer gesto es el criterio previo, no la impresión de la demo. Anders y Dux Speltz (2025) muestran, del lado del estudiante, que planear incluye conocimiento de dominio y criterios antes de iterar. Esa taxonomía de humano en el bucle no es protocolo docente: el aprendiz sostiene el ciclo. Nabhan y Habók (2026) incluyen evaluación y ética junto a conocimiento, colaboración, contextualización y autonomía profesional: alfabetizado es quien valora, no quien pulsa. Baran et al. (2026) colocan la criticidad en la formación de formadores. Traga Philippakos y Rocconi (2025) separan conocer herramientas y declarar confianza de la necesidad de formación. El criterio se escribe como error intolerable —dato falso, atribución injusta, tarea que el alumnado debía hacer, evaluación que no se delega—, no como score.

El segundo gesto es la traza. Papaioannou (2026) muestra que encuadre y atribución están en la salida y cambian con la lengua de la pregunta: quien no lee acepta el espejo. Dakshit et al. (2026) piden decisiones rastreables para estudiantes, docentes y administración. PEARL se demuestra con simulación; el principio no queda validado como práctica de centro. Alfredo et al. (2024) atan la confianza a participar en el diseño y el despliegue. La traza mínima es lo dicho, con qué consigna y qué quedó fuera, no un resumen de participación. Yan et al. (2024) recuerdan que preguntar, retroalimentar o calificar con un modelo no se vuelve inocuo por adoptarlo. Sin traza hay fe en la fluidez, no revisión.

El tercer gesto es el veto en el momento, no un ajuste de administrador. Brusilovsky (2024) recupera el control del aprendiz como deuda de investigación: es vecino del veto y no es el veto. El estudiante puede querer dirigir su trayectoria y el docente debe poder cortar una explicación falsa. Kotsis y Stylos (2026) sitúan la supervisión humana bajo el Reglamento de IA en STEM europeo: la norma pide vigilancia de personas y no diseña un botón. Zhai et al. (2024) describen el costo de no poder negar la recomendación. Kim et al. (2026) muestran que la etiqueta de colaboración no iguala percepciones. El veto no es promedio de satisfacción.

Atribución y escalamiento van juntos. Nemoto (2026) impide cargar la culpa en una agencia indeterminada. Fisher (2024) impide tratar al modelo como hablante que ya evaluó la verdad. Kudina y de Boer (2025) describen el adelgazamiento de quien debía juzgar. El nombre de quien adopta la salida, y el de quien revisa si entra en evaluación o en contenido sensible, se escriben fuera del modelo. Balducci (2024) y Lemasters y Hurshman (2025) no describen un umbral de copiloto: empujan tareas con proceso humano y, en filosofía, una oralidad que el modelo no sostiene en silencio. Calificar, certificar, tratar un daño, salir del currículo o contradecir una fuente vinculante escala a una persona nombrada, con el corte decidido antes y no cuando el score luce alto.

El sexto gesto es alfabetización crítica. Zhang y Samsudin (2026) oponen disciplina y género textual a un programa genérico. Brünner et al. (2025) hacen ver probabilidad, contexto y manipulación. Haroud y Saqri (2025) mantienen la sustitución distinta del apoyo. Moorhouse y Kohnke (2024) localizan la brecha en confianza y competencia de los formadores: la respuesta es formación, no abdicar el currículo. Saber qué no delegar, cómo leer una traza, cuándo parar y a quién vuelve la responsabilidad es la alfabetización que cuenta. Un curso de consignas puede subir la confianza declarada y dejar el protocolo ausente. El docente usa, corrige o apaga. No es cliente de una función.

6. Contraste. Fronteras de categoría

La supervisión humana no es una autonomía tímida. Nemoto (2026) deja la agencia indeterminada. Kotsis y Stylos (2026) exigen supervisión como condición de la agencia docente bajo el Reglamento, no como letra pequeña de un agente que «ya no necesita» al docente. Kim et al. (2026) estudian máquinas que enseñan como percepción estudiantil: ese rol no es una plaza. Llamar autónomo al copiloto y añadir «con humano en el bucle» en la nota al pie borra la frontera en lugar de cruzarla. HITL niega que el sistema sea el sujeto del acto.

Copiloto y sustituto se separan por quién puede decir que no. Haroud y Saqri (2025) tratan apoyo y reemplazo como categorías que docentes y estudiantes no viven igual. Moorhouse y Kohnke (2024) dejan currículo, enseñanza y evaluación en formadores afectados y a menudo poco preparados: el sujeto sigue siendo el formador. Zhang y Tur (2024) pueden registrar ayuda para planear sin convertir al modelo en planificador responsable. El copiloto produce insumos bajo criterio ajeno. El sustituto ocupa el criterio.

Alfabetización y entrenamiento de clics tampoco coinciden. Nabhan y Habók (2026) desagregan conocimiento, evaluación, colaboración, contextualización, autonomía docente y ética: «sé usar la herramienta» no agota el constructo. Baran et al. (2026), Zhang y Samsudin (2026) y Brünner et al. (2025) buscan criticidad situada, probabilidad, contexto y manipulación, no familiaridad genérica. Anders y Dux Speltz (2025) exigen criterios puestos por la persona antes de iterar. Terminar un taller en «ya puedo generar el plan» puede ser alfabetización funcional y seguir siendo analfabetismo de gobernanza.

La evaluación de un agente no es juicio profesional, y el arnés no es gobernanza. En el sentido del 18 de septiembre, la evaluación mide fiabilidad en una distribución de tareas, no en esta hora. Yan et al. (2024) acumulan retos que una fila de resultados no cierra: ir bien medido al generar ítems no autoriza a calificar donde el umbral no está escrito. En el sentido del 16 de septiembre, el arnés produce trabajo con herramientas, estado, verificación y parada técnica. Esa parada obedece a un presupuesto o a un verificador. No sabe de una fuente vinculante ni de una relación en la que conviene no delegar aunque el verificador esté en verde. Se puede tener arnés y evaluación y no tener apoyo.

El score no es el criterio de aceptación. Zhai et al. (2024) atan la sobredependencia a la dificultad de valorar fiabilidad. Dakshit et al. (2026) piden explicabilidad y decisiones justificables, no un escalar que reemplace el juicio. Un score puede ser pista; no el criterio que debía escribirse antes. Otras fronteras internas se aplastan con la misma prisa. El humano en el bucle de Anders y Dux Speltz (2025) es el estudiante que se autorregula. El control del aprendiz de Brusilovsky (2024) no es el veto docente. La agencia de PEARL no es la atribución institucional. El diálogo de Wan y Gu (2026) puede formar; no gobierna. La oralidad de Lemasters y Hurshman (2025) y los principios de tarea de Balducci (2024) son cortes humanos de otro grano: no instalan, solos, la revisión de trazas. La categoría es conjuntiva. Falta una pieza y el sistema recae en artefacto, aunque la diapositiva diga copiloto.

7. Cuatro pruebas de apoyo (no artefacto)

Lo que sigue es inferencia de diseño de este artículo, anclada en el corpus y no entregada por ninguna fuente como estándar. No es una norma, no es una rúbrica validada y no puntúa productos. Si un chat, un score, un plan, un agente «autónomo», un tablero o un botón no pasa las cuatro pruebas, no puede declararse apoyo profesional.

7.1. Prueba del criterio de aceptación previo al uso, no del score ni de la demo. Anders y Dux Speltz (2025) colocan los criterios antes de iterar. Nabhan y Habók (2026) tratan la evaluación como dimensión de la alfabetización, no como accesorio. Baran et al. (2026) inscriben la criticidad en la formación de formadores. Traga Philippakos y Rocconi (2025) separan conocer la herramienta de estar formado para juzgarla. La prueba se cumple cuando, antes de delegar, está escrito qué salida es aceptable, qué error no se delega y qué usos quedan fuera, por ejemplo certificar o cerrar una disputa de hechos. Si el único criterio es un score alto o una demo que impresionó, la prueba falla. El criterio habla del currículo y del daño posible, no de la seguridad subjetiva del modelo.

7.2. Prueba de trazas revisables por el docente, no del tablero de participación. Dakshit et al. (2026) exigen decisiones rastreables. Papaioannou (2026) muestra que el marco viaja en la salida. Alfredo et al. (2024) atan el control a la participación real, no a un gráfico agregado. Yan et al. (2024) dejan abiertos los retos de preguntar, retroalimentar y calificar: inspeccionar es parte de la respuesta ética. La prueba se cumple cuando el docente puede leer qué se pidió, qué respondió el sistema, qué herramientas intervinieron si las hubo y qué versión llegó al alumnado. Si solo ve participación, tiempo en pantalla o «confianza media», hay vigilancia de exhibición, no revisión.

7.3. Prueba del derecho a veto y a detener, no de la etiqueta de colaboración. Brusilovsky (2024) recuerda que el control no viene dado por la palabra colaborativo, y que el control del aprendiz no agota el veto docente. Kotsis y Stylos (2026) hacen de la supervisión humana una condición de la agencia, no un modo opcional. Zhai et al. (2024) describen el costo de no poder negar la recomendación. Kim et al. (2026) muestran que la colaboración etiquetada no borra diferencias de valoración: el gusto de una parte del grupo no es licencia para seguir. La prueba se cumple cuando el docente puede impedir que una salida llegue, o retirarla, sin esperar otro ciclo de compra y sin que el sistema traduzca el corte a una preferencia de estilo. Si detener exige un privilegio que el docente de aula no tiene, o si el botón solo confirma lo ya entregado, hay coreografía.

7.4. Prueba de atribución explícita de responsabilidad y de umbral de escalamiento. Nemoto (2026) no ofrece un sujeto al que cargar la culpa profesional. Fisher (2024) no ofrece un hablante que haya evaluado la verdad. Kudina y de Boer (2025) describen el adelgazamiento de quien debía juzgar. MacPhail et al. (2026) recuerdan que la responsabilidad de rol es identidad, no una firma al pie de un plan. Moorhouse y Kohnke (2024) dejan a los formadores como sujetos del currículo: la brecha pide formación, no cesión del nombre. Balducci (2024) y Lemasters y Hurshman (2025) mantienen cortes humanos en la tarea y en la oralidad. La prueba se cumple si está escrito quién responde y cuándo escala a una persona nombrada —calificar, daño, salida del currículo, fuente vinculante, desacuerdo que la traza no resuelve—. «La IA es responsable», sin nombre ni umbral, es un descargo.

Las cuatro se leen juntas. Un criterio sin traza no se aplica. Una traza sin veto es un archivo. Un veto sin atribución no dice quién sostiene el corte mañana. Un umbral sin criterio previo se inventa bajo presión, cuando el score más invita a no pensar. Caben en el oficio, como piezas subordinadas, un plan, un diálogo de formación (Wan y Gu, 2026), un ciclo estudiantil (Anders y Dux Speltz, 2025), una explicabilidad al estilo PEARL (Dakshit et al., 2026) o una medición de fiabilidad hecha en otra capa. Ninguna, sola, es apoyo. La autonomía de catálogo no las vuelve un detalle para más adelante.

8. Discusión

Tres tensiones organizan la discusión. La primera opone exhibir artefactos y ejercer el oficio. Fisher (2024), Papaioannou (2026), Nemoto (2026) y Kim et al. (2026) no dicen lo mismo: ausencia de evaluación de verdad, encuadres que se mueven con la lengua, agencia no resuelta, colaboración que no iguala percepciones. El mercado los aplasta en «el docente de IA ya llegó». La pieza puede ser verdadera en su dominio. «Pieza = apoyo profesional» no lo es. Zhang y Tur (2024) pueden listar el plan entre las asequibilidades sin autorizar esa ecuación. Wan y Gu (2026) pueden mostrar diálogo útil para formar sin convertir el chat en el formador.

La segunda opone las capas previas de la serie a la gobernanza. El arnés produce trabajo comprobable. La evaluación mide fiabilidad en una distribución. Las dos pueden estar bien hechas y el acto de esta hora seguir siendo indelegable: porque el marco atribuye mal una responsabilidad histórica (Papaioannou, 2026), porque quien usa el sistema no detecta la falla (Zhai et al., 2024), porque la evaluación no se ha rediseñado (Balducci, 2024; Lemasters y Hurshman, 2025), o porque el Reglamento pide supervisión y agencia docente que un modo autónomo contradice (Kotsis y Stylos, 2026). Comprar arnés y comprar evaluación no compra HITL. Omitir la tercera capa —«el modelo ya es fiable, luego ya apoya»— es un sesgo de exhibición, no una conclusión de las revisiones.

La tercera opone alfabetización crítica y confianza de clic. Moorhouse y Kohnke (2024) encuentran formadores que anticipan el impacto y no se sienten competentes: es un dato, no un fracaso moral. La respuesta coherente con Baran et al. (2026), Zhang y Samsudin (2026), Brünner et al. (2025) y Nabhan y Habók (2026) es formación con evaluación, ética, contexto y criticidad situada. La incoherente es un taller de consignas que sube la confianza declarada (Traga Philippakos y Rocconi, 2025) y la llama alfabetización. Haroud y Saqri (2025) muestran que la apertura a adoptar no se distribuye igual entre estudiantes y docentes, y que apoyo y sustitución no son sinónimos. Confundir entusiasmo de uso con protocolo deja el centro gobernado por quien más quiere delegar.

Las pruebas leen esas tensiones como hipótesis, no como hallazgo de aula. PEARL es simulación (Dakshit et al., 2026). MacPhail et al. (2026) no estudiaron copilotos. El humano en el bucle de Anders y Dux Speltz (2025) es estudiantil, y el control de Brusilovsky (2024) es una agenda, no un botón de veto. Criterio, traza, veto y nombre con umbral son una candidatura a apoyo. Chat, score, plan, etiqueta, tablero o botón, solos, son consumo.

9. Límites

La revisión es narrativa. No estima efectos combinados ni aplica un PRISMA propio. No se inventan tamaños de muestra, d, r, AUC ni porcentajes, aunque algunas fuentes los reporten. Nabhan y Habók (2026) validan un constructo, no rankean docentes. Zhang y Samsudin (2026) se leen por el paso de familiaridad a criticidad, no por un efecto importado. Kim et al. (2026) hablan de estudiantes de grado, no del profesorado. Moorhouse y Kohnke (2024) recogen percepciones en Hong Kong. Papaioannou (2026) es un caso historiográfico. Brünner et al. (2025) y Baran et al. (2026) diseñan formación; no auditan productos.

Otras fuentes son suelo o vecino, no evidencia directa del protocolo. MacPhail et al. (2026) estudian identidad de formadores en la escuela. Fisher (2024), Nemoto (2026) y Kudina y de Boer (2025) argumentan. Balducci (2024) opina sobre tareas. Lemasters y Hurshman (2025) proponen un giro oral. Dakshit et al. (2026) simulan PEARL. Anders y Dux Speltz (2025) documentan prácticas estudiantiles. Brusilovsky (2024) reseña control del aprendiz. Alfredo et al. (2024), Yan et al. (2024), Zhang y Tur (2024), Zhai et al. (2024) y Wan y Gu (2026) mapean campos; no certifican un copiloto. Kotsis y Stylos (2026) analizan norma y agencia en STEM europeo, no un protocolo de centro. Haroud y Saqri (2025) y Traga Philippakos y Rocconi (2025) describen percepciones y necesidades, no el cumplimiento de las cuatro pruebas.

En este kit no hay un ensayo que equivalga chat, score, plan o etiqueta de autonomía a apoyo con criterio, traza, veto y atribución. Esa ausencia es límite de categoría, no un tamaño de daño. No se auditan contratos ni se condenan marcas. Las cuatro pruebas no son un instrumento validado. El rótulo «jardín» del encabezado 5 no transfiere hallazgos de educación inicial: este artículo no estudia ese nivel. El corpus está en inglés y la síntesis es editorial en español. La pila arnés, evaluación y HITL es una distinción de la serie, no un resultado empírico de las veinticuatro fuentes.

10. Conclusiones

Un chat que «enseña», un score, un plan o un agente «autónomo» no constituyen apoyo profesional si falta supervisión docente. Tampoco un tablero ni un botón de aceptar. El oficio es el juicio que delega, corrige o detiene. Fisher (2024), Papaioannou (2026), Nemoto (2026), Zhai et al. (2024), Kim et al. (2026) y Zhang y Tur (2024) fijan el techo: fluidez sin evaluación de verdad, encuadre en la salida, agencia indeterminada, sobredependencia, colaboración que no iguala percepciones, y planes que son asequibilidad de la literatura, no oficio.

Donde hay oficio hay sujeto y protocolo. MacPhail et al. (2026) y Moorhouse y Kohnke (2024) dejan la responsabilidad en quien forma, aunque se sienta poco seguro: la respuesta es formación, no cesión. Nabhan y Habók (2026), Baran et al. (2026), Zhang y Samsudin (2026), Brünner et al. (2025), Anders y Dux Speltz (2025), Traga Philippakos y Rocconi (2025) y Haroud y Saqri (2025) mueven la alfabetización del clic a la evaluación, la ética, la criticidad y la distinción entre apoyo y sustitución. Alfredo et al. (2024), Brusilovsky (2024), Dakshit et al. (2026) y Kotsis y Stylos (2026) piden control, supervisión y decisiones rastreables. Yan et al. (2024), Kudina y de Boer (2025), Lemasters y Hurshman (2025), Balducci (2024) y Wan y Gu (2026) impiden cerrar el problema con un rol de catálogo.

La pila no se sustituye por dentro. El arnés produce trabajo. La evaluación mide fiabilidad. La supervisión humana gobierna la delegación en situación, con cuatro pruebas conjuntivas: criterio previo, trazas que el docente puede revisar, derecho a veto y atribución explícita con umbral de escalamiento. Donde las fuentes no midieron ese protocolo, este artículo no lo da por medido. Donde midieron encuadres, percepciones, constructos o argumentos, no se traducen en «el agente ya apoya». Convertir un sistema generativo en apoyo es ejercer juicio sobre cuándo sirve, cuándo se corrige y cuándo se detiene. Lo demás es chat, puntuación, plan o autonomía de marketing. No es oficio, y no debe presentarse como lo que no es.

Laboratorio Editorial de NEXTECH.IA / Ingeniero Mitre.

Referencias

  1. Alfredo, R., Echeverria, V., Jin, Y., Yan, L., Swiecki, Z., Gašević, D., y Martinez-Maldonado, R. (2024). Human-centred learning analytics and AI in education: A systematic literature review. Computers and Education: Artificial Intelligence, 6, Article 100215. https://doi.org/10.1016/j.caeai.2024.100215
  2. Anders, A. D., y Dux Speltz, E. (2025). Developing generative AI literacies through self-regulated learning: A human-centered approach. Computers and Education: Artificial Intelligence, 9, Article 100482. https://doi.org/10.1016/j.caeai.2025.100482
  3. Balducci, B. (2024). AI and student assessment in human-centered education. Frontiers in Education, 9, Article 1383148. https://doi.org/10.3389/feduc.2024.1383148
  4. Baran, E., Dilek, M., Ziba, M., y Xiao, X. (2026). Human-centered AI for teacher educators: Designing professional learning for critical AI literacy. Computers and Education Open, 11, Article 100399. https://doi.org/10.1016/j.caeo.2026.100399
  5. Brünner, B., Schön, S., y Ebner, M. (2025). From Gretel to Strudelcity: Empowering teachers regarding generative AI for enhanced AI literacy with CollectiveGPT. Education Sciences, 15(2), Article 206. https://doi.org/10.3390/educsci15020206
  6. Brusilovsky, P. (2024). AI in education, learner control, and human-AI collaboration. International Journal of Artificial Intelligence in Education, 34(1), 122–135. https://doi.org/10.1007/s40593-023-00356-z
  7. Dakshit, S., Mokhtari, K., y Khalid, A. (2026). Designing understandable and fair AI for learning: The PEARL framework for human-centered educational AI. Education Sciences, 16(2), Article 198. https://doi.org/10.3390/educsci16020198
  8. Fisher, S. A. (2024). Large language models and their big bullshit potential. Ethics and Information Technology, 26(4), Article 67. https://doi.org/10.1007/s10676-024-09802-5
  9. Haroud, S., y Saqri, N. (2025). Generative AI in higher education: Teachers’ and students’ perspectives on support, replacement, and digital literacy. Education Sciences, 15(4), Article 396. https://doi.org/10.3390/educsci15040396
  10. Kim, J., Spence, P. R., y Kelly, S. (2026). Machine teachers and human-AI collaboration: Student differences in perceptions of AI-based education. Interactive Learning Environments. Advance online publication. https://doi.org/10.1080/10494820.2026.2667455
  11. Kotsis, K. T., y Stylos, G. (2026). The AI Act and the future of STEM education in Europe: Rethinking pedagogy, assessment, and teacher agency. Frontiers in Education, 11, Article 1845045. https://doi.org/10.3389/feduc.2026.1845045
  12. Kudina, O., y de Boer, B. (2025). Large language models, politics, and the functionalization of language. AI and Ethics, 5(3), 2367–2379. https://doi.org/10.1007/s43681-024-00564-w
  13. Lemasters, R., y Hurshman, C. (2025). A shift towards oration: Teaching philosophy in the age of large language models. AI and Ethics, 5(2), 1203–1215. https://doi.org/10.1007/s43681-024-00455-0
  14. MacPhail, A., Vanassche, E., Guberman, A., Czerniawski, G., y Boks-Vlemmix, J. (2026). School-based teacher educators’ professional identity and professional needs. Teaching and Teacher Education, 176, Article 105523. https://doi.org/10.1016/j.tate.2026.105523
  15. Moorhouse, B. L., y Kohnke, L. (2024). The effects of generative AI on initial language teacher education: The perceptions of teacher educators. System, 122, Article 103290. https://doi.org/10.1016/j.system.2024.103290
  16. Nabhan, S., y Habók, A. (2026). Language teachers’ AI literacy: A psychometric study based on the ED-AI framework. Computers and Education: Artificial Intelligence, 10, Article 100583. https://doi.org/10.1016/j.caeai.2026.100583
  17. Nemoto, R. (2026). Continuous intentionality and indeterminate agency in large language models. AI and Ethics, 6(3), Article 322. https://doi.org/10.1007/s43681-026-01181-5
  18. Papaioannou, C. (2026). Language and the framing of historical narrative in large language models: The case of Asia Minor (1922). AI and Ethics, 6(3), Article 262. https://doi.org/10.1007/s43681-026-01138-8
  19. Traga Philippakos, Z. A., y Rocconi, L. (2025). AI literacy: Elementary and secondary teachers’ use of AI-tools, reported confidence, and professional development needs. Education Sciences, 15(9), Article 1186. https://doi.org/10.3390/educsci15091186
  20. Wan, P., y Gu, X. (2026). Developing teachers’ professional abilities: A systematic review of human-machine dialogic learning for teacher education. Interactive Learning Environments, 34(2), 615–639. https://doi.org/10.1080/10494820.2025.2507280
  21. Yan, L., Sha, L., Zhao, L., Li, Y., Martinez-Maldonado, R., Chen, G., Li, X., Jin, Y., y Gašević, D. (2024). Practical and ethical challenges of large language models in education: A systematic scoping review. British Journal of Educational Technology, 55(1), 90–112. https://doi.org/10.1111/bjet.13370
  22. Zhang, P., y Tur, G. (2024). A systematic review of ChatGPT use in K-12 education. European Journal of Education, 59(2), Article e12599. https://doi.org/10.1111/ejed.12599
  23. Zhang, Y., y Samsudin, M. A. (2026). From familiarity to criticality: Cultivating EFL teachers’ AI literacy through an AI-integrated genre-based pedagogy. Education Sciences, 16(1), Article 150. https://doi.org/10.3390/educsci16010150
  24. Zhai, C., Wibowo, S., y Li, L. D. (2024). The effects of over-reliance on AI dialogue systems on students’ cognitive abilities: A systematic review. Smart Learning Environments, 11(1), Article 28. https://doi.org/10.1186/s40561-024-00316-7