1. Introducción y problema
En un taller de escritura de bachillerato, el entorno de aprendizaje junta cuatro objetos al devolver un borrador. Un banco de comentarios automáticos marca «desarrolla la tesis» y «varía el vocabulario». Al margen, un score de rúbrica generado por un modelo de lenguaje asigna un nivel a coherencia. Debajo, un dashboard de similitud colorea solapamientos con un corpus. Un chatbot invita a «escribe mejor» el párrafo señalado. El contrato llama al conjunto evaluación formativa y al docente le deja un botón de publicar la devolución. La escena no es un dato de campo de este artículo: es el techo de exhibición que el mercado ya trata como oficio. No está escrito, antes del uso, qué meta de aprendizaje autoriza esa devolución. No hay criterio interpretativo que el docente pueda revisar, ni diálogo con quien escribió, ni ciclo de revisión, ni nombre de quién decide el avance.
La tesis no cabe en el título breve. Esos objetos no constituyen evaluación formativa si falta el protocolo de mediación docente. El oficio es el juicio que elige qué feedback importa, cuándo devolverlo y cómo convertirlo en evidencia de aprendizaje. Davies (2026) sitúa el GenAI para devolver comentarios formativos sobre borradores: el objeto es el feedback sobre el draft, no la equivalencia entre un banco automático y una práctica formativa. Pack, Barrett y Escalante (2024) examinan validez y fiabilidad del AES de aprendices de inglés con LLM: el objeto es el score, no el ciclo. Tate et al. (2024) preguntan si la IA puede ofrecer una puntuación holística útil: la utilidad del score no es, por sí, mediación. Estatus: práctica de feedback generativo en un caso; hallazgo empírico de scoring en los otros. Ninguno prueba que el comentario automático «ya evalúa de forma formativa». Preguntan si se midió un score o si se ejerció un oficio de devolución.
El texto se apoya en tres distinciones de la serie y no las rehace. El 16 de septiembre de 2026 el arnés se entendió como la capa que vuelve trabajo la capacidad generativa: herramientas acotadas, estado, verificadores, parada. El 18, la evaluación de agentes mide si ese trabajo es fiable frente a un criterio externo a la prosa del modelo. El 22, la supervisión humana en el bucle gobierna al copiloto: criterio de aceptación, trazas, veto, atribución y umbral de escalamiento. Ninguna de esas tres capas es el juicio evaluativo formativo de quien tiene un grupo, una asignatura y un ciclo de aprendizaje. Un sistema puede producir comentarios y no mediar. Puede puntuar con fiabilidad de scoring y no formar. Puede estar gobernado como copiloto y no devolver evidencia de aprendizaje. Inferencia de diseño, no hallazgo propio: sin mediación docente hay producto de feedback y hay métrica; no hay evaluación formativa.
Seis sustituciones ilegítimas organizan el problema. Tratar el feedback GenAI como evaluación formativa: Banihashem et al. (2024) comparan fuentes —pares o IA—; la fuente no es el protocolo. Tratar el AES como juicio docente: Li y Liu (2024) puntúan japonés no nativo; Choi et al. (2026) hacen del ancla la clave de un AES por prompting; Kim y Holden (2026) contrastan API y GUI. El score no es el aprendizaje: Pan (2025) indexa feedback generativo a una rúbrica; la indexación no firma el ciclo. Tratar el peer con IA como sustituto: Guo et al. (2024) estudian peer apoyado por IA; Bauer et al. (2023) quieren que el PLN apoye el intercambio, no que lo reemplace. Confundir literacy de prompts con literacy evaluativa: Kokoç et al. (2026), Yang y Banks (2025) y Zhang et al. (2025) mapean alfabetización docente, de formadores y estudiantil; saber pedir al modelo no es saber juzgar el avance. Creer que el arnés, la eval de agente o el HITL ya median: Yan et al. (2024) cartografían retos prácticos y éticos; Alfredo et al. (2024) y Capel y Brereton (2023) recuerdan que lo centrado en la persona no es el catálogo. Este artículo separa artefactos y mediación y propone cuatro pruebas que no son norma. No se inventan N, d, r, AUC, porcentajes ni DOI.
2. Estado del arte: práctica situada vs artefacto
El discurso de «evaluación formativa con IA» aplasta cuatro estratos. El primero es el AES con modelos de lenguaje como problema de validez, fiabilidad, ancla e interfaz (Pack et al., 2024; Li y Liu, 2024; Choi et al., 2026; Kim y Holden, 2026; Tate et al., 2024). El segundo es el GenAI como fuente de feedback sobre borradores o indexado a rúbrica (Davies, 2026; Pan, 2025; Banihashem et al., 2024). El tercero es el peer con apoyo de IA o de PLN, y el entrenamiento de quien comenta (Guo et al., 2024; Bauer et al., 2023; Xu et al., 2024; Prilop y Weber, 2023). El cuarto es la alfabetización, la evaluación humano-céntrica y la competencia colaborativa (Kokoç et al., 2026; Yang y Banks, 2025; Zhang et al., 2025; Alfredo et al., 2024; Yan et al., 2024; Capel y Brereton, 2023; Balducci, 2024; Cui et al., 2026; Goslen et al., 2025). El artefacto vive en el anuncio del grader. La práctica situada vive en la meta, el criterio, el diálogo y el nombre de quien juzga.
En scoring, Pack et al. (2024) saturan el techo de validez y fiabilidad cuando un LLM puntúa escritura de aprendices de inglés: hallazgo empírico de AES, no de evaluación formativa. Li y Liu (2024) extienden la aplicación a japonés no nativo: el objeto sigue siendo puntuar. Choi et al. (2026) argumentan que el ancla es la clave de un AES accesible por prompting: el ancla es técnica de scoring, no criterio interpretativo dialogado. Kim y Holden (2026) contrastan API y GUI: cambiar la superficie de puntuación no instala un ciclo de revisión. Tate et al. (2024) preguntan por la utilidad de una puntuación holística: «útil» no autoriza a leer el número como evidencia de aprendizaje. Inferencia de categoría: el estado del arte del AES autoriza a pedir validez de score; no a vender el score como mediación formativa.
En feedback y en peer, Davies (2026) trata el GenAI como devolución formativa sobre drafts: nombra el uso; no equivale un banco automático a un oficio de aula. Pan (2025) indexa el feedback a una rúbrica en inglés médico: estrategia declarada, no prueba de que la rúbrica autoaplicada sustituya al docente. Banihashem et al. (2024) oponen fuentes —pares o IA—: comparar procedencia no cierra el protocolo. Guo et al. (2024) ensayan peer apoyado por IA sobre calidad del comentario y escritura: hallazgo de apoyo al par, no de sustitución del juicio. Bauer et al. (2023) proponen un marco: el PLN sostiene el peer; no lo vuelve formativo por generar texto. Xu et al. (2024) estudian la visualización del peer-assessment en docentes en formación: ver el feedback no es mediarlo. Prilop y Weber (2023) muestran que el feedback experto, en un entrenamiento digital con video, incide en creencias y en calidad del comentario: el experto sigue siendo mediador. Inferencia: hay práctica situada cuando alguien con oficio sostiene el ciclo; hay artefacto cuando la fuente o la visualización ocupan su lugar.
En alfabetización y diseño humano-céntrico, Kokoç et al. (2026) revisan literacy en IA de docentes en servicio: el mapa no es literacy evaluativa. Yang y Banks (2025) sitúan la alfabetización en formadores de primaria, no en un taller de prompts. Zhang et al. (2025) validan un inventario estudiantil: el constructo no es el juicio de calificación. Alfredo et al. (2024) revisan analítica e IA centradas en la persona: excluir a docentes y estudiantes del diseño alimenta desconfianza. Capel y Brereton (2023) preguntan qué hay de humano-céntrico en esa etiqueta: el mapa no autoriza a llamar centrado a un grader. Balducci (2024) sitúa la evaluación en una educación humano-céntrica: el acto no se agota en la automatización. Cui et al. (2026) evalúan competencia colaborativa humano–IA en escritura de L2: el objeto es la competencia conjunta, no el score. Goslen et al. (2025) generan planes de estudiante con LLM para andamiaje en juego: el plan no es juicio formativo. Yan et al. (2024) dejan abiertos retos de calificar y de retroalimentar con modelos. Inferencia: el estado del arte distingue scoring, fuente, apoyo al par, literacy y marco; el mercado los aplasta.
3. Método de revisión
Se hizo una revisión narrativa crítica, no un metaanálisis ni una tasa de «éxito del feedback GenAI». El argumento es de categoría: qué cuenta como evaluación formativa cuando un docente media comentarios, scores y chatbots, y qué queda en artefacto. La ventana es 2021–2026. El foco es evaluación formativa con GenAI, AES-LLM, peer+AI o PLN, y alfabetización en IA de docentes y estudiantes. Si el año de impresión diverge del año en línea, se cita el de impresión: Cui et al. (2026) pese al DOI 2025; Yang y Banks (2025) pese a 2024 en línea; Yan et al. (2024) pese a 2023 en línea. Inclusión: pares con DOI Crossref verificado el 23 de septiembre de 2026, slot 09:02 America/Mexico_City. Se excluyeron los ejes de educación inicial de la serie, los catálogos sin artículo y cualquier cifra ausente de las fuentes. Se usaron las veintiuna entradas de fuentes.md. No se añadieron autores, revistas ni DOI.
Cada fuente se marca con uno de tres estatus. Hallazgo empírico: lo observado en scoring, en fuentes de feedback, en peer apoyado por IA, en visualización o en entrenamiento de comentarios. Marco: revisión, agenda, mapa o instrumento que no ensaya las cuatro pruebas. Inferencia de diseño: lo que este artículo concluye y no puede atribuir como resultado. Sin un estudio que los equivalga a evaluación formativa, el banco de comentarios, el score AES-LLM, el dashboard, el chatbot, la rúbrica autoaplicada y el grader de catálogo son límite de categoría. No hay PRISMA propio. Las pruebas de la sección 7 son hipótesis, no norma. No se inventan N, d, r, AUC, porcentajes de acuerdo interjueces ni DOI.
4. Eje 1. Los artefactos no constituyen apoyo
El apoyo que este eje niega no es el de un adulto en un aula infantil. Es el que un proveedor declara al decir que el docente «ya tiene evaluación formativa» porque el sistema comentó el borrador. El banco de comentarios GenAI es el primer artefacto. Davies (2026) nombra el uso de modelos generativos para devolver feedback formativo sobre drafts: pegar frases al margen puede coexistir con la ausencia de una meta previa y de un diálogo. El banco habla en plantillas, como si ya hubiera leído el currículo. «Desarrolla la tesis» no dice cuál tesis, para qué criterio ni en qué ciclo. Inferencia restrictiva: un almacén de comentarios no es una práctica formativa. Puede ser insumo. Exhibido como la evaluación, es techo.
El score AES-LLM no es un juicio docente. Pack et al. (2024) fijan el problema en validez y fiabilidad de la puntuación de aprendices de inglés: el hallazgo vive en el score, no en el aula como ciclo. Li y Liu (2024) aplican el mismo objeto a japonés no nativo. Choi et al. (2026) desplazan la accesibilidad hacia el prompting y el ancla: el ancla calibra al modelo; no conversa con el aprendiz. Kim y Holden (2026) muestran que la interfaz —API o GUI— cambia el modo de puntuar; no instala atribución. Tate et al. (2024) preguntan por la utilidad holística: un número «útil» para rankear no es evidencia de que alguien aprendió. Yan et al. (2024) dejan la retroalimentación automática y la calificación entre los retos prácticos y éticos: que un sistema puntúe no significa que el docente haya fijado qué error no se delega. Confianza del modelo y criterio interpretativo no son convertibles.
El dashboard de similitud y el chatbot de «escribe mejor» completan la gramática de exhibición. Xu et al. (2024) estudian la visualización del peer-assessment: ver datos puede tocar alfabetización de datos, motivación y carga; no autoriza a tratar un tablero de similitud como mediación. El color del solapamiento no dice si el préstamo es aprendizaje, cita o atajo. El chatbot que reescribe el párrafo ocupa el lugar del borrador siguiente: Goslen et al. (2025) generan planes de estudiante con LLM para andamiaje en juego —objeto vecino— y recuerdan que producir un plan o una reescritura no es juzgar el avance. Banihashem et al. (2024) pueden comparar un feedback de IA con uno de pares sin convertir al chatbot en el sujeto del ciclo. El aprendiz que pega el output en la siguiente entrega no ha revisado: ha sustituido. Sin diálogo no hay evaluación formativa; hay cosmética del texto.
La rúbrica autoaplicada y el «AI grader» de marketing cierran en falso el criterio. Pan (2025) indexa el feedback generativo a una rúbrica en inglés médico y lo declara estrategia formativa: la indexación es un diseño de prompt; no es el criterio interpretativo revisable por quien enseña. Balducci (2024) sitúa la evaluación en una educación humano-céntrica: automatizar la rúbrica no hereda ese centrado. Capel y Brereton (2023) impiden llamar humano-céntrico a lo que solo exhibe una persona en el folleto. Alfredo et al. (2024) piden control real, no un gráfico que esconde quién puntúa. El grader de catálogo aplasta scoring, feedback y calificación en una sola palabra. Inferencia de categoría: banco, score, dashboard, chatbot, rúbrica autoaplicada y grader comparten una gramática de sustitución. Ninguna está autorizada por el corpus.
5. Eje 2. El oficio relacional en el jardín
El rótulo es del molde de la serie. El referente, no. No hay aula de educación inicial. El terreno es la relación entre una persona responsable de una asignatura y un sistema que produce comentarios, scores, reescrituras y rúbricas. Hay oficio cuando esa persona fija metas antes de usar el modelo, sostiene criterios interpretativos que puede revisar, dialoga con el aprendiz, abre ciclos de revisión, nombra quién decide la calificación o el avance, y alfabetiza el feedback —el propio y el del estudiante—. Prilop y Weber (2023) muestran, sin hablar de GenAI como grader, que el feedback experto cambia creencias y calidad del comentario de quienes se forman: el sujeto que media no se descarga en una plantilla. Un banco de comentarios no recluta esa identidad.
El primer gesto es la meta de aprendizaje previa al uso del modelo, no la impresión de la demo. El criterio no nace del output. Balducci (2024) impide empezar por la herramienta: la evaluación del estudiante, en una educación humano-céntrica, se diseña como acto, no como plugin. Davies (2026) puede devolver comentarios sobre drafts solo si alguien ya sabía qué se aprendía en ese draft. Pan (2025) indexa a rúbrica: si es de la asignatura y anterior al modelo, puede ser insumo; si nace del prompt, es artefacto. Zhang et al. (2025) miden literacy en IA del estudiante, no la meta de la tarea. Inferencia: la meta se escribe como desempeño observable y como error que no se delega. No se escribe como score alto.
El segundo gesto es el criterio interpretativo revisable por el docente. Choi et al. (2026) tratan el ancla como clave del AES por prompting: el ancla calibra al modelo; el criterio de aula se discute, se ajusta y se enseña. Pack et al. (2024) y Li y Liu (2024) pueden describir la validez de un score sin que ese score sea el criterio de esta consigna. Kim y Holden (2026) cambian la interfaz de puntuación: la GUI no es la rúbrica viva. Tate et al. (2024) preguntan por utilidad holística: un holístico opaco no se revisa. Alfredo et al. (2024) atan la confianza a participar en el diseño. Inferencia de diseño: hay criterio cuando el docente puede decir qué cuenta como «suficiente cohesión» en este género, con este grupo, y enmendar esa lectura después de ver los borradores. Si el único criterio es el número que devolvió el modelo, hay scoring, no mediación.
El tercer gesto es el diálogo con el aprendiz y el ciclo de revisión. Guo et al. (2024) sitúan el peer apoyado por IA en la calidad del feedback y en la escritura: el par sigue siendo interlocutor. Bauer et al. (2023) quieren que el PLN sostenga ese intercambio, no que lo cierre. Banihashem et al. (2024) comparan fuentes: la comparación solo importa si alguien devuelve el texto a un ciclo. Xu et al. (2024) visualizan el peer-assessment: la visualización puede informar; no habla con el aprendiz. Prilop y Weber (2023) entrenan el comentario: entrenar es ya un diálogo mediado. Davies (2026) trabaja sobre drafts: el draft exige una versión siguiente, no un veredicto. Inferencia: hay evaluación formativa cuando el comentario entra en una conversación y produce una revisión atribuible. Si el chatbot reescribe y el estudiante entrega esa versión, el ciclo se ha saltado.
Atribución y alfabetización de feedback van juntas. Cui et al. (2026) evalúan la competencia colaborativa humano–IA en escritura de L2: el marco obliga a decir quién hace qué. Ese «quién» es vecino de la atribución del juicio, no su sustituto. Yan et al. (2024) impiden tratar la calificación automática como gesto inocuo. Capel y Brereton (2023) impiden esconder a la persona detrás de la etiqueta. Kokoç et al. (2026) mapean literacy docente: saber usar la herramienta no es saber devolver un juicio. Yang y Banks (2025) colocan la alfabetización en formadores, no en un clic. Zhang et al. (2025) dan un instrumento estudiantil: literacy de IA no es literacy evaluativa. Goslen et al. (2025) recuerdan el vecino del plan generado: andamiar un juego no nombra quién califica. El nombre de quien adopta el score, y el de quien decide el avance, se escriben fuera del modelo. El docente media, corrige o apaga. No es cliente de un grader.
6. Contraste. Fronteras de categoría
El feedback GenAI no es evaluación formativa. Davies (2026) y Pan (2025) pueden describir devoluciones generativas —sobre drafts o indexadas a rúbrica— sin autorizar la ecuación. Banihashem et al. (2024) muestran que la fuente puede ser la IA: la fuente no es el ciclo. Llamar formativo al comentario automático y añadir «con el docente en el bucle» en la nota al pie borra la frontera en lugar de cruzarla. La evaluación formativa niega que el sistema sea el sujeto del juicio.
El AES no es el juicio docente, y el score no es el aprendizaje. Pack et al. (2024), Li y Liu (2024), Choi et al. (2026), Kim y Holden (2026) y Tate et al. (2024) construyen un problema de puntuación: validez, fiabilidad, ancla, interfaz, utilidad holística. Ninguno instala un diálogo ni una atribución de calificación. Un AES bien medido puede ser insumo de una rúbrica. Convertido en el avance del estudiante, cruzó de lado. Xu et al. (2024) pueden visualizar el peer-assessment sin que el color sea el aprendizaje. Inferencia restrictiva: el número habla del texto frente a un modelo de score; el aprendizaje habla de un cambio atribuible, leído por alguien con criterio.
El peer con IA no sustituye al docente, y la literacy de prompts no es literacy evaluativa. Guo et al. (2024) y Bauer et al. (2023) tratan el apoyo al par como objeto: el docente sigue diseñando la tarea y, si hay calificación, sigue firmándola. Prilop y Weber (2023) necesitan al experto para formar el comentario. Kokoç et al. (2026), Yang y Banks (2025) y Zhang et al. (2025) desagregan alfabetización en IA —docente en servicio, formador, estudiante—: «sé pedir al modelo» no es saber qué cuenta como evidencia de avance. Terminar un taller en «ya puedo generar la rúbrica» puede ser alfabetización funcional y seguir siendo analfabetismo evaluativo.
El arnés no es mediación formativa, la eval de agente no es rúbrica de aula, y el HITL no es la atribución del juicio de calificación. El 16 de septiembre el arnés produce trabajo con herramientas, estado, verificación y parada: un banco puede estar bien arnesado y seguir sin meta. El 18, la eval de un agente mide fiabilidad en una distribución: ir bien medido al puntuar no autoriza a calificar donde el umbral no está escrito. El 22, el HITL gobierna al copiloto con veto y traza: se puede vetar un comentario y no haber dialogado ni nombrado quién decide el avance. Goslen et al. (2025) ilustran otra frontera: generar un plan de estudiante es andamiaje, no juicio formativo. Cui et al. (2026) evalúan competencia colaborativa: no equivalen esa competencia a la firma de una nota. Yan et al. (2024), Alfredo et al. (2024), Capel y Brereton (2023) y Balducci (2024) impiden cerrar el problema con un grader de catálogo. La categoría es conjuntiva: falta una pieza y el sistema recae en artefacto, aunque la diapositiva diga evaluación formativa.
7. Cuatro pruebas de apoyo (no artefacto)
Lo que sigue es inferencia de diseño de este artículo, anclada en el corpus y no entregada por ninguna fuente como estándar. No es una norma, no es una rúbrica validada y no puntúa productos. Si un banco de comentarios, un score AES-LLM, un dashboard, un chatbot de «escribe mejor», una rúbrica autoaplicada o un grader de marketing no pasa las cuatro pruebas, no puede declararse evaluación formativa.
7.1. Prueba de las metas de aprendizaje previas al uso del modelo, no del banco de comentarios ni de la demo. Balducci (2024) coloca la evaluación del estudiante en un diseño humano-céntrico anterior a la herramienta. Davies (2026) trabaja sobre drafts: el draft es de una tarea que alguien definió. Pan (2025) indexa a rúbrica: si es previa, puede orientar; si es un output más, no. Zhang et al. (2025) miden literacy de IA del estudiante: un inventario no sustituye la meta de la asignatura. La prueba se cumple cuando, antes de pegar el modelo al borrador, está escrito qué se espera aprender, qué error no se delega y qué usos quedan fuera, por ejemplo certificar. Si el único criterio es un comentario fluido o una demo que impresionó, la prueba falla.
7.2. Prueba de criterios interpretativos revisables por el docente, no del score AES ni del ancla de prompting. Pack et al. (2024), Li y Liu (2024) y Tate et al. (2024) hablan de validez, fiabilidad o utilidad de un score: eso no es el criterio de esta consigna. Choi et al. (2026) hacen del ancla la clave del AES accesible: el ancla no se discute con el grupo. Kim y Holden (2026) cambian API y GUI: la interfaz no interpreta. Alfredo et al. (2024) piden participación real en el diseño. La prueba se cumple cuando el docente puede leer, enmendar y enseñar qué cuenta como desempeño en este género, y un desacuerdo entre score y lectura humana no se resuelve a favor del número por defecto. Si solo ve un holístico o una rúbrica autoaplicada, hay scoring de exhibición, no criterio.
7.3. Prueba del diálogo y del ciclo de revisión con el aprendiz, no del chatbot que reescribe ni del dashboard que colorea. Guo et al. (2024) y Bauer et al. (2023) sostienen el peer como intercambio. Banihashem et al. (2024) comparan fuentes: la fuente entra en el ciclo o queda en el margen. Xu et al. (2024) visualizan: ver no es conversar. Prilop y Weber (2023) entrenan el comentario con un experto. Davies (2026) exige, por el objeto del draft, una versión siguiente. Goslen et al. (2025) generan planes: el plan no es la revisión del ensayo. La prueba se cumple cuando el aprendiz recibe el feedback, puede preguntar, produce una revisión atribuible y alguien la lee. Si el chatbot entrega el párrafo «mejor» y esa versión se publica, hay sustitución del proceso. Si el dashboard colorea y nadie habla, hay vigilancia de similitud, no mediación.
7.4. Prueba de atribución explícita del juicio evaluativo: quién decide la calificación o el avance. Cui et al. (2026) obligan a articular la competencia colaborativa: el marco no ofrece un sujeto al que cargar la nota sin nombrarlo. Yan et al. (2024) no ofrecen una calificación automática inocua. Capel y Brereton (2023) no dispensan de la persona. Kokoç et al. (2026) y Yang y Banks (2025) dejan la literacy en docentes y formadores: la brecha pide formación, no cesión del nombre. Balducci (2024) mantiene el acto evaluativo en una educación de personas. La prueba se cumple si está escrito quién adopta, corrige o descarta el score y el comentario, y cuándo el avance se declara —o se niega— con nombre propio. «La IA calificó», sin nombre ni umbral, es un descargo. Las cuatro se leen juntas: meta sin criterio no se aplica; criterio sin diálogo es un archivo; diálogo sin atribución no sostiene el juicio mañana; atribución sin meta previa se inventa bajo presión.
8. Discusión
Tres tensiones organizan la discusión. La primera opone exhibir artefactos y ejercer el oficio de mediación. Pack et al. (2024), Li y Liu (2024), Choi et al. (2026), Kim y Holden (2026) y Tate et al. (2024) no dicen lo mismo: validez, fiabilidad, ancla, interfaz, utilidad holística. El mercado los aplasta en «el grader ya evalúa». La pieza puede ser verdadera en su dominio; «pieza = evaluación formativa» no lo es. Davies (2026) y Pan (2025) pueden mostrar devoluciones generativas sin autorizar esa ecuación. Banihashem et al. (2024) pueden contrastar fuentes sin convertir a la IA en el sujeto del ciclo.
La segunda opone las capas previas de la serie a la mediación formativa. El arnés produce trabajo comprobable. La evaluación de agentes mide fiabilidad en una distribución. El HITL gobierna la delegación en situación. Las tres pueden estar bien hechas y el feedback de esta tarea seguir sin formar: porque el score no era la meta (Pack et al., 2024; Tate et al., 2024), porque nadie dialogó el comentario (Guo et al., 2024; Prilop y Weber, 2023), porque la rúbrica se autoaplicó (Pan, 2025), o porque el nombre de quien califica quedó vacío (Cui et al., 2026; Yan et al., 2024). Comprar arnés, eval y HITL no compra evaluación formativa. Omitir la cuarta capa —«el modelo ya comenta, luego ya forma»— es un sesgo de exhibición, no una conclusión de las revisiones.
La tercera opone alfabetización evaluativa y confianza de prompt. Kokoç et al. (2026) encuentran un campo empírico de literacy docente en servicio: es un mapa, no un protocolo de devolución. Yang y Banks (2025) trabajan la literacy en formadores de primaria como self-study: la respuesta coherente es formación con criterio, no un taller de confianza declarada. Zhang et al. (2025) validan un inventario estudiantil: medirlo no es enseñar a usar el feedback. Xu et al. (2024) recuerdan que visualizar datos de evaluación no sustituye el oficio. Alfredo et al. (2024), Capel y Brereton (2023) y Balducci (2024) mantienen el centrado en la persona como diseño y como acto, no como etiqueta. Bauer et al. (2023) y Goslen et al. (2025) ofrecen vecinos —PLN para el par, planes para andamiaje— que caben dentro del oficio y no lo agotan. Confundir entusiasmo de uso con mediación deja el aula gobernada por quien más quiere delegar el juicio.
Las pruebas leen esas tensiones como hipótesis, no como hallazgo de un centro. Choi et al. (2026) no escribieron una rúbrica de asignatura. Kim y Holden (2026) no estudiaron ciclos de revisión. El peer de Guo et al. (2024) no es la firma de una nota. Meta, criterio, diálogo y nombre son una candidatura a evaluación formativa. Banco, score, dashboard, chatbot o grader, solos, son consumo.
9. Límites
La revisión es narrativa. No estima efectos combinados ni aplica un PRISMA propio. No se inventan tamaños de muestra, d, r, AUC, porcentajes de acuerdo ni tasas de mejora, aunque algunas fuentes los reporten. Pack et al. (2024), Li y Liu (2024), Choi et al. (2026), Kim y Holden (2026) y Tate et al. (2024) se leen por el objeto que puntúan, no como ensayos de un protocolo formativo. Guo et al. (2024), Banihashem et al. (2024), Xu et al. (2024) y Prilop y Weber (2023) hablan de peer, de fuentes o de entrenamiento: no se importan efectos. Zhang et al. (2025) validan un constructo. Kokoç et al. (2026) mapean; no auditan productos. Yang y Banks (2025) son un self-study de formadores de primaria, no un estudio de jardín ni un ensayo de grader.
Otras fuentes son suelo o vecino, no evidencia directa del protocolo. Davies (2026) y Pan (2025) describen usos de feedback generativo: no certifican las cuatro pruebas. Bauer et al. (2023) proponen marco y agenda. Cui et al. (2026) evalúan competencia colaborativa en EFL chino. Goslen et al. (2025) generan planes en juego. Alfredo et al. (2024), Yan et al. (2024), Capel y Brereton (2023) y Balducci (2024) mapean diseño humano-céntrico y retos; no instalan un ciclo de asignatura. En este kit no hay un ensayo que equivalga banco, score, dashboard o chatbot a evaluación formativa con las cuatro pruebas. Esa ausencia es límite de categoría, no un tamaño de daño. No se auditan contratos ni se condenan marcas. Las cuatro pruebas no son un instrumento validado. El rótulo «jardín» del encabezado 5 no transfiere hallazgos de educación inicial. El corpus está en inglés y la síntesis es editorial en español. La pila arnés, eval de agente, HITL y mediación formativa es una distinción de la serie, no un resultado empírico de las veintiuna fuentes.
10. Conclusiones
Un banco de comentarios automáticos, un score de rúbrica generado por un LLM, un dashboard de similitud o un chatbot de «escribe mejor» no constituyen evaluación formativa si falta mediación docente. Tampoco una rúbrica autoaplicada ni un grader de marketing. El oficio es el juicio que decide qué feedback importa, cuándo devolverlo y cómo convertirlo en evidencia de aprendizaje. Pack et al. (2024), Li y Liu (2024), Choi et al. (2026), Kim y Holden (2026), Tate et al. (2024), Davies (2026), Pan (2025) y Banihashem et al. (2024) fijan el techo: scoring, ancla, interfaz, utilidad holística, devolución generativa e indexación a rúbrica, y fuentes que no son, por sí, un ciclo.
Donde hay oficio hay sujeto y protocolo. Prilop y Weber (2023), Guo et al. (2024), Bauer et al. (2023) y Xu et al. (2024) dejan el comentario —experto, de par, visualizado o apoyado por PLN— como objeto que alguien sostiene, no como veredicto del modelo. Kokoç et al. (2026), Yang y Banks (2025) y Zhang et al. (2025) mueven la alfabetización del clic a docentes, formadores y estudiantes, sin equivalerla a literacy evaluativa. Cui et al. (2026) obligan a articular la colaboración. Alfredo et al. (2024), Capel y Brereton (2023), Balducci (2024), Yan et al. (2024) y Goslen et al. (2025) impiden cerrar el problema con un rol de catálogo o con un plan generado.
La pila no se sustituye por dentro. El arnés produce trabajo. La evaluación de agentes mide fiabilidad. El HITL gobierna al copiloto. La mediación formativa convierte el feedback en evidencia de aprendizaje, con cuatro pruebas conjuntivas: metas previas al modelo; criterios interpretativos revisables; diálogo y ciclo de revisión; atribución de quién decide la calificación o el avance. Donde las fuentes no midieron ese protocolo, este artículo no lo da por medido. Donde midieron scores, fuentes, peer, instrumentos o marcos, no se traducen en «el grader ya forma». Convertir un sistema generativo en evaluación formativa es ejercer juicio sobre qué comentario se publica, cuándo se revisa y quién firma el avance. Lo demás es banco, puntuación, tablero o chatbot de marketing. No es oficio, y no debe presentarse como lo que no es.
Laboratorio Editorial de NEXTECH.IA / Ingeniero Mitre.
Referencias
- Alfredo, R., Echeverria, V., Jin, Y., Yan, L., Swiecki, Z., Gašević, D., y Martinez-Maldonado, R. (2024). Human-centred learning analytics and AI in education: A systematic literature review. Computers and Education: Artificial Intelligence, 6, Article 100215. https://doi.org/10.1016/j.caeai.2024.100215
- Balducci, B. (2024). AI and student assessment in human-centered education. Frontiers in Education, 9, Article 1383148. https://doi.org/10.3389/feduc.2024.1383148
- Banihashem, S. K., Kerman, N. T., Noroozi, O., Moon, J., y Drachsler, H. (2024). Feedback sources in essay writing: peer-generated or AI-generated feedback? International Journal of Educational Technology in Higher Education, 21(1), Article 23. https://doi.org/10.1186/s41239-024-00455-4
- Bauer, E., Greisel, M., Kuznetsov, I., Berndt, M., Kollar, I., Dresel, M., Fischer, M. R., y Fischer, F. (2023). Using natural language processing to support peer-feedback in the age of artificial intelligence: A cross-disciplinary framework and a research agenda. British Journal of Educational Technology, 54(5), 1222–1245. https://doi.org/10.1111/bjet.13336
- Capel, T., y Brereton, M. (2023). What is human-centered about human-centered AI? A map of the research landscape. En Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems (pp. 1–23). ACM. https://doi.org/10.1145/3544548.3580959
- Choi, J., Tate, T., y Warschauer, M. (2026). Anchor is the key: Toward accessible automated essay scoring with large language model through prompting. Assessing Writing, 69, Article 101053. https://doi.org/10.1016/j.asw.2026.101053
- Cui, H., Mahfoodh, O. H. A., Dong, H., y Ulanbek, M. (2026). An assessment framework for human-AI collaborative competence in second language writing: Evidence from the Chinese EFL context. System, 137, Article 103937. https://doi.org/10.1016/j.system.2025.103937
- Davies, R. (2026). Using generative AI for formative feedback on student writing drafts. Educational Technology Research and Development. https://doi.org/10.1007/s11423-026-10652-9
- Goslen, A., Kim, Y. J., Rowe, J., y Lester, J. (2025). LLM-based student plan generation for adaptive scaffolding in game-based learning environments. International Journal of Artificial Intelligence in Education, 35(2), 533–558. https://doi.org/10.1007/s40593-024-00421-1
- Guo, K., Pan, M., Li, Y., y Lai, C. (2024). Effects of an AI-supported approach to peer feedback on university EFL students' feedback quality and writing ability. The Internet and Higher Education, 63, Article 100962. https://doi.org/10.1016/j.iheduc.2024.100962
- Kim, J., y Holden, D. (2026). Reassessing automated essay scoring with large language models: Evidence from API and GUI interfaces. Assessing Writing, 69, Article 101080. https://doi.org/10.1016/j.asw.2026.101080
- Kokoç, M., Ağırman, Ş., y Yağmurlugil, B. N. (2026). Mapping in-service teacher AI literacy: A systematic review of empirical studies. Teaching and Teacher Education, 181, Article 105707. https://doi.org/10.1016/j.tate.2026.105707
- Li, W., y Liu, H. (2024). Applying large language models for automated essay scoring for non-native Japanese. Humanities and Social Sciences Communications, 11(1), Article 723. https://doi.org/10.1057/s41599-024-03209-9
- Pack, A., Barrett, A., y Escalante, J. (2024). Large language models and automated essay scoring of English language learner writing: Insights into validity and reliability. Computers and Education: Artificial Intelligence, 6, Article 100234. https://doi.org/10.1016/j.caeai.2024.100234
- Pan, Y. (2025). Leveraging generative AI powered rubric-indexed feedback as a formative assessment strategy for enhancing medical English education. Discover Computing, 28(1), Article 284. https://doi.org/10.1007/s10791-025-09830-9
- Prilop, C. N., y Weber, K. E. (2023). Digital video-based peer feedback training: The effect of expert feedback on pre-service teachers’ peer feedback beliefs and peer feedback quality. Teaching and Teacher Education, 127, Article 104099. https://doi.org/10.1016/j.tate.2023.104099
- Tate, T. P., Steiss, J., Bailey, D., Graham, S., Moon, Y., Ritchie, D., Tseng, W., y Warschauer, M. (2024). Can AI provide useful holistic essay scoring? Computers and Education: Artificial Intelligence, 7, Article 100255. https://doi.org/10.1016/j.caeai.2024.100255
- Xu, L., Zou, X., y Hou, Y. (2024). Effects of feedback visualisation of peer-assessment on pre-service teachers' data literacy, learning motivation, and cognitive load. Journal of Computer Assisted Learning, 40(4), 1447–1462. https://doi.org/10.1111/jcal.12955
- Yan, L., Sha, L., Zhao, L., Li, Y., Martinez-Maldonado, R., Chen, G., Li, X., Jin, Y., y Gašević, D. (2024). Practical and ethical challenges of large language models in education: A systematic scoping review. British Journal of Educational Technology, 55(1), 90–112. https://doi.org/10.1111/bjet.13370
- Yang, S., y Banks, A. (2025). Enhancing AI literacy: A collaborative self-study of elementary teacher educators. Studying Teacher Education, 21(3), 297–317. https://doi.org/10.1080/17425964.2024.2434213
- Zhang, H., Perry, A., y Lee, I. (2025). Developing and validating the Artificial Intelligence Literacy Concept Inventory: An instrument to assess artificial intelligence literacy among middle school students. International Journal of Artificial Intelligence in Education, 35(1), 398–438. https://doi.org/10.1007/s40593-024-00398-x