1. Introducción: de la sospecha al expediente

Un porcentaje llega antes que el expediente. Quien califica ve la proporción clasificada como generada, sin borrador, sin la conversación de escritura y sin lo que el estudiante puede explicar. El número puede quedarse en el aula o entrar en un procedimiento, con efectos sobre la calificación, el expediente y la confianza. El falso positivo recae sobre una persona; el falso negativo deja pasar un texto que quizá no se puede sostener. No son el mismo daño.

El problema no nace con esa interfaz. Cotton et al. (2024), como marco conceptual, ven en las interfaces conversacionales y en GPT-3 una doble cara: más participación, colaboración y accesibilidad, y también deshonestidad difícil de detectar. No hay en su texto un ensayo con verdad conocida; hay una propuesta de políticas, formación y más de un método de prevención. Birks y Clare (2023) añaden que la mala conducta no es nueva y que existen marcos de prevención, de raíz en la prevención del delito, útiles también cuando la facilita un modelo de lenguaje. Su cierre es una agenda de investigación, no una sanción tipo.

La pregunta de revisión adopta la forma PCC. La población son los textos académicos de estudiantes de educación superior y, como transferencia, otra escritura académica ya probada con detectores. El concepto es la clasificación automática de autoría humana frente a autoría generada. El contexto es la evaluación y los procedimientos de integridad. «¿Funcionan los detectores?» mezcla productos, unidades y definiciones de error que los estudios no comparten. La pregunta que organiza el artículo es qué puede probar un puntaje cuando hay que decidir un caso.

La tesis es restrictiva. Bajo control, la exactitud mejoró y, en textos íntegros, varios falsos positivos se volvieron raros; persisten la inconsistencia, la caída ante la paráfrasis, la dificultad con los híbridos y un sesgo posible hacia escritores no nativos. El puntaje abre una conversación y no cierra un expediente. Lo que sigue marca cada afirmación como hallazgo empírico, marco conceptual o inferencia de diseño.

2. Antecedentes: tres oleadas de estudios sobre detectores

No hay una línea recta, sino tres oleadas: la de 2023 pregunta si se distingue texto humano de texto generado; la segunda atiende al sesgo y a la evasión; la de 2025-2026 vuelve sobre productos comerciales y sobre texto híbrido, humanizado o editado. No deben confundirse dos planos. La exactitud de benchmark es una frecuencia con procedencia conocida. El valor probatorio es lo que un puntaje autoriza a decir de una persona, sin esa verdad y con consecuencia. Un banco excelente puede no ser prueba de una violación.

Weber-Wulff et al. (2023) prueban 12 herramientas públicas más Turnitin y PlagiarismCheck, y preguntan si separan el texto humano del de ChatGPT y si la traducción automática y la ofuscación alteran la detección. El hallazgo: no son exactas ni fiables, sesgan a decir humano y empeoran con la ofuscación. Elkhatat et al. (2023), con quince párrafos del modelo 3.5 y quince del 4 sobre torres de enfriamiento, cinco controles y las herramientas OpenAI, Writer, Copyleaks, GPTZero y CrossPlag, aciertan más en el 3.5 que en el 4 y producen falsos positivos e incertidumbre en lo humano. Walters (2023), con 16 detectores y tres grupos de 42 ensayos, halla alta exactitud de Copyleaks, Turnitin y Originality.ai, y fallo de la mayoría de los otros 13 ante el modelo 4; el pago mejora poco. Dalalah y Dalalah (2023) entran solo por el título, sin resumen ni resultado.

La segunda oleada cambia de pregunta. Liang et al. (2023) reportan, como hallazgo empírico, que los detectores clasifican con frecuencia como generada la escritura no nativa del inglés, con riesgo de marginarla en la evaluación. El resumen no trae una tasa repetible. Perkins et al. (2024b) enfrentan seis detectores a contenido modificado para evadir la detección (n = 805) y hallan una caída de exactitud del 17,4 % ante técnicas simples. Concluyen que no pueden recomendarse para determinar violaciones, por la exactitud y por el riesgo de acusación falsa, aunque puedan apoyar el aprendizaje si el uso no es punitivo.

Van Vlasselaer et al. (2026), Malik y Amjad (2025) y Hyatt et al. (2025) miden de nuevo la exactitud sobre texto que ya no es puro; las cifras van después, no como eslogan. Barrot y Aranda (2025) entran solo por el título, sin resumen: distinguir lo producido por el estudiante, lo editado y lo generado. Como inferencia de lectura, no como metaanálisis, ningún diseño observa a la vez procedencia, permiso, comprensión y consecuencia.

3. Método: revisión crítica PRISMA-lite con lectura evidencial

Es una síntesis narrativa, no un metaanálisis: no hay unidad común de texto, modelo ni umbral. El 9 de octubre de 2026 se consultó la API REST de Crossref, sin Scopus, Web of Science, ERIC ni PsycInfo: 16 consultas de 60 filas, artículos de revista desde 2021. De 960 registros quedaron 892 al deduplicar. La elegibilidad pidió autores, año, un término de IA generativa en el título y otro de detección, integridad o escritura, y apartó imagen, deepfake, código, audio o video y desinformación. Las exclusiones —45, 292, 101 y 17— y los 437 elegibles están en la Tabla 1.

EtapaRegistrosCriterio aplicado
Identificación en Crossref REST API96016 consultas, 60 filas; artículo de revista; publicación desde 2021
Tras deduplicar892Registros repetidos entre consultas eliminados
Exclusión automática: sin autores45Sin autoría registrada
Exclusión automática: sin término de IA generativa en el título292El título no nombra IA generativa, LLM, ChatGPT o texto generado
Exclusión automática: sin término de integridad, detección o escritura101Ni el título ni la revista sitúan detección, integridad, plagio, evaluación, escritura o estudiantes
Exclusión automática: otra modalidad17Imagen, código, audio o video, desinformación
Elegibles para cribado437Resultado del filtro automático
Excluidos en cribado manual414Título y resumen, con los criterios declarados en el texto
Incluidos desde la siembra23Cribado del conjunto elegible
Incluido por búsqueda dirigida1Perkins et al. (2024b), verificado en Crossref el 9 de octubre de 2026
Corpus incluido2420 con resumen vía Crossref, OpenAlex o Semantic Scholar; 4 solo con título
Tabla 1. Flujo PRISMA-lite de identificación y selección (registro real del 9 de octubre de 2026).

El cribado manual, una sola pasada y sin doble cribado, excluyó 414 de 437: correcciones y erratas, preprints duplicados, actas de congreso, revistas sin revisión por pares verificable o de indexación dudosa, adopción sin integridad o detección, clasificadores sin escritura estudiantil y opinión sin argumento. Quedaron 23 de la siembra, más Perkins et al. (2024b) por búsqueda dirigida y verificación en Crossref. Son 24: 20 con resumen y 4 solo con título —Jiang et al. (2024), Dalalah y Dalalah (2023), Barrot y Aranda (2025) y Zhang y Lv (2026)—. No hubo herramienta formal de riesgo de sesgo.

La lectura evidencial pregunta tres cosas: qué texto entró —humano, generado íntegro, editado, híbrido o humanizado—, o si el trabajo es marco, voces o política; qué error declara el resumen, sin inventar un porcentaje; y si eso alcanza un caso individual. No alcanza cuando la verdad está fabricada, y menos cuando el acervo real no la tiene. Ningún estudio observa a la vez permiso, comprensión y consecuencia. Salud conductual y admisiones entran como transferencia, no como tarea de curso.

4. Exactitud bajo control: lo que cambió entre 2023 y 2026

La Tabla 2 reúne los estudios con desempeño en el resumen recuperado. No es una liga: las filas no comparten longitud, modelo, año ni definición de acierto. Se leen como diseños, y la interpretación separa esa exactitud del valor probatorio.

EstudioHerramientasTextos evaluadosLo que reporta (según su resumen)
Weber-Wulff et al. (2023)12 públicas, más Turnitin y PlagiarismCheckTexto humano y de ChatGPT; también traducción automática y ofuscaciónNi exactas ni fiables. Sesgo a clasificar como texto humano. La ofuscación empeora el desempeño de manera significativa
Elkhatat et al. (2023)OpenAI, Writer, Copyleaks, GPTZero y CrossPlag15 párrafos del modelo 3.5, 15 del modelo 4 y 5 controles humanosMás exactitud con el modelo 3.5 que con el 4. Falsos positivos y clasificaciones inciertas en los controles humanos
Walters (2023)16 detectores; destacan Copyleaks, Turnitin y Originality.ai42 ensayos de ChatGPT-3.5, 42 de ChatGPT-4 y 42 humanos sin IAEsos tres, alta exactitud en los tres conjuntos. La mayoría de los otros 13 falla ante el modelo 4. El pago solo mejora de forma ligera
Gosling et al. (2024)Detector de IA asociado a Turnitin160 respuestas estudiantiles y 160 de ChatGPT, con 16 promptsPuntajes del texto generado significativamente más altos. Los puntajes humanos, todos en cero
Malik y Amjad (2025)Turnitin, ZeroGPT, GPTZero y Writer AIChatGPT, Perplexity y Gemini, en original y tras Grammarly, Quillbot y edición humana del 10 % al 20 %Turnitin, el más exacto y consistente, con puntaje de IA del 100 % aun con técnicas adversariales. Quillbot afecta sobre todo a ZeroGPT, GPTZero y Writer AI. El mismo modelo y la misma herramienta dan puntajes distintos según el archivo. Perplexity se detecta mejor; Gemini puntúa más bajo
Van Vlasselaer et al. (2026)GPTZero, Pangram, Copyleaks y Turnitin160 documentos sintéticos con verdad conocida (humano, IA, híbrido y humanizado) y 1163 tesis de maestría de 2024-2025 sin verdad conocidaPangram es superior en IA pura, híbrida y humanizada. Las demás subestiman, sobre todo con el modelo más avanzado. Todas aciertan el texto humano. Falsos positivos raros. En las tesis, Pangram marca el 45,5 %, por lo general en niveles bajos o moderados
Popkov y Barrett (2025)Un detector gratuito y Originality.AI100 artículos humanos de 2016-2018 y 200 textos de chatbot (100 de ChatGPT y 100 de Claude)Falsos positivos y falsos negativos problemáticos, de pago o gratuitos. Mediana de 27,2 % del texto humano marcado como IA por el detector gratuito. Originality.AI rinde mejor y sigue limitado ante Claude
Zhao et al. (2024)Modelos específicos de dominio, no un detector universal3755 cartas de recomendación y 1973 declaraciones de intención de posgrados de Fordham, con contrapartes de GPT-3.5 TurboUn detector general y universal parece fuera del alcance actual. Modelos especializados pueden lograr alta exactitud en ese material de admisión
Hyatt et al. (2025)Detectores en línea, solos y por consensoEscritura de estudiantes STEM, humana y generadaCada detector varía. En conjunto informan cuando falla la intuición humana. El consenso reduce los falsos positivos casi a cero
Tabla 2. Estudios de exactitud del corpus (síntesis de los autores a partir de los resúmenes; no es una comparación estandarizada entre herramientas).

La mejora, como hallazgo empírico, es real y no es lineal. Weber-Wulff et al. (2023) no describen el cero de Gosling et al. (2024), el 100 % de Turnitin en Malik y Amjad (2025), los falsos positivos raros de Van Vlasselaer et al. (2026) ni el consenso de Hyatt et al. (2025). Tampoco cabe un detector singular: Walters (2023) opuso tres herramientas capaces a una mayoría de las otras trece, ineficaz ante el modelo 4. El falso positivo no está cerrado. Malik y Amjad (2025) ven puntajes distintos en archivos del mismo modelo. Popkov y Barrett (2025), en revistas de salud conductual, hallan una mediana del 27,2 % de texto humano marcado por un detector gratuito y un Originality.AI mejor, limitado ante Claude. Zhao et al. (2024) logran alta exactitud con modelos de dominio —3755 cartas y 1973 declaraciones, contrapartes de GPT-3.5 Turbo— y dejan fuera de alcance un detector universal. Sigue siendo benchmark.

El límite es de diseño. Salvo las 1163 tesis, hay verdad conocida, pero no se observa la consigna ni la comprensión. Pangram marca el 45,5 % de esas tesis, en niveles por lo general bajos o moderados, sin verdad conocida: son banderas, no prevalencia. La inferencia de diseño es que clasificar mejor un texto puro no decide un caso. El puntaje mide una semejanza; la violación une persona, consigna y comprensión.

5. Falsos positivos, escritores no nativos y tasa base

La equidad no es un apéndice de la exactitud. Liang et al. (2023) documentan, como hallazgo empírico, que los detectores clasifican con frecuencia como generada la escritura no nativa del inglés, con riesgo de marginar a esos escritores. El resumen no da una cifra repetible. Aun así, prohíbe leer «falso positivo raro» como si el error estuviera bien repartido: raro en el agregado puede ser frecuente en quien escribe en una lengua que no es la primera.

Jiang et al. (2024) formulan la pregunta donde más importaría cerrarla: si, al detectar ensayos de ChatGPT en una evaluación de escritura a gran escala, hay sesgo contra hablantes no nativos del inglés. No hubo resumen. Atribuirles un sí o un no sería inventar un hallazgo. El título mantiene el debate abierto. El silencio no refuta a Liang et al. (2023) ni lo confirma.

Hay contraevidencia, y no disuelve el problema. Gosling et al. (2024) dejan en cero los 160 textos humanos. Van Vlasselaer et al. (2026) ven acierto en el texto humano íntegro y falsos positivos raros, con mejora frente a estudios previos. Eso impide decir que todo detector marca de más. No anula a Liang et al. (2023): esos resúmenes no separan prosa nativa y no nativa. Popkov y Barrett (2025), con una mediana del 27,2 % en artículos de 2016-2018, muestran que «raro» depende de la herramienta, del género y del año. La evidencia está en tensión.

El ejemplo muestra la tasa base, no una universidad. Con falso positivo bajo, la mayoría no generada produce inocentes cuyo puntaje no se distingue del acierto, y nadie señala cuál marca es de las 9,5. Sancionar por el número los alcanza. El 45,5 % de Van Vlasselaer et al. (2026) no es el 5 % del supuesto, y el casi cero de Hyatt et al. (2025) tampoco pone nombre al caso. La inferencia de diseño: el número abre la revisión y no la cierra, más aún si el error carga sobre escritores no nativos (Liang et al., 2023).

6. Evasión, textos híbridos y la frontera móvil de la autoría

Un detector puede acertar contra el texto parecido a su entrenamiento y fallar contra el que se modifica en minutos. Perkins et al. (2024b) lo miden: seis detectores, n = 805 y una caída del 17,4 % ante técnicas simples, con la negativa ya citada a usarlos para determinar violaciones y la puerta a un uso no punitivo. Weber-Wulff et al. (2023) habían colocado la misma fragilidad al preguntarse por la traducción automática y la ofuscación, y al concluir que la ofuscación empeora el desempeño dentro de un veredicto de falta de exactitud y de fiabilidad. La evasión no es un hallazgo tardío.

Malik y Amjad (2025) dejan a Turnitin en 100 % tras Grammarly, Quillbot y una edición del 10 % al 20 %; ZeroGPT, GPTZero y Writer AI caen sobre todo con Quillbot, y Gemini puntúa más bajo que Perplexity. El mismo modelo y la misma herramienta no dan el mismo número en archivos distintos. En 160 documentos, Van Vlasselaer et al. (2026) incluyen híbrido —pasajes generados dentro de texto humano— y humanizado —reescrito con un prompt para parecer estudiantil—: Pangram sostiene la exactitud y las otras tres subestiman, sobre todo con el modelo más avanzado. Ese falso negativo no se borra porque una herramienta, en ese banco, sí vea la mezcla.

Barrot y Aranda (2025) no aportan resultado; su objeto nombra tres clases que un porcentaje aplasta: producido por el estudiante, editado con IA y generado. Wright (2026), en un análisis de política y no de exactitud, sostiene que desde 2023 muchas normas no separan la generación del contenido evaluado de usos no generativos —reconocimiento óptico, voz a texto, reconocimiento de escritura—. Según reporta, el 94 % de las 50 principales universidades de Estados Unidos tenía guías para el profesorado. Tener guía no es distinguir transcripción de generación.

La inferencia de diseño es que la autoría ya no es binaria. El híbrido, las tres clases del objeto de Barrot y Aranda (2025) y la distinción de Wright (2026) entre generación y mera conversión de formato muestran más de dos componentes. Leer el porcentaje como una de dos casillas impone al expediente una ontología que esa literatura abandona. El puntaje, cuando dice algo, dice una semejanza: no dice quién decidió, con qué permiso y con qué comprensión.

7. El juicio docente frente al puntaje

Si el software no cierra el caso, queda el ojo de quien califica. Perkins et al. (2024a) lo prueban con 22 envíos de ChatGPT diseñados para dificultar la detección y con 15 docentes, junto a envíos genuinos. El hallazgo empírico corta el optimismo: Turnitin marca el 91 % de los envíos, pero solo el 54,8 % del contenido; el personal reporta el 54,5 % al procedimiento; las medias son 52,3 y 54,4. La marca del documento, la cobertura del texto y la nota no son el mismo hecho, y casi la mitad de lo experimental no llega al expediente.

Ni el ojo ni el software son patrón oro. Hyatt et al. (2025) muestran que, en agregado, los detectores avisan cuando la intuición falla y que el consenso reduce los falsos positivos casi a cero. Guan y Han (2025), con n = 156 estudiantes STEM en dos grupos —con modelo de lenguaje o escritura independiente—, evalúan un detector y una encuesta de conciencia ética. El resumen no da cifras de exactitud ni de la encuesta. El hallazgo es la limitación de estas herramientas en el curso de escritura, donde el estilo se aprende y un clasificador puede confundir aprendizaje con sustitución.

La inferencia de diseño es que ni el ojo ni el programa, solos, sostienen una determinación. La discordancia entre la marca, la cobertura del texto y el reporte docente es motivo para preguntar, no un empate que se rompe a favor de la sanción. El consenso ayuda donde falla la intuición y no conoce la consigna (Hyatt et al., 2025; Guan y Han, 2025).

8. De detectar a validar: autoría epistémica y defensa oral

Ebrahimzadeh et al. (2026) cambian la unidad. Como marco de validez, preguntan qué pasa si, sin vigilancia, se entrega un texto generado que no se entiende. La integridad de coautoría, que proponen como fuente de evidencia de validez, se viola en ese acto. El desarrollo es un prototipo, «AI Viva»: defensa oral más preguntas de comprensión, con retroalimentación cuantitativa y dialógica. La validación es preliminar y de expertos, no un ensayo de cohorte. El giro —de cazar el archivo a verificar la propiedad epistémica— se toma aquí como marco, no como eficacia demostrada.

Hutson et al. (2026) miden ese giro en un piloto. Integrevise empareja el escrito con una viva breve: no detecta ni califica. En una universidad privada de artes liberales del Medio Oeste, otoño de 2025 y primavera de 2026 son ciclos distintos, no una cohorte, y la evidencia es preliminar. Hubo 52 vivas. De siete respondientes, el 14,3 % acordó que la oralidad ayudó a pensar más a fondo y el 57,1 % discrepó. En 20 de 52, el 38,5 %, no hubo comentarios. Lo cualitativo sugiere lagunas que el escrito no muestra. Piden seguir investigando, no cerrar una política.

La alternativa también cuesta, y su evidencia es débil. El 57,1 % de desacuerdo frente al 14,3 % de acuerdo, sobre siete voces, avisa que la defensa oral puede no vivirse como pensar más a fondo y puede volverse un segundo examen. Perkins et al. (2024a) recomiendan menos tareas imitables por una herramienta, o evaluaciones que incluyan la IA, más formación. Es coherente con el marco de Ebrahimzadeh et al. (2026) y no es una eficacia demostrada. La inferencia de diseño es modesta: verificar la comprensión responde a lo que el puntaje no nombra, y hoy es una hipótesis, no una mejora automática.

9. Política institucional: propósito, proporcionalidad y debido proceso

Taylor y LaCroix (2026), como marco conceptual, sostienen que saber si el uso de IA generativa es mala conducta depende del propósito de la universidad. Leen el aumento aparente de casos como incoherencia —entusiasmo tecnológico, influencia corporativa y norma que empujan distinto— en la que el estudiante rinde cuentas por conductas que la institución moldeó. El análisis de declaraciones de misión halla una brecha entre el ideal y la práctica. Sin alinear misión, pedagogía y tecnología no hay exigencia creíble de integridad, y un detector hereda esa incoherencia.

Ying (2026) aporta el hallazgo de una revisión de alcance de 38 estudios empíricos. Hay una zona gris ética: el estudiante no es receptor pasivo ni infractor sin freno, sino agente que interpreta el uso lícito. A la vez hay brecha entre conciencia y práctica, y racionalizaciones de esa brecha. Las voces dependen de factores demográficos, psicológicos y contextuales. Como lectura de ese hallazgo, una política única queda corta: sancionar la zona gris sin oírla castiga negociaciones que el estudiantado vive como ambiguas.

Zhang y Lv (2026) entran solo por el título: un comentario, sin resumen, según el cual la detección puede socavar la integridad. No hay dato que atribuirles. El enunciado alerta en la dirección del riesgo de acusación falsa (Perkins et al., 2024b) y del sesgo (Liang et al., 2023). Birks y Clare (2023) enlazan la mala conducta facilitada por IA con marcos de prevención ya usados para la mala conducta clásica: la respuesta empieza en la ocasión y la consigna, no en el castigo. La prevención situacional es aquí inferencia de diseño, no un hallazgo medido por ellos.

De ahí no sale una norma validada, sino una inferencia de diseño. El puntaje no es prueba única. Quien resulta marcado puede explicar versiones, formato, transcripción, edición, ayuda y la consigna que creyó vigente. El registro de versiones, si la tarea es de proceso, se prevé en la evaluación y no se improvisa tras la sospecha. La conversación precede a la sanción, y esta, si llega, responde a comprensión, permiso, proceso y texto. El paquete no está ensayado en los 24 estudios. Llamarlo buena práctica comprobada excedería el corpus.

La inferencia para universidades mexicanas y latinoamericanas es de transferencia: no hay dato ni se invoca normativa. Ninguna fuente evalúa detectores en español, y la Tabla 2 describe textos en inglés, mientras en la región se escribe en español y, en el posgrado, a menudo en inglés como segunda lengua. Trasladar el umbral importa el sesgo de Liang et al. (2023) a un terreno no medido; Jiang et al. (2024) dejan la pregunta abierta incluso en inglés. No autoriza entusiasmo ni prohibición. El porcentaje no viaja solo hasta la sanción.

10. Discusión: un indicio no es una prueba

Un puntaje depende del año, del producto, del modelo y de si el texto es puro, editado, híbrido o humanizado. En laboratorio, con verdad conocida, unos productos aciertan y otros marcan prosa humana o subestiman la generada. En el expediente faltan la verdad y a menudo el proceso, y sobra la consecuencia. El indicio es razón para no archivar la duda; la prueba sería razón suficiente de una violación. El puntaje no llega ahí. La Figura 1, esquema inferido y no protocolo evaluado, ordena el paso para que la decisión no salte del porcentaje a la sanción. Cada peldaño responde una pregunta que el anterior no contesta.

PeldañoPregunta que respondeEvidencia del corpusUso defendible (hipótesis de diseño)
Puntaje del detector¿El texto se parece, según la herramienta, a una clase generada?Mejora en texto puro y falsos positivos raros en diseños recientes; fallos de 2023 e inconsistencia entre archivos (Gosling et al., 2024; Van Vlasselaer et al., 2026; Hyatt et al., 2025; Weber-Wulff et al., 2023; Malik y Amjad, 2025)Abrir una revisión. No determinar la violación
Contraste con historial y borradores¿Encaja el texto con la trayectoria de escritura y con las versiones de la tarea?Los bancos juzgan el texto cerrado, casi siempre con verdad fabricada (Walters, 2023; Zhao et al., 2024). Wright (2026) separa la conversión de formato de la generaciónPedir una explicación de proceso antes de leer el puntaje como sustitución de la autoría
Conversación con el estudiante¿Puede dar cuenta de las decisiones del texto y del permiso que creyó tener?Zona gris y agencia estudiantil (Ying, 2026). El personal reportó el 54,5 % de los envíos experimentales (Perkins et al., 2024a)Oír la explicación antes de cualquier sanción
Verificación de comprensión o defensa oral¿Entiende y puede sostener lo que puso a su nombre?La integridad de coautoría se viola al entregar lo que no se comprende; la viva tiene validación experta preliminar (Ebrahimzadeh et al., 2026). Piloto mixto: 14,3 % de acuerdo y 57,1 % en desacuerdo, con siete respondientes (Hutson et al., 2026)Comprobar la autoría epistémica sin dar la defensa oral por eficaz
Decisión proporcional¿Qué respuesta cabe al propósito formativo y a la duda que queda?La mala conducta depende del propósito (Taylor y LaCroix, 2026). La prevención precede a la sanción (Birks y Clare, 2023). La detección puede dañar la integridad (objeto de Zhang y Lv, 2026)Sancionar solo si el conjunto sostiene la violación. El puntaje aislado no basta
Figura 1. Esquema conceptual, no dato empírico: escalera de decisión del indicio a la determinación, inferida de la revisión.

Si la tarea prohibía generar, ignorar un puntaje alto sería tan poco serio como obedecerlo, y Gosling et al. (2024) advierten que la vía técnica no basta. Los peldaños siguientes cubren la historia que el texto no cuenta (Wright, 2026), el reporte inestable (Perkins et al., 2024a), la norma que el estudiante ya interpreta (Ying, 2026), la verificación aún sin eficacia demostrada (Ebrahimzadeh et al., 2026; Hutson et al., 2026) y el propósito que define la falta (Taylor y LaCroix, 2026). Sancionar solo con el indicio realiza el riesgo que enuncia Zhang y Lv (2026).

Un indicio no es una prueba por cuatro razones. El benchmark tiene verdad conocida y el caso no; ni en 2023 la exactitud era pareja (Elkhatat et al., 2023; Walters, 2023). La tasa base marca inocentes y el puntaje no dice cuál lo es. Paráfrasis, híbrido y transcripción hacen que el mismo porcentaje cubra hechos distintos. Certificar aprendizaje exige que la persona sostenga el trabajo. Nada obliga a apagar los detectores; sí, a que el número no sea la última palabra. Cotton et al. (2024), como marco, pedían más de un método, y la escalera no finge que cada peldaño esté medido.

11. Límites

El corpus es solo de Crossref: no entraron Scopus, Web of Science, ERIC ni PsycInfo, y el predominio anglófono es de lo recuperado, no de la lectura. La generalización a México y América Latina es inferencial y ninguna fuente evalúa detectores en español. Las herramientas van más rápido que la revista: usar a Weber-Wulff et al. (2023) o a Elkhatat et al. (2023), que evalúan generaciones como GPT-3.5 y GPT-4, para describir un producto de 2026 sería tan erróneo como usar a Van Vlasselaer et al. (2026) para rehabilitar el parque de 2023. La Tabla 2 es una serie de ventanas, no una ficha vigente.

Los conjuntos sintéticos permiten exactitud; las 1163 tesis, sin verdad conocida, permiten describir banderas y no verificarlas. Cuatro fuentes entran solo con el título —Jiang et al. (2024), Dalalah y Dalalah (2023), Barrot y Aranda (2025) y el comentario de Zhang y Lv (2026)— y nada de lo dicho excede ese objeto. No hubo doble cribado ni herramienta de riesgo de sesgo. Salud conductual y admisiones son transferencia, no el aula de un pregrado. La síntesis renuncia a una cifra única de exactitud del campo: con estos diseños sería más precisa en la forma que en el significado.

12. Conclusiones

La pregunta que queda no es si, en textos puros, un detector separa lo humano de lo generado: algunos pueden y otros dejan de poderlo si cambian el modelo, la paráfrasis o el híbrido. La pregunta es qué hace una universidad con el número cuando señala a una persona. La respuesta del corpus es estrecha. El número es un indicio: abre una revisión, no declara la violación, no señala al inocente y no certifica que quien entrega entienda lo entregado.

Hay una mejora bajo control que sería desleal negar, y hay a la vez inestabilidad entre archivos, fragilidad ante el híbrido y la paráfrasis, marcas sobre la prosa no nativa y, fuera del aula, texto humano señalado por detectores que en otros diseños casi no fallan. Citar solo la mejora vende un producto. Citar solo el fallo niega la mejora. Ninguna de las dos series convierte el benchmark en prueba de un expediente.

Quien califica no corrige ese campo solo: en los envíos evasivos, marca, cobertura y reporte no coincidieron, y las notas quedaron casi parejas. Comprobar que la persona sostiene lo que firma es coherente con el daño que importa y llega con evidencia débil —prototipo de expertos y piloto de percepciones mixtas—. Recomendarlo es inferencia de diseño. Darlo por solución evaluada repetiría el atajo del detector que «ya funciona».

Sin un propósito, el detector vigila conductas que la institución ayuda a producir (Ying, 2026). Que el puntaje no sea prueba única, que el proceso pueda explicarse y que la conversación preceda a la sanción es condición de diseño, no ley del corpus. En México y América Latina pesa más por falta de dato: un umbral de inglés, aplicado al español o al inglés como segunda lengua, repite un sesgo no medido. Si el indicio no sobrevive al proceso y a la explicación, no hay sanción atribuida al número.

Laboratorio Editorial de NEXTECH.IA / Ingeniero Mitre

Referencias

  1. Barrot, J. S., & Aranda, M. R. R. (2025). Efficacy of AI-Text Detection Tools in Distinguishing Student-Produced, AI-Edited, and AI-Generated Essays. Technology, Knowledge and Learning. https://doi.org/10.1007/s10758-025-09884-0
  2. Birks, D., & Clare, J. (2023). Linking artificial intelligence facilitated academic misconduct to existing prevention frameworks. International Journal for Educational Integrity, 19(1), Article 20. https://doi.org/10.1007/s40979-023-00142-3
  3. Cotton, D. R. E., Cotton, P. A., & Shipway, J. R. (2024). Chatting and cheating: Ensuring academic integrity in the era of ChatGPT. Innovations in Education and Teaching International, 61(2), 228–239. https://doi.org/10.1080/14703297.2023.2190148
  4. Dalalah, D., & Dalalah, O. M. A. (2023). The false positives and false negatives of generative AI detection tools in education and academic research: The case of ChatGPT. The International Journal of Management Education, 21(2), 100822. https://doi.org/10.1016/j.ijme.2023.100822
  5. Ebrahimzadeh, M., Shibani, A., & Shum, S. B. (2026). Coauthorship integrity: Reconceptualising assessment validity for the age of generative artificial intelligence. Computers and Education: Artificial Intelligence, 10, 100609. https://doi.org/10.1016/j.caeai.2026.100609
  6. Elkhatat, A. M., Elsaid, K., & Almeer, S. (2023). Evaluating the efficacy of AI content detection tools in differentiating between human and AI-generated text. International Journal for Educational Integrity, 19(1), Article 17. https://doi.org/10.1007/s40979-023-00140-5
  7. Gosling, S. D., Ybarra, K., & Angulo, S. K. (2024). A widely used Generative-AI detector yields zero false positives. Aloma: Revista de Psicologia, Ciències de l'Educació i de l'Esport, 42(2), 31–43. https://doi.org/10.51698/aloma.2024.42.2.31-43
  8. Guan, Q., & Han, Y. (2025). From AI to authorship: Exploring the use of LLM detection tools for calling on “originality” of students in academic environments. Innovations in Education and Teaching International, 62(5), 1514–1528. https://doi.org/10.1080/14703297.2025.2511062
  9. Hutson, J., Poyer, K., Ogoe, E., & Atologun, K. A. (2026). Beyond AI Detection: A Pilot Study of IntegreviseTM and Viva-Based Verification of Student Understanding in AI-Mediated Assessment. Trends in Higher Education, 5(3), 59. https://doi.org/10.3390/higheredu5030059
  10. Hyatt, J.-P. K., Bienenstock, E. J., Firetto, C. M., Woods, E. R., & Comus, R. C. (2025). Using aggregated AI detector outcomes to eliminate false positives in STEM-student writing. Advances in Physiology Education, 49(2), 486–495. https://doi.org/10.1152/advan.00235.2024
  11. Jiang, Y., Hao, J., Fauss, M., & Li, C. (2024). Detecting ChatGPT-generated essays in a large-scale writing assessment: Is there a bias against non-native English speakers? Computers & Education, 217, 105070. https://doi.org/10.1016/j.compedu.2024.105070
  12. Liang, W., Yuksekgonul, M., Mao, Y., Wu, E., & Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7), 100779. https://doi.org/10.1016/j.patter.2023.100779
  13. Malik, M. A., & Amjad, A. I. (2025). AI vs AI: How effective are Turnitin, ZeroGPT, GPTZero, and Writer AI in detecting text generated by ChatGPT, Perplexity, and Gemini? Journal of Applied Learning and Teaching, 8(1), 91–101. https://doi.org/10.37074/jalt.2025.8.1.9
  14. Perkins, M., Roe, J., Postma, D., McGaughran, J., & Hickerson, D. (2024a). Detection of GPT-4 Generated Text in Higher Education: Combining Academic Judgement and Software to Identify Generative AI Tool Misuse. Journal of Academic Ethics, 22(1), 89–113. https://doi.org/10.1007/s10805-023-09492-6
  15. Perkins, M., Roe, J., Vu, B. H., Postma, D., Hickerson, D., McGaughran, J., & Khuat, H. Q. (2024b). Simple techniques to bypass GenAI text detectors: implications for inclusive education. International Journal of Educational Technology in Higher Education, 21(1), Article 53. https://doi.org/10.1186/s41239-024-00487-w
  16. Popkov, A. A., & Barrett, T. S. (2025). AI vs academia: Experimental study on AI text detectors’ accuracy in behavioral health academic writing. Accountability in Research, 32(7), 1072–1088. https://doi.org/10.1080/08989621.2024.2331757
  17. Taylor, T. B., & LaCroix, T. (2026). Purpose before policy: academic integrity, generative AI, and rhetorical stance. Higher Education. https://doi.org/10.1007/s10734-026-01706-1
  18. Van Vlasselaer, M., Van Droogenbroeck, F., & Spruyt, B. (2026). Who wrote this? Evaluating the reliability of AI detection tools in higher education. International Journal for Educational Integrity, 22(1), Article 16. https://doi.org/10.1007/s40979-026-00226-w
  19. Walters, W. H. (2023). The Effectiveness of Software Designed to Detect AI-Generated Writing: A Comparison of 16 AI Text Detectors. Open Information Science, 7(1), Article 20220158. https://doi.org/10.1515/opis-2022-0158
  20. Weber-Wulff, D., Anohina-Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero-Dib, J., Popoola, O., Šigut, P., & Waddington, L. (2023). Testing of detection tools for AI-generated text. International Journal for Educational Integrity, 19(1), Article 26. https://doi.org/10.1007/s40979-023-00146-z
  21. Wright, C. (2026). Transcription is not generation: distinguishing non-generative AI tool use from academic misconduct in higher education assessment. International Journal for Educational Integrity, 22(1), Article 24. https://doi.org/10.1007/s40979-026-00234-w
  22. Ying, J. (2026). Academic Integrity in the Age of Generative AI: a Scoping Review of Research on Higher Education Student Voices. Journal of Academic Ethics, 24(3), Article 78. https://doi.org/10.1007/s10805-026-09752-1
  23. Zhang, S., & Lv, X. (2026). AI detection risks undermining academic integrity. Nature Human Behaviour, 10(8), 1395–1396. https://doi.org/10.1038/s41562-026-02528-y
  24. Zhao, Y., Borelli, A., Martinez, F., Xue, H., & Weiss, G. M. (2024). Admissions in the age of AI: detecting AI-generated application materials in higher education. Scientific Reports, 14(1), Article 26411. https://doi.org/10.1038/s41598-024-77847-z