1. Introducción y problema

Circula un ranking. La fila superior muestra un nombre de agente y un número. El laboratorio que lo publica no entrega la traza de pasos, no declara el presupuesto de tokens ni de tiempo, no nombra el oráculo que decide el acierto y no descompone por qué falló el segundo puesto. El screenshot viaja por redes y por diapositivas. Un vídeo, recortado en el instante en que la interfaz parece «resolver X», acompaña el anuncio. Eso no es una evaluación de un agente basado en un modelo de lenguaje: es un cartel. El problema de este artículo no es que existan benchmarks —existen, y varios de ellos construyen entornos de evidencia—, sino que el mercado de «agentes de IA» ha naturalizado sustituir el oficio de la eval por la exhibición de un número, de un clip o de una demo afortunada (Ma et al., 2024; Guo et al., 2024; Aleithan, 2025; Wang et al., 2024; Xi, Chen et al., 2025).

La tesis es restrictiva. Una demo cherry-picked, un screenshot de leaderboard, un score único de un run o un vídeo de «el agente resolvió X» sin harness de evaluación fijo no constituyen evaluación de un agente. La eval fiable distingue capacidad de demo de evidencia de trabajo y requiere un criterio verificable fuera del propio modelo. Relaciona, sin duplicarlo, el argumento del 16 de septiembre de 2026 sobre el arnés (harness) de agentes: el arnés convierte capacidad generativa en trabajo; la eval mide si ese trabajo es fiable frente a un oráculo, un presupuesto y una taxonomía de fallos que no coinciden con el propio completion. No son lo mismo. Un sistema puede tener arnés de ejecución y carecer de eval; puede exhibir un ranking y carecer de ambos. Yang et al. (2024) muestran, como hallazgo empírico de interfaz, que la interfaz agente–computadora cambia lo que se puede hacer y, por tanto, lo que se puede medir. Ma et al. (2024) descomponen el fallo multi-turno en lugar de compactarlo en un score. Guo et al. (2024) tratan la estabilidad del benchmarking de tools como problema de diseño. Aleithan (2025) recuerda que un score de SWE-Bench sin auditoría de datos no es un veredicto. Eso autoriza a preguntar qué se midió: un clip, una fila de tabla —o un protocolo.

El problema se agrava por seis confusiones que el discurso de producto aplasta en la palabra eval. Primera: eval no es arnés —el arnés produce trabajo; la eval adjudica fiabilidad con evidencia externa (Yang et al., 2024; Xie et al., 2024; Liu et al., 2026)—. Segunda: eval no es perplexity; los entornos desplazan la métrica hacia la tarea (Deng et al., 2023; Trivedi et al., 2024; Lee et al., 2025; Zhuang et al., 2023). Tercera: eval no es un leaderboard sin protocolo (Ma et al., 2024; Guo et al., 2024; Xi, Ding et al., 2025). Cuarta: eval no es RAG, fine-tune ni la etiqueta agent (Patil et al., 2024; Schick et al., 2023; Wang et al., 2024). Quinta: Toolformer, HuggingGPT y Reflexion son piezas, no harness de evaluación (Schick et al., 2023; Shen et al., 2023; Shinn et al., 2023). Sexta: Mind2Web, VisualWebArena, AppWorld, OSWorld, AgentBoard, AgentGym, StableToolBench o SEC-bench son jardines de evidencia como protocolo y carteles como premio (Deng et al., 2023; Koh et al., 2024; Trivedi et al., 2024; Xie et al., 2024; Ma et al., 2024; Xi, Ding et al., 2025; Guo et al., 2024; Lee et al., 2025). Inferencia: la eval se cumple con oficio de medición, no con escala del modelo ni con viralidad del clip.

Hay, además, una economía de coordinación. Los artefactos caben en un anuncio; el protocolo con oráculo, presupuesto, taxonomía y traza, no. Wang et al. (2024), Xi, Chen et al. (2025) y Liu et al. (2026) describen el auge de agentes —perfil, memoria, planificación, acción— sin autorizar a leerlo como si ya hubiera criterio verificable. Park et al. (2023) y Li et al. (2023) articulan memoria, plan y comunicación: marcos de sistema, no ranking único. Qian et al. (2024) organizan roles para desarrollo de software: oficio organizacional, no demo de chat. Las contribuciones son tres: separar artefactos de oficio; trazar fronteras frente al arnés, al RAG, al fine-tune, al marketing de agent, al leaderboard sin protocolo y a la perplexity; y ofrecer cuatro pruebas de diseño, no un estándar industrial. No se inventan N, d, r, AUC, porcentajes de leaderboard ni DOI.

2. Estado del arte: práctica situada vs artefacto

Conviene separar cuatro estratos que el mercado de «evals de agentes» suele mezclar. El primero es el constructo de agente LLM como sistema que percibe un entorno, decide y actúa con herramientas, no como un completion más largo ni como un slogan (Wang et al., 2024; Xi, Chen et al., 2025; Park et al., 2023). El segundo es el oficio de la eval en un entorno real o controlable: tareas tipadas, oráculo externo al modelo, presupuestos, taxonomía de fallos, logging de trazas, reproducibilidad e interfaces que dejan rastro medible (Yang et al., 2024; Ma et al., 2024; Trivedi et al., 2024; Xie et al., 2024; Guo et al., 2024; Xi, Ding et al., 2025). El tercero es la evidencia de artefactos de capacidad —tool-use auto-supervisado, orquestación de modelos, reflexión verbal, invocación masiva de APIs, comunicación multi-agente— sin equivalerlos a un harness de evaluación (Schick et al., 2023; Shen et al., 2023; Shinn et al., 2023; Patil et al., 2024; Li et al., 2023; Qian et al., 2024). El cuarto es la auditoría del propio instrumento de medida: calidad de datos del banco de tareas, estabilidad del ranking de tools, descomposición analítica del episodio multi-turno (Aleithan, 2025; Guo et al., 2024; Ma et al., 2024). Inferencia: un leaderboard no observa el repositorio, la página web ni el estado de las apps; un protocolo con oráculo y traza sí.

En constructo, Wang et al. (2024) organizan perfil, memoria, planificación y acción (survey de marco). Xi, Chen et al. (2025) revisan auge y límites (survey 2025). Liu et al. (2026) cierran el mapa en ingeniería de software: el agente se juega como sistema (survey TOSEM). Park et al. (2023) componen memoria, reflexión y planificación como arquitectura de simulacro, no como leaderboard. Li et al. (2023) exploran agentes comunicativos como sociedad de modelos, no como ranking único. En componentes de capacidad, Schick et al. (2023) muestran tool-use tipado —capacidad de tool ≠ eval con oráculo—. Shen et al. (2023) orquestan modelos y tools: planning no es criterio verificable. Shinn et al. (2023) aportan reflexión verbal: el mismo canal no es un oráculo. Patil et al. (2024) documentan API hallucination cuando falta evidencia de recuperación (hallazgo empírico). Qian et al. (2024) describen ChatDev: oficio organizacional, no demo de chat. Inferencia: el constructo autoriza a pedir arquitectura y eval; «pieza = eval» es ilegítima.

En entornos de evidencia —aquí, el jardín operativo donde se mide el agente, no un aula de educación inicial—, Deng et al. (2023) y Koh et al. (2024) tipan tareas web, las segundas con evidencia visual. Trivedi et al. (2024) construyen AppWorld, con estado de apps externo al LLM. Xie et al. (2024) sitúan OSWorld en un computador real. Lee et al. (2025) llevan el principio a tareas de seguridad (SEC-bench). Zhuang et al. (2023) aportan ToolQA: el oráculo no vive en el prompt. Estatus: benchmarks o datasets empíricos de entorno. En el instrumento, Ma et al. (2024) —AgentBoard— descomponen el episodio multi-turno; Xi, Ding et al. (2025) —AgentGym— taxonomizan entornos; Guo et al. (2024) —StableToolBench— tratan la estabilidad del ranking de tools; Yang et al. (2024) muestran que la ACI habilita medición; Aleithan (2025) audita la calidad de datos de SWE-Bench. Inferencia restrictiva: el estado del arte distingue componente, entorno, tablero, estabilidad y auditoría; el mercado los aplasta en un número. Estos trabajos no son trofeos de slide; son protocolos que dejan rastro.

3. Método de revisión

Se realizó una revisión narrativa crítica centrada en benchmarks de agentes, tool-use y surveys de marco (2021–2026), no un metaanálisis primario. El propósito no fue estimar un tamaño de efecto homogéneo ni combinar tasas de leaderboard —tasas que este artículo no inventa—, sino articular un argumento de categoría: qué cuenta como evaluación de un agente basado en LLM y qué queda en el techo de artefacto de exhibición. Criterios de inclusión: (a) 2021–2026; (b) agentes LLM, tool-use, interfaces agente–computadora, entornos de evidencia (web, escritorio, apps, seguridad, QA con tools), tableros analíticos, estabilidad de benchmarking, calidad de datos de bancos de tareas, o surveys de agentes; (c) proceedings o revista con DOI Crossref verificado el 18 de septiembre de 2026 (slot 09:02 America/Mexico_City); (d) relevancia para el contraste oficio de eval / artefacto de demo. Se excluyeron los ejes de educación inicial de esta serie, los catálogos de producto sin paper y cualquier cifra no presente en las fuentes verificadas. Se usaron las veintiuna fuentes de fuentes.md. SWE-bench, WebArena o AgentBench, cuando se nombran, son contexto histórico, sin tasas ni DOI inventados.

La búsqueda y la verificación se ejecutaron el 18 de septiembre de 2026 contra registros Crossref del kit. Cada fuente se leyó por el objeto que realmente mide o propone. Se distinguieron hallazgo empírico, marco e inferencia de diseño. Cuando un artefacto —demo cherry-picked, screenshot de leaderboard, score único de un run, vídeo sin traza, chatbot etiquetado agent, ranking sin presupuestos ni taxonomía— carece de ensayo verificado que lo equivalga a una eval con oráculo externo, se discute como techo de categoría, no como hallazgo cuantitativo. El método no aplica PRISMA propio. No se inventaron N, d, r, AUC, porcentajes de resolución ni DOI. Las cuatro pruebas de la sección 7 son hipótesis de categoría de este artículo, ancladas en el corpus, no un estándar ISO ni un leaderboard sustituto. La relación con el artículo de arnés del 16 de septiembre se trata como distinción de objeto: producir trabajo no es medir fiabilidad. La unidad de análisis es el episodio de medición, no un aula. La viñeta del leaderboard sin traza es un caso límite de exhibición, no etnografía de un laboratorio nombrado; por eso el encabezado 4 se titula eje, no caso.

4. Eje 1. Los artefactos no constituyen apoyo

El apoyo que este eje niega no es el de un adulto en un jardín de infantes: es el apoyo epistémico que un laboratorio reclama cuando declara que «ya evaluó al agente». El primero de los artefactos es la demo cherry-picked: un episodio afortunado se recorta como si fuera la distribución de desempeño. Schick et al. (2023) muestran tool-use tipado; Shen et al. (2023) muestran orquestación; ninguno autoriza a tratar un clip como eval. La demo puede ser un ejemplo de capacidad; no es un protocolo. El segundo es el vídeo de «el agente resolvió X»: comprime el tiempo, oculta reintentos y llamadas alucinadas, y oculta el criterio con el que alguien fuera de cámara decidió que «estaba resuelto». Patil et al. (2024) documentan API hallucination cuando falta evidencia de recuperación: el modo de fallo es el que el vídeo no muestra. Inferencia restrictiva: «se vio que lo hizo» no es un oráculo; es testimonio editado.

El tercer artefacto es el screenshot de leaderboard. Ma et al. (2024) construyen AgentBoard porque un número agregado no dice dónde se rompió el episodio multi-turno. Guo et al. (2024) tratan la inestabilidad del ranking de tools como objeto de diseño. Xi, Ding et al. (2025) evalúan a través de entornos diversos: un ranking de un solo entorno no es el oficio. El screenshot hereda la autoridad visual de una tabla y ninguna de las obligaciones del protocolo. El cuarto es el score único de un run —suerte de muestreo, de temperatura o de un issue mal filtrado—. Aleithan (2025) insiste en la calidad de datos de SWE-Bench: sin auditoría, el score no distingue capacidad de ruido del instrumento. No se inventa aquí ningún porcentaje; se niega que el porcentaje baste.

El quinto artefacto es el chatbot etiquetado agent sin oráculo. Wang et al. (2024), Xi, Chen et al. (2025) y Liu et al. (2026) describen arquitectura y el campo de SE; ninguno equivale la etiqueta a una eval. Shinn et al. (2023) aportan reflexión verbal: un agente que se declara exitoso en el mismo canal no ha salido del contexto. Park et al. (2023) y Li et al. (2023) muestran que memoria y comunicación pueden ser arquitectura; sin oráculo siguen siendo simulacro de éxito. El sexto es el ranking sin presupuestos ni taxonomía. Xie et al. (2024) y Trivedi et al. (2024) construyen entornos con estado observable; Deng et al. (2023) y Koh et al. (2024) construyen tareas web con evidencia de acción. Un ranking que no declara pasos, tokens ni tiempo, ni clasifica el fallo, es lista, no eval. Inferencia: la demo habla por la distribución; el vídeo por el oráculo; el screenshot por el protocolo; el score por la taxonomía; la etiqueta por la arquitectura; el ranking por el oficio.

El techo no niega que Toolformer, HuggingGPT, Reflexion, Gorilla o CAMEL sean contribuciones reales (Schick et al., 2023; Shen et al., 2023; Shinn et al., 2023; Patil et al., 2024; Li et al., 2023). Niega que su existencia autorice el gesto «ya hay eval». Un modelo mayor puede producir trazas más coherentes; Wang et al. (2024) y Xi, Chen et al. (2025) no autorizan leer esa coherencia como medición. Qian et al. (2024) organizan roles: multiplicar personajes en un prompt no instala un oráculo. Liu et al. (2026) tratan el agente de software como sistema; Yang et al. (2024) recuerdan que la interfaz es parte de lo medido. El error no detectado se compone: una tool alucinada produce un estado falso; el siguiente paso razona sobre ese estado; el output parece acabado y está mal. Sin oráculo externo no hay quién corte la cadena. Inferencia de diseño: el laboratorio que solo muestra artefactos no ha evaluado; ha anunciado.

5. Eje 2. El oficio relacional en el jardín

El «jardín» de este eje no es un aula de educación inicial ni un círculo de asamblea: es el entorno operativo de medición —repositorio, navegador, escritorio, apps, tools, seguridad— en el que el oficio de la eval se reconoce como práctica relacional entre modelo, interfaz, oráculo, presupuesto y traza. El piso es un episodio con tareas tipadas, criterio externo, presupuesto, taxonomía, log y, en principio, reproducibilidad (Yang et al., 2024; Ma et al., 2024; Trivedi et al., 2024; Xie et al., 2024; Guo et al., 2024; Zhuang et al., 2023). Hay eval cuando se protege ese oficio, no cuando se exhibe una demo. El objeto medido es el acoplamiento entre modelo, arnés de ejecución e instrumento. El arnés produce el trabajo; la eval lo juzga. Relación, no identidad.

El primer gesto son las tareas tipadas y el oráculo externo al LLM. Zhuang et al. (2023) —ToolQA— formulan preguntas que exigen tool y criterio fuera del modelo. Trivedi et al. (2024) —AppWorld— construyen un mundo de apps con estado observable; el oráculo no es el texto del agente. Deng et al. (2023) —Mind2Web— y Koh et al. (2024) —VisualWebArena— anclan el acierto en la página y en la acción, también visual. Lee et al. (2025) —SEC-bench— llevan el principio a seguridad de software: la verificación no es un «parece un parche». Inferencia: el oráculo es la pieza que el vídeo y el chatbot-juez no sustituyen.

El segundo gesto son los presupuestos de pasos, tokens y tiempo, y el logging de trazas. Xie et al. (2024) —OSWorld— sitúan al agente en un computador real: sin presupuesto el episodio no es comparable; sin traza no es auditable. Yang et al. (2024) —SWE-agent— muestran que la ACI es parte del sistema y de lo que una eval honesta debe declarar (hallazgo empírico de interfaz). Guo et al. (2024) exigen estabilidad del banco de tools. El log es la memoria externa que Reflexion no sustituye (Shinn et al., 2023). Un run sin traza es anécdota; un run con traza y sin presupuesto es una anécdota cara.

El tercer gesto es la taxonomía de fallos. Ma et al. (2024) —AgentBoard— preguntan en qué subhabilidad se rompió el episodio multi-turno. Xi, Ding et al. (2025) —AgentGym— taxonomizan entornos. Aleithan (2025) añade que el fallo puede estar en el dato, no en el agente. Inferencia restrictiva: compactar un episodio multi-turno o de seguridad en un único número es el anti-oficio. El cuarto gesto es la reproducibilidad y la interfaz que deja rastro. Park et al. (2023), Qian et al. (2024) y Li et al. (2023) recuerdan que memoria, roles y comunicación son arquitectura: hay que declararlas en el protocolo, no ocultarlas detrás del nombre del LLM. Reproducir no es repetir el screenshot: es poder reconstruir tareas, oráculo, presupuesto, taxonomía, traza e interfaz.

El oficio se verifica cuando el bucle de medición deja rastro —logs, estados de apps, acciones web, oráculos, paradas—, no cuando el modelo narra lo que «habría hecho» ni cuando un humano edita un vídeo. El jardín de la eval es relacional porque el criterio no vive en el modelo: vive entre el modelo y un mundo que puede contradecirlo. El ranking que oculta esa contradicción no es jardín: es vitrina.

6. Contraste. Fronteras de categoría

La primera frontera es eval versus arnés. El artículo del 16 de septiembre argumentó que escala, prompt o demo de tools sin bucle de observación–acción–verificación no constituyen arnés; este texto lo usa como orilla, no como tesis. El arnés produce ejecución controlada; la eval produce un juicio con evidencia externa (Yang et al., 2024; Liu et al., 2026; Xie et al., 2024). Se puede tener ACI sin oráculo de tarea, o un banco de tareas sin aislamiento. Confundirlos permite decir «tenemos eval» cuando solo hay runtime, o «tenemos arnés» cuando solo hay ranking. La segunda frontera es eval versus RAG: recuperar pasajes no observa un escritorio ni verifica un parche. Patil et al. (2024) muestran que el tool calling exige evidencia de recuperación; eso no convierte a RAG en eval. La tercera es eval versus fine-tune: Schick et al. (2023) enseñan tools en el modelo; el checkpoint no es un protocolo de medición.

La cuarta frontera es eval versus perplexity: Deng et al. (2023), Koh et al. (2024), Trivedi et al. (2024), Xie et al. (2024), Lee et al. (2025) y Zhuang et al. (2023) desplazan el objeto hacia la tarea. Predecir el siguiente token no es resolver una tarea web visual ni un issue de seguridad. La quinta es eval versus marketing de agent: Wang et al. (2024), Xi, Chen et al. (2025), Liu et al. (2026), Park et al. (2023), Li et al. (2023) y Qian et al. (2024) describen potencial, arquitectura y roles, no una etiqueta de chatbot. La sexta es eval versus leaderboard sin protocolo: Ma et al. (2024) descomponen; Guo et al. (2024) piden estabilidad; Aleithan (2025) pide calidad de datos; Xi, Ding et al. (2025) piden diversidad de entornos. Una fila de tabla sin oráculo, presupuesto, taxonomía y traza no distingue modelo, prompt, arnés y suerte. Memoria, plan, comunicación, orquestación y reflexión verbal son componentes: sin oráculo pueden memorizar el error o teatralizar el consenso (Park et al., 2023; Li et al., 2023; Qian et al., 2024; Shen et al., 2023; Shinn et al., 2023). Los entornos del corpus son jardines de evidencia como protocolo y trofeos como anuncio. La categoría «eval» es conjuntiva: falta una pieza y el sistema recae en artefacto, aunque el slide diga SOTA.

Una frontera adicional protege este artículo de colonizar el del arnés y la serie de educación inicial. Medir el trabajo no es producirlo. El jardín de este eje es el entorno de medición, no un aula. SWE-bench, WebArena y AgentBench se tratan como contexto histórico, sin tasas fabricadas; los objetos con DOI del corpus se leen como entornos o como críticas del instrumento, no como medallas. Nombrar el banco no es haber evaluado. Usar el banco con protocolo sí.

7. Cuatro pruebas de apoyo (no artefacto)

El marco que sigue es inferencia de diseño de este artículo, anclada en los ejes y en las fuentes verificadas. No es un estándar ISO ni un leaderboard. Distingue cuatro pruebas. Si una plataforma, un paper o un producto no las pasa, no puede declarar que la demo, el screenshot, el score único, el vídeo, el chatbot etiquetado agent o el ranking sin protocolo constituyen evaluación de un agente.

7.1. Prueba de tareas tipadas y oráculo externo al LLM, no de la demo ni del vídeo ni del modelo que se autoevalúa. Zhuang et al. (2023) exigen tools y criterio fuera del contexto; Trivedi et al. (2024) exponen estado de apps; Deng et al. (2023) y Koh et al. (2024) anclan acción web, también visual; Lee et al. (2025) anclan seguridad; Xie et al. (2024) anclan el computador real. Si la «evidencia» es que el modelo escribió «listo» o que un humano recortó un vídeo, hay teatro de eval, no eval.

7.2. Prueba de presupuestos fijos y logging de trazas reproducibles, no del run único ni del ranking opaco. Yang et al. (2024) sitúan la ACI como rastro; Xie et al. (2024) exigen un episodio acotable; Guo et al. (2024) exigen estabilidad; Shinn et al. (2023) se releen en negativo: la reflexión verbal no sustituye el log. Hay eval cuando otro laboratorio puede reconstruir pasos, tokens, tiempo, interfaz y traza.

7.3. Prueba de taxonomía de fallos y descomposición analítica, no del score único. Ma et al. (2024) descomponen el episodio multi-turno; Xi, Ding et al. (2025) taxonomizan entornos; Aleithan (2025) descompone el instrumento; Patil et al. (2024) nombran API hallucination, que un número agregado oculta. Un laboratorio que solo reporta un porcentaje no ha evaluado el cómo.

7.4. Prueba de la distinción de categoría y del juicio de diseño de eval, no del catálogo de producto ni del trofeo de entorno. Eval ≠ arnés ≠ RAG ≠ fine-tune ≠ marketing de agent ≠ leaderboard sin protocolo ≠ perplexity ≠ demo ≠ vídeo. Wang et al. (2024), Xi, Chen et al. (2025) y Liu et al. (2026) impiden reducir el campo a un slogan. Park et al. (2023), Li et al. (2023), Qian et al. (2024), Schick et al. (2023) y Shen et al. (2023) son arquitectura o capacidad, no licencia para omitir el protocolo. El trabajo de evaluar se cumple diseñando el acoplamiento tareas–oráculo–presupuesto–taxonomía–traza y declarando qué pieza falta.

El marco admite tool-use, reflexión, orquestación, APIs, roles y memoria como piezas (Schick et al., 2023; Shinn et al., 2023; Shen et al., 2023; Patil et al., 2024; Qian et al., 2024; Park et al., 2023). Rechaza declarar eval por cualquiera de ellos en solitario. Las cuatro pruebas se leen en conjunto: pasar una y fallar las otras es, otra vez, artefacto.

8. Discusión

Tres tensiones organizan la discusión. La primera es entre exhibir los artefactos y ejercer el oficio de la eval. Schick et al. (2023), Shen et al. (2023), Shinn et al. (2023), Patil et al. (2024) y Li et al. (2023) sostienen componentes reales —tools, orquestación, reflexión, APIs, comunicación— que el mercado infla hasta hacerlos pasar por medición. Ma et al. (2024), Guo et al. (2024), Yang et al. (2024) y Aleithan (2025) sostienen el contraste: tablero analítico, estabilidad, interfaz, auditoría de datos. Inferencia: la pieza es verdadera en su dominio; «pieza = eval de agente» es una inferencia de categoría ilegítima. El screenshot del ranking es el gesto que mejor resume esa ilegitimidad: hereda la forma de la ciencia y ninguna de sus obligaciones de protocolo.

La segunda es entre producir trabajo y medirlo. El arnés del 16 de septiembre y la eval de este texto se necesitan y no se sustituyen. Yang et al. (2024) muestran que la ACI cambia el trabajo posible; Xie et al. (2024) y Trivedi et al. (2024) muestran entornos con estado observable; Liu et al. (2026) recuerdan que en ingeniería de software el agente se juega en el sistema. Omitir el arnés y exhibir un ranking es un sesgo; omitir la eval y exhibir un runtime es el sesgo simétrico. Xi, Chen et al. (2025) y Wang et al. (2024) describen el auge de agentes más capaces: ese auge no firma, por sí solo, ni arnés ni eval. La ganancia empírica reportada no se lee con honestidad si se atribuye a un clip o a un score único y se oculta el protocolo.

La tercera es entre el modo de fallo y el instrumento. Patil et al. (2024) nombran la alucinación de API; Koh et al. (2024) y Deng et al. (2023) distinguen error de percepción y de plan; Lee et al. (2025) sitúan la seguridad como dominio en el que «parece resuelto» no basta; Aleithan (2025) sitúa el error en el dato. Ma et al. (2024) y Xi, Ding et al. (2025) impiden compactar esa heterogeneidad; Guo et al. (2024) recuerdan que el ranking puede ser inestable. Sin oráculo, taxonomía y auditoría, el error no se ve o se atribuye al sitio equivocado. Park et al. (2023) y Qian et al. (2024) ilustran que memoria y roles pueden ensayar el mismo error con más elocuencia.

Las cuatro pruebas leen estas tensiones. Un caller, un rol o una invocación pueden vivir dentro de un sistema evaluado; no lo es invertir la secuencia: primero el anuncio de «agente evaluado», después la esperanza de que el modelo se verifique solo (Xi, Chen et al., 2025; Wang et al., 2024; Schick et al., 2023; Patil et al., 2024; Qian et al., 2024). Si hay tareas tipadas, oráculo, presupuesto, traza, taxonomía y juicio de diseño, hay eval; si solo hay demo, screenshot, score de un run o vídeo, hay artefactos. Zhuang et al. (2023) y Xie et al. (2024) recuerdan que el criterio vive fuera: en la tool y en el escritorio, no en el aplauso del propio modelo.

9. Límites

Esta revisión es narrativa. No aplica PRISMA propio ni estima efectos combinados. No se inventan porcentajes de leaderboard ni N, d, r o AUC. Las fuentes de tool-use, reflexión, orquestación y APIs se leen por el objeto que proponen, no como ensayos de «eval de producción» (Schick et al., 2023; Shinn et al., 2023; Shen et al., 2023; Patil et al., 2024; Li et al., 2023). Yang et al. (2024) anclan interfaz, sin generalizar a todo dominio. Los entornos y datasets (Deng et al., 2023; Koh et al., 2024; Trivedi et al., 2024; Xie et al., 2024; Lee et al., 2025; Zhuang et al., 2023) tienen transferencia de escenario marcada. AgentBoard, AgentGym y StableToolBench son tablero, multi-entorno y estabilidad, no un trial del techo de artefactos (Ma et al., 2024; Xi, Ding et al., 2025; Guo et al., 2024). Park et al. (2023) y Qian et al. (2024) son arquitectura y roles; Wang et al. (2024), Xi, Chen et al. (2025) y Liu et al. (2026) son surveys; Aleithan (2025) es calidad de datos de un banco específico.

No se localizaron ensayos que equivalgan demo, screenshot, score de un run o vídeo sin traza a una eval con oráculo, presupuesto, taxonomía y reproducibilidad; se discuten como techo de categoría. No se evalúan productos comerciales. Las inferencias de la sección 7 son hipótesis de diseño, no evidencia de un runtime. El «jardín» del encabezado 5 nombra el entorno de medición; no transfiere hallazgos de educación inicial. SWE-bench, WebArena y AgentBench aparecen como contexto histórico, sin tasas ni DOI inventados. Este texto no vuelve a demostrar que el arnés no es el modelo: demuestra que la eval no es el arnés ni el cartel.

10. Conclusiones

Una demo cherry-picked, un screenshot de leaderboard, un score único de un run o un vídeo de «el agente resolvió X» sin harness de evaluación fijo no constituyen evaluación de un agente. Tampoco la constituyen un chatbot etiquetado agent, un RAG, un fine-tune, un ranking sin protocolo ni la perplexity. Schick et al. (2023), Shinn et al. (2023), Shen et al. (2023), Patil et al. (2024) y Li et al. (2023) confirman componentes sin equivalencia a eval. Wang et al. (2024), Xi, Chen et al. (2025) y Liu et al. (2026) fijan el mapa. Cuando hay eval hay oficio: tareas y oráculo externo (Zhuang et al., 2023; Trivedi et al., 2024; Deng et al., 2023; Koh et al., 2024; Lee et al., 2025); presupuestos, trazas e interfaz (Xie et al., 2024; Yang et al., 2024; Guo et al., 2024); taxonomía, no score único (Ma et al., 2024; Xi, Ding et al., 2025; Aleithan, 2025); arquitectura y roles declarados (Park et al., 2023; Qian et al., 2024). La eval se distingue del arnés, del LLM solo, de la demo y del slogan.

Donde las fuentes no miden un runtime de producción, este artículo no lo afirma. Donde miden tools, entornos, tableros, estabilidad, calidad de datos o surveys, no los traduce en «el agente ya está evaluado» vía clip o vía captura de pantalla. Distinguir capacidad de demo de evidencia de trabajo es ejercer tareas tipadas, oráculos externos, presupuestos, taxonomía de fallos, logging de trazas y reproducibilidad, con un criterio que puede contradecir al modelo. Lo demás es demo cherry-picked, screenshot, score de un run y vídeo sin traza. No es evaluación, y no debe presentarse como lo que no es. El arnés produce trabajo; la eval dice si ese trabajo es fiable. Confundirlos es el gesto que este texto se niega a firmar.

Laboratorio Editorial de NEXTECH.IA / Ingeniero Mitre.

Referencias

  1. Aleithan, R. (2025). Revisiting SWE-Bench: On the importance of data quality for LLM-based code models. En 2025 IEEE/ACM 47th International Conference on Software Engineering: Companion Proceedings (ICSE-Companion). https://doi.org/10.1109/icse-companion66252.2025.00075
  2. Deng, X., Gu, Y., Zheng, B., Chen, S., Stevens, S., Wang, B., Sun, H. y Su, Y. (2023). Mind2Web: Towards a generalist agent for the web. En Advances in Neural Information Processing Systems 36. https://doi.org/10.52202/075280-1220
  3. Guo, Z., Cheng, S., Wang, H., Liang, S., Qin, Y., Li, P., Liu, Z., Sun, M. y Liu, Y. (2024). StableToolBench: Towards stable large-scale benchmarking on tool learning of large language models. En Findings of the Association for Computational Linguistics ACL 2024 (pp. 11143-11156). https://doi.org/10.18653/v1/2024.findings-acl.664
  4. Koh, J. Y., Lo, R., Jang, L., Duvvur, V., Lim, M., Huang, P. Y., Neubig, G., Zhou, S., Salakhutdinov, R. y Fried, D. (2024). VisualWebArena: Evaluating multimodal agents on realistic visual web tasks. En Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 881-905). https://doi.org/10.18653/v1/2024.acl-long.50
  5. Lee, H., Zhang, Z., Lu, H. y Zhang, L. (2025). SEC-bench: Automated benchmarking of LLM agents on real-world software security tasks. En Advances in Neural Information Processing Systems 38. https://doi.org/10.52202/085713-3878
  6. Li, G., Hammoud, H., Itani, H., Khizbullin, D. y Ghanem, B. (2023). CAMEL: Communicative agents for “mind” exploration of large language model society. En Advances in Neural Information Processing Systems 36. https://doi.org/10.52202/075280-2264
  7. Liu, J., Wang, K., Chen, Y., Peng, X., Chen, Z., Zhang, L. y Lou, Y. (2026). Large language model-based agents for software engineering: A survey. ACM Transactions on Software Engineering and Methodology. https://doi.org/10.1145/3796507
  8. Ma, C., Zhang, J., Zhu, Z., Yang, C., Yang, Y., Jin, Y., Lan, Z., Kong, L. y He, J. (2024). AgentBoard: An analytical evaluation board of multi-turn LLM agents. En Advances in Neural Information Processing Systems 37. https://doi.org/10.52202/079017-2365
  9. Park, J. S., O’Brien, J., Cai, C. J., Morris, M. R., Liang, P. y Bernstein, M. S. (2023). Generative agents: Interactive simulacra of human behavior. En Proceedings of the 36th Annual ACM Symposium on User Interface Software and Technology (pp. 1-22). https://doi.org/10.1145/3586183.3606763
  10. Patil, S., Zhang, T., Wang, X. y Gonzalez, J. (2024). Gorilla: Large language model connected with massive APIs. En Advances in Neural Information Processing Systems 37. https://doi.org/10.52202/079017-4020
  11. Qian, C., Liu, W., Liu, H., Chen, N., Dang, Y., Li, J., Yang, C., Chen, W., Su, Y., Cong, X., Xu, J., Li, D., Liu, Z. y Sun, M. (2024). ChatDev: Communicative agents for software development. En Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 15174-15186). https://doi.org/10.18653/v1/2024.acl-long.810
  12. Schick, T., Dwivedi-Yu, J., Dessi, R., Raileanu, R., Lomeli, M., Hambro, E., Zettlemoyer, L., Cancedda, N. y Scialom, T. (2023). Toolformer: Language models can teach themselves to use tools. En Advances in Neural Information Processing Systems 36. https://doi.org/10.52202/075280-2997
  13. Shen, Y., Song, K., Tan, X., Li, D., Lu, W. y Zhuang, Y. (2023). HuggingGPT: Solving AI tasks with ChatGPT and its friends in Hugging Face. En Advances in Neural Information Processing Systems 36. https://doi.org/10.52202/075280-1657
  14. Shinn, N., Cassano, F., Gopinath, A., Narasimhan, K. y Yao, S. (2023). Reflexion: Language agents with verbal reinforcement learning. En Advances in Neural Information Processing Systems 36. https://doi.org/10.52202/075280-0377
  15. Trivedi, H., Khot, T., Hartmann, M., Manku, R., Dong, V., Li, E., Gupta, S., Sabharwal, A. y Balasubramanian, N. (2024). AppWorld: A controllable world of apps and people for benchmarking interactive coding agents. En Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 16022-16076). https://doi.org/10.18653/v1/2024.acl-long.850
  16. Wang, L., Ma, C., Feng, X., Zhang, Z., Yang, H., Zhang, J., Chen, Z., Tang, J., Chen, X., Lin, Y., Zhao, W. X., Wei, Z. y Wen, J. (2024). A survey on large language model based autonomous agents. Frontiers of Computer Science, 18(6). https://doi.org/10.1007/s11704-024-40231-1
  17. Xi, Z., Chen, W., Guo, X., He, W., Ding, Y., Hong, B., Zhang, M., Wang, J., Jin, S., Zhou, E., Zheng, R., Fan, X., Wang, X., Xiong, L., Zhou, Y., Wang, W., Jiang, C., Zou, Y., Liu, X., Yin, Z., Dou, S., Weng, R., Qin, W., Zheng, Y., Qiu, X., Huang, X., Zhang, Q. y Gui, T. (2025). The rise and potential of large language model based agents: A survey. Science China Information Sciences, 68(2). https://doi.org/10.1007/s11432-024-4222-0
  18. Xi, Z., Ding, Y., Chen, W., Hong, B., Guo, H., Wang, J., Guo, X., Yang, D., Liao, C., He, W., Gao, S., Chen, L., Zheng, R., Zou, Y., Gui, T., Zhang, Q., Qiu, X., Huang, X., Wu, Z. y Jiang, Y. G. (2025). AgentGym: Evaluating and training large language model-based agents across diverse environments. En Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 27914-27961). https://doi.org/10.18653/v1/2025.acl-long.1355
  19. Xie, T., Zhang, D., Chen, J., Li, X., Zhao, S., Cao, R., Hua, T., Cheng, Z., Shin, D., Lei, F., Liu, Y., Xu, Y., Zhou, S., Savarese, S., Xiong, C., Zhong, V. y Yu, T. (2024). OSWorld: Benchmarking multimodal agents for open-ended tasks in real computer environments. En Advances in Neural Information Processing Systems 37. https://doi.org/10.52202/079017-1650
  20. Yang, J., Jimenez, C., Wettig, A., Lieret, K., Yao, S., Narasimhan, K. y Press, O. (2024). SWE-agent: Agent-computer interfaces enable automated software engineering. En Advances in Neural Information Processing Systems 37. https://doi.org/10.52202/079017-1601
  21. Zhuang, Y., Yu, Y., Wang, K., Sun, H. y Zhang, C. (2023). ToolQA: A dataset for LLM question answering with external tools. En Advances in Neural Information Processing Systems 36. https://doi.org/10.52202/075280-2180