Si tu equipo de tecnología lleva meses debatiendo si migrar de un modelo de IA a otro para mejorar resultados, la investigación que publicó Nvidia el 21 de agosto debería frenar esa conversación. Nvidia tomó el mismo modelo, Claude Opus 5 de Anthropic, y lo hizo pasar de un 30% de aciertos a un 100% en un benchmark exigente. No cambió el modelo. Cambió todo lo que lo rodea: el harness [1].
Es la confirmación más contundente hasta ahora de algo que este blog viene documentando desde hace meses: en sistemas de IA que actúan de forma autónoma, la arquitectura que envuelve al modelo pesa tanto o más que el modelo mismo. Si gestionas marketing, comercio digital o automatización en tu empresa, este experimento tiene una lectura directa para tu presupuesto de IA.
¿Qué es un harness de IA y por qué Nvidia dice que importa más que el modelo?
Un harness es la envoltura de software que rodea a un modelo de IA: las herramientas, la gestión de memoria y las reglas que convierten un modelo capaz de generar texto en algo que puede actuar por sí mismo [1]. El modelo aporta el razonamiento crudo, pero es el harness el que decide qué contexto recibe, qué herramientas puede usar, cómo recuerda lo que hizo antes y cómo corrige el rumbo cuando algo sale mal.
Adel El Hallak, vicepresidente de producto de la unidad de IA de Nvidia, lo resume así en la investigación:
"Generalmente, el mundo interpreta un agente casi como una API del modelo. Pero un agente es en realidad más que eso: es el modelo, es el andamiaje alrededor del modelo (lo que llamamos harness), es decir, el conjunto de herramientas que utiliza. Es el runtime y las habilidades y librerías asociadas a las que le damos acceso" [1].
Nvidia formalizó este concepto bajo el nombre de "harness engineering" a comienzos de 2026: la disciplina de diseñar todo el sistema que envuelve al modelo (no solo los prompts) y de tratar los fallos de un agente como problemas de diseño de sistema que se resuelven de forma permanente, no como errores que se arreglan reintentando con un mejor prompt [10]. Si quieres profundizar en la definición completa y en cómo se diferencia del prompt engineering tradicional, publiqué un artículo sobre esto: harness engineering para escalar agentes de IA.
El experimento: cómo el mismo modelo pasó de 30% a 100% en ARC-AGI-3
Nvidia sometió a distintos modelos al benchmark ARC-AGI-3, un conjunto de juegos 2D sin instrucciones donde el sistema tiene que descubrir por sí mismo cómo jugar y ganar, de forma parecida a como lo haría una persona enfrentando un juego nuevo [1]. Es un benchmark que ha resultado particularmente incómodo para OpenAI, uno de los rivales directos de Nvidia y Anthropic en esta carrera [1].
El resultado es la parte que debería llamar tu atención:
| Configuración | Resultado en ARC-AGI-3 |
|---|---|
| Claude Opus 5 sin harness | 30% (el mejor puntaje entre todos los modelos evaluados sin harness) [1] |
| Claude Opus 5 con el harness AVO de Nvidia (memoria + agente supervisor) | 100% de aciertos, resolviendo los 183 niveles de los 25 entornos [1][12] |
| Modelos de OpenAI antes de ajustar su propio harness | Menos del 10% [7] |
| Modelos de OpenAI después de ajustar su harness (triplicaron el puntaje) | Alrededor de 30%, muy por debajo del resultado de Nvidia [7] |
El harness que usó Nvidia se llama AVO (Agentic Variation Operators) y no es un producto comercial cerrado: Nvidia lo publica como parte de su ecosistema abierto NeMo [7]. La pieza clave no fue un modelo más grande ni más caro, sino dos decisiones de diseño: una gestión de memoria ajustada para tareas largas y un componente "supervisor" que actúa casi como un jefe de equipo, redirigiendo al agente cuando se atasca o se desvía del objetivo [11].
Nvidia probó la misma arquitectura en un dominio completamente distinto para confirmar que no era un truco específico del benchmark. En optimización de kernels de GPU, AVO exploró de forma autónoma más de 500 direcciones de solución, confirmó 40 versiones de kernel y llegó a un rendimiento hasta 10.5% superior a FlashAttention-4 en sistemas Nvidia DGX B200, sin intervención manual [12]. El mensaje técnico de Nvidia es explícito: el rendimiento y la generalidad de un sistema de agentes vienen de la arquitectura a nivel de sistema, no solo de la capacidad del modelo [12].
¿Por qué esto es una decisión de negocio y no solo un dato técnico?
Porque el harness no solo determina si un agente acierta o falla: también determina cuánto te cuesta cada tarea que ese agente ejecuta. En julio, Databricks publicó una investigación paralela que muestra que, corriendo el mismo modelo bajo distintos harnesses, el costo de inferencia puede duplicarse [3].
Ali Ghodsi, CEO de Databricks, lo planteó de forma directa a TechCrunch: "puedes elegir el mismo modelo pero distintos harnesses, y obtienes un costo significativamente mayor si usas el harness equivocado. Entonces piensas: ah, este es un modelo caro, este es un modelo barato. Pero espera, ¿qué harness estás usando? Eso solo puede duplicar tu costo" [3].
Juntando ambos hallazgos, Nvidia sobre precisión y Databricks sobre costo, la conclusión para cualquier empresa que esté evaluando proveedores de IA es la misma: comparar modelos por su ficha técnica o su precio por token, sin mirar el harness que los va a operar, es comparar la mitad de la ecuación. Si te preguntas si vale la pena invertir en personalizar el modelo en sí en vez de invertir en la capa que lo rodea, ya cubrí ese dilema en detalle en cuándo vale la pena personalizar un LLM para tus agentes de IA.
¿Qué significa "harness" en términos prácticos para un equipo de marketing o comercio digital?
En la práctica, el harness es la suma de cuatro piezas que casi nunca aparecen en la demo comercial de una herramienta de IA: memoria (qué recuerda el agente entre pasos y entre sesiones), herramientas (a qué sistemas, APIs o catálogos puede conectarse), reglas de contexto (qué información recibe en cada paso y qué se descarta) y un mecanismo de supervisión (qué corrige el rumbo cuando el agente se equivoca o se queda dando vueltas).
Si tu empresa ya conecta agentes a un CRM, a un catálogo de producto o a un ERP a través de protocolos como MCP, ese conjunto de conexiones y reglas de gobierno es, literalmente, tu harness. Documenté cómo se estandariza esa capa de integraciones en el artículo sobre el MCP Gateway como puerta única para que tus agentes de IA usen tus herramientas.
¿Qué debería hacer tu empresa con esta evidencia?
Antes de aprobar el próximo cambio de modelo o el próximo aumento de presupuesto en licencias de IA, hay una lista corta de preguntas que vale la pena resolver primero:
- Audita el harness antes de culpar al modelo. Si un agente falla o alucina en tareas largas, revisa primero la gestión de memoria y el manejo de contexto antes de asumir que el modelo "no sirve" [1].
- Presupuesta ingeniería de harness, no solo licencias de modelo. El componente supervisor y la gestión de memoria que usó Nvidia son trabajo de ingeniería, no una casilla que se marca al contratar un modelo más caro [11].
- Compara costos por harness, no solo por modelo. Pide a tus proveedores o a tu equipo técnico una medición de costo real bajo tu harness actual antes de decidir que un modelo es "barato" o "caro" [3].
- Evalúa harnesses abiertos frente a cerrados. Nvidia defiende explícitamente que los harnesses abiertos, igual que los modelos abiertos, dan más control real del que la mayoría de usuarios cree tener [3].
- No trates los fallos como un problema de prompt. La disciplina de harness engineering trata los fallos recurrentes de un agente como defectos de diseño de sistema que se corrigen una sola vez, de forma permanente [10].
Este tipo de decisiones de arquitectura son, en buena medida, el mismo trabajo que ya cubrimos al comparar plataformas de agentes gestionados de los grandes proveedores. Si estás evaluando qué plataforma te da más control sobre esta capa, te sirve revisar la comparativa de Claude Managed Agents frente a otras plataformas de agentes de IA.
Conclusiones Clave
- Nvidia demostró que el mismo modelo, Claude Opus 5, pasó de 30% a 100% de aciertos en el benchmark ARC-AGI-3 sin cambiar de modelo, solo cambiando el harness que lo rodea [1].
- El harness incluye gestión de memoria, herramientas disponibles, reglas de contexto y un componente supervisor que corrige el rumbo del agente [1][11].
- Databricks encontró, de forma independiente, que el harness puede duplicar el costo de inferencia incluso usando el mismo modelo [3].
- Nvidia publica su harness AVO (Agentic Variation Operators) como parte de su ecosistema abierto NeMo, no como producto cerrado [7].
- La disciplina de harness engineering trata los fallos de un agente como problemas de arquitectura que se resuelven de forma permanente, no con mejores prompts [10].
- Para tu empresa, la decisión relevante ya no es solo "qué modelo elegir", sino cuánto inviertes en la capa de orquestación, memoria y supervisión que lo rodea.
Lleva esto a tu operación
Evaluar modelos por su ficha técnica sin auditar el harness que los va a operar es, según esta evidencia, la forma más común de tomar una mala decisión de inversión en IA. Si tu empresa está diseñando o escalando agentes de IA para marketing, ventas o atención al cliente, en Franco ayudamos a construir esa capa de orquestación con foco en resultados medibles: conoce el servicio de automatización con agentes de IA y MCP.
Sobre el Autor
Juan P Franco es consultor en expansión digital, comercio electrónico y automatización con agentes de IA. Ayuda a empresas de todo tamaño y modelo de negocio (B2B, B2C, retail, D2C) a crecer en canales digitales con estrategias basadas en datos y tecnología.
Referencias
[1] TechCrunch, "Nvidia just showed that the harness, not the AI model, is now the real hero" (21 de agosto, 2026): https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/
[3] TechCrunch, cita de Ali Ghodsi (Databricks) sobre costos de harness vs modelo: https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/
[7] AI Chat Daily, "Nvidia says the harness, not the model, drives Claude Opus 5 to 100% on ARC-AGI-3": https://www.aichatdaily.com/ai-models/nvidia-says-harness-not-model-drives-claude-opus
[10] Nvidia Elements, "Agent Harness Guidelines Reference": https://nvidia.github.io/elements/docs/internal/guidelines/agent-harness/
[11] daily.dev, resumen de la investigación de Nvidia sobre AVO y ARC-AGI-3: https://daily.dev/posts/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero-xhs3liky3
[12] NVIDIA Technical Blog, "NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents": https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
