En resumen. Hace once días argumentamos que la parte difícil de un asistente personal no es el modelo, sino llegar a tu vida siquiera. La semana pasada Nvidia publicó una investigación que señala un segundo cuello de botella que tampoco es el modelo: el software construido a su alrededor. Misma conclusión, mecanismo distinto, y entre los dos cubren la mayor parte de lo que de verdad decide si un asistente sirve para algo. Creemos que esto importa más para la IA personal que para cualquier otra cosa, y más abajo decimos por qué esa parte es afirmación nuestra y no suya.

El 14 de agosto publicamos un texto que sostenía que el cuello de botella nunca fue el modelo. En corto: «contexto perfecto de toda tu vida» es una afirmación sobre datos, no sobre inteligencia. Tu vida está en diez años de Mail, en una base de Mensajes que se remonta a tu primer iPhone y en una exportación de WhatsApp que oficialmente no existe. En un Mac, cada una de esas cosas está detrás de un permiso, y esos permisos no se abren para un modelo más listo.

El 21 de agosto Nvidia publicó una investigación que llega a la misma conclusión desde una dirección completamente distinta.

Qué encontraron en realidad

Tomaron Claude Opus 5 y lo ejecutaron contra ARC-AGI-3, una prueba de razonamiento. Sin modificar, sacó un 30 %. Después dejaron el modelo completamente intacto y reconstruyeron el software de alrededor: el conjunto de herramientas, cómo se gestionan la memoria y el contexto, cómo vuelve la retroalimentación al agente, más un componente supervisor que interviene cuando el agente se desvía. El mismo modelo. La puntuación subió al 100 %.

Nvidia llama a esa envoltura el harness. Su vicepresidente Adel El Hallak lo dijo de la forma más directa posible: «Es el modelo. Es el andamiaje alrededor del modelo, lo que llamamos el harness».

No son el único dato del artículo. Se informa de que OpenAI triplicó su propia puntuación en ARC-AGI-3 cambiando dos ajustes del harness. Se cita a Databricks al constatar que la elección del harness puede mover el coste operativo el doble, más de lo que lo hace la elección del modelo.

Dos cuellos de botella distintos, y conviene ser preciso en esto

Sería fácil, y algo deshonesto, presentar esto como la validación exacta de lo que escribimos. No lo es del todo, y la diferencia es la parte interesante.

Nuestro cuello de botella es meter los datos dentro: permisos, exportaciones, formatos, la década de material que ningún modelo ha visto nunca. El de Nvidia es lo que ocurre alrededor del modelo en tiempo de ejecución: herramientas, memoria, retroalimentación, supervisión. No son la misma afirmación. Podrías resolver una y seguir atascado en la otra.

Lo que comparten es la forma. Ambas son fontanería. Ambas son poco lucidas, invisibles cuando funcionan y ausentes de toda presentación de producto. Y ambas son ya, según la evidencia, más decisivas que el número de parámetros sobre el que discute todo el mundo.

Por qué creemos que esto muerde más fuerte en la IA personal

Esta parte es nuestro argumento, no el de Nvidia. Ellos probaron agentes con acertijos y no dijeron absolutamente nada sobre asistentes personales. Pero la lógica se traslada, y se traslada con más fuerza, no con menos.

Un modelo general que responde a una pregunta general puede apoyarse en lo que absorbió de internet. Ha leído muchísimo sobre casi todo. Pero nada en internet dice qué le prometiste a tu hermano en febrero, ni que la persona que te escribe hoy es la que conociste en un congreso hace cuatro años. Ninguna cantidad de parámetros recupera un hecho que nunca se le dio al modelo. Para un asistente personal, el andamiaje no es una optimización encima de la inteligencia. Es la parte que aporta la materia.

Lo cual significa que los dos cuellos de botella se componen. El harness solo puede trabajar con el contexto que alcanza, y el contexto solo se alcanza si algo hizo antes el trabajo poco lucido de sacarlo de Mail, de Mensajes y de WhatsApp. Resuelve el segundo sin el primero y tendrás un sistema de razonamiento excelente sin nada personal sobre lo que razonar.

Lo que no vamos a afirmar

ARC-AGI-3 es una prueba de acertijos. Pasar del 30 % al 100 % en rejillas de razonamiento abstracto es un resultado real sobre andamiaje de agentes, y no es un resultado sobre resumir qué pasó con tu hermana el año pasado. Nadie ha demostrado esa transferencia, nosotros incluidos, y no vamos a citar la cifra como si fuera nuestra.

Nvidia además tiene un interés comercial evidente en la conclusión de que hay que invertir más en andamiaje y en la computación para hacerlo funcionar. Eso no hace que el hallazgo sea falso. Sí significa que conviene leerlo como se lee cualquier investigación publicada por una parte a la que le beneficia creerla.

Y un harness que se supervisa a sí mismo con un segundo agente cuesta tokens y tiempo de reloj. En un Mac que ejecuta un modelo, ese presupuesto es real de una forma que no lo es en un centro de datos. Parte de lo que Nvidia puede permitirse, nosotros no, y preferimos decirlo antes que dar a entender que nuestro andamiaje está medido y es mejor que el de nadie. No está medido en absoluto. Es justo que nos lo recuerdes más adelante.

La parte que no depende de quién tenga razón

Hay aquí una lectura estratégica que sobrevive sea cual sea el cuello de botella que acabe dominando.

Si el modelo no es lo que decide la calidad, entonces el modelo es la parte más intercambiable del sistema. Vale la pena detenerse en ello, porque es la misma conclusión a la que llegamos la semana pasada desde el lado de la cadena de suministro, por una vía completamente distinta. Si los pesos son un archivo en tu disco y ese archivo es reemplazable, entonces la capa cuya pérdida preocupa a todo el mundo es la que menos importa.

Las partes verdaderamente difíciles de reemplazar son las que nadie fotografía: el trabajo de permisos, los analizadores, la resolución de identidades, el grafo, la recuperación, aquello que se da cuenta. Eso es la mayor parte de lo que hemos construido, y durante mucho tiempo fue difícil explicar por qué llevaba tanto, porque la fontanería no se puede enseñar en una demo.

Esta semana es un poco más fácil de explicar.