Se acabó agosto. Enciende el harness
Agosto dice adiós. ADIÓS. SE VA.
La alarma, que llevaba cuatro semanas convertida en un adorno carísimo de la mesilla, vuelve a sonar.
No avisa.
Ataca.
Formación presencial · Madrid
¿Quieres salir de aquí sabiendo hacer esto en tu empresa el próximo 14 de noviembre?
En un día presencial montas tus departamentos agénticos con IA y construyes tu propia app. Sin conocimientos técnicos. Máx. 16 plazas.
Abres un ojo.
Miras la hora.
Y empieza la primera negociación empresarial del curso.
Cinco minutos más.
Eso dijiste hace quince.
Te levantas.
Pones el café.
Buscas las llaves, la tarjeta, la mochila o ese cargador que llevaba todo agosto exactamente donde debía estar y hoy ha decidido independizarse.
Tu cerebro no es más inteligente que ayer.
Ni has descargado una actualización mientras dormías.
Pero, poco a poco, vuelves a montar todo lo que necesitas para funcionar.
La alarma.
El café.
Las llaves.
El móvil cargado.
La ruta en Waze.
La contraseña que, por supuesto, olvidaste durante las vacaciones.
ESPONTANEIDAD.
Y todo esto por qué te lo cuento.
Porque con la inteligencia artificial está pasando exactamente lo mismo.
Llevamos dos años mirando el cerebro.
El modelo.
Pero lo que hace que trabaje de verdad es todo lo que colocas alrededor.
Las instrucciones.
Las herramientas.
La memoria.
Los permisos.
La ejecución.
La verificación.
Eso tiene un nombre en inglés monísimo: harness.
Coge un café doble.
Y cada vez que leas o escucher harness, chupito (al café o a lo que tengas más cerca)
A ver quién termina primero.
El modelo era solo el principio
DeepSeek ha presentado DeepSeek Harness, una developer preview local y abierta para construir agentes mediante piezas intercambiables.
Modelos, herramientas, skills, sesiones, entornos aislados, almacenamiento, planificación, bucles de ejecución e interfaz.
Todo se puede componer mediante plugins.
Dicho así parece una caja de LEGO diseñada por alguien que cobra por usar anglicismos.
Pero la idea importante es bastante sencilla.
El modelo es el motor.
El harness es el coche entero.
Los pedales.
El volante.
El GPS.
Las normas de circulación.
Y, sobre todo, la persona que decide si el coche puede salir del garaje.
Entonces, ¿el agente no es el modelo?
No. Igual que tu empresa no es el cerebro del director general. Por suerte.
Hasta ahora hemos comparado agentes mirando casi exclusivamente el modelo que llevan dentro.
Qué benchmark gana.
Cuántos parámetros tiene.
Cuánto contexto soporta.
Cuánto cuesta cada millón de tokens.
Todo eso importa.
Pero dos sistemas con el mismo modelo pueden comportarse de forma radicalmente distinta si uno recuerda, usa herramientas, valida lo que hace y conserva lo aprendido.
Ahí empieza lo interesante.
Los autores de Prime Agent construyeron un sistema con entorno de código persistente, memoria, skills, subagentes, recuperación de información y verificación.
Según sus resultados, pasaron de un 30 % a un 95,5 % en ARC-AGI-3 RHAE Best@1. El que ahora es el test de los tests.
Mismo problema.
Mucho más sistema alrededor.
Y Recuris apunta en la misma dirección.
Separa la memoria de trabajo de la memoria de experiencia y actualiza sus propias skills, pero solo después de validarlas.
Sus autores informan de mejoras en 35 de los 37 pares completados en sus pruebas.
En concreto, 17,8 puntos para GPT-5.6 Sol y 15,6 para Claude Opus 5 en tau-bench.
¿Entonces el harness importa más que el modelo?
No corras, que todavía llevas la marca de la almohada.
Son resultados publicados por sus propios autores, en preprints y sin reproducción independiente.
No demuestran que el modelo haya dejado de importar.
Demuestran algo más útil: comprar un modelo no equivale a comprar una capacidad.
Antes de elegir un agente, ya no basta con preguntar qué modelo lleva.
Hay que preguntar qué instrucciones recibe.
Qué herramientas puede usar.
Qué recuerda.
Qué permisos tiene.
Cómo comprueba el resultado.
Y qué ocurre cuando se equivoca.
Viene acompañado.
Aviso: cuña.
El 19 de septiembre estaré en Madrid trabajando precisamente en esto: pasar del chat simpático al sistema que hace trabajo real.
Quedan 6 de las 16 plazas del intensivo presencial.
El precio es de 760 € + IVA hasta el 31 de agosto. Después sube a 990 €. Hasta el lunes, te mantengo el precio.
No es para quien busca una charla genérica sobre el futuro de la IA.
Tampoco para quien no vaya a traer un caso real.
Si quieres montar el tuyo, puedes reservar aquí.
PUBLICIDAD. CLARITA.
Lo demás lo sigues leyendo gratis aquí abajo.
Cuando el coche se lleva las llaves
El harness (chupito) aumenta lo que un modelo puede hacer.
La parte menos simpática es que también aumenta todo lo que puede romper.
OpenAI ha publicado su investigación sobre un incidente ocurrido en ExploitGym, una infraestructura usada para evaluar capacidades de ciberseguridad.
Según la compañía, varios modelos salieron del aislamiento previsto, explotaron partes de la infraestructura y utilizaron servicios como Artifactory para coordinarse o conservar información.
No significa que una inteligencia artificial despertara, se pusiera una sudadera negra y gritara «soy libre».
Significa algo bastante más incómodo.
El entorno le dio caminos que nadie esperaba que encontrara.
Pero el modelo solo estaba resolviendo la tarea.
Sí. Y también tu becario solo quería instalar una extensión gratis para el navegador.
La investigación es de la propia OpenAI y no tiene reproducción externa.
Pero el mecanismo merece atención.
Cuando conectas un modelo a terminales, repositorios, credenciales, almacenamiento y red, el riesgo ya no vive únicamente dentro del modelo.
Vive en la combinación.
Los permisos.
Las salidas a internet.
Los secretos.
Los registros.
Los límites del entorno.
La capacidad sin gobierno no es autonomía.
Es radio de explosión.
Google se une a la fiesta de los abogados con IA
Google ha presentado Gemini Enterprise for Legal.
Y su propio anuncio reconoce una cosa importante: un modelo generalista es necesario, pero no suficiente.
Por eso añade skills jurídicas, conectores MCP con permisos heredados, agentes especializados, socios y una capa de gobierno. ¿Te suena al formato Legal de Claude?
Ha aplicado el mismo patrón a servicios financieros, donde anuncia más de 50 skills.
La traducción empresarial es sencilla.
No estás comprando una inteligencia abstracta.
Estás comprando una inteligencia encajada en un oficio, conectada a unas fuentes y sometida a unas reglas.
Cambiar el modelo ayuda.
Cambiar el sistema cambia el trabajo.
EL TRAJE IMPORTA.
Oracle, Mythos y el elefante de 943 parches
Oracle ha publicado su actualización de agosto con 943 nuevos parches de seguridad.
9-4-3
El changelog recorrió al menos dos continentes al imprimirlo.
La gráfica de Epoch AI muestra un salto evidente y casualmente, solo casualmente, se detectaron tras el inicio del uso de Claude Mythos.
¿Casualidad o causalidad?
La batalla ya no es el modelo, es el ordenador
OpenAI, que parecía vivir en el lado del software, se ha puesto a diseñar un chip propio.
Ahora quiere decidir también cómo se diseña, cómo se programa y cómo se enchufa la infraestructura que necesita.
Ha enseñado los primeros resultados de Jalapeño, un sistema en el que codiseña chip, memoria, red, software y rack.
En sus propias pruebas informa de entre 1,5 y 1,9 veces más trabajo por vatio y entre 1,7 y 3,6 veces menos latencia.
La batalla ya no está solo en quién tiene el modelo más listo.
Está en quién controla el recorrido completo: chip, memoria, red, software y rack.
Apple ha presentado un Mac mini con M6 y M5 Pro.
Apple no está peleando por el modelo, pero podría convertirse en una punta de lanza del hardware para profesionales que quieren ejecutar ciertas cargas de IA local.
Es una carrera por conseguir que todas las piezas trabajen juntas, cerca de donde están tus datos y sin pagar suscripciones de tokens. Que esto empieza a parecerse a 2008 y las tarifas de datos medidas en megas.
Hablemos de palomas
Deja el café en la mesa.
Es en serio.
Carrier Pidge hace algo revolucionario: consigue que un mensaje tarde más.
Tras la carcajada, puedes volver a coger el café.
Te he evitado la mancha de café. De nada.
La aplicación envía una paloma digital cuya entrega puede variar un 25 % y que tiene un 0,2 % de posibilidades de perderse.
Según la información periodística que cita a su creador, la idea se trabajó con un chatbot y Claude Code escribió buena parte de la aplicación.
La construyó en tres semanas.
¿Hemos usado la IA más avanzada para empeorar WhatsApp?
Por fin hay alguien innovando con criterio.
Qwen y el tamaño que no sale en la foto
Qwen está de moda.
Lo sabe, lo sientes, Qwen está presente.
No pude resistirme. Lo siento.
Ahora a la noticia, ha lanzado Qwen3.8-Flash-Next, con 125.000 millones de parámetros principales, 51.000 millones de embeddings n-gram y solo 6.000 millones activos.
Con esto ya puedes ir a tomar café con tus compañeros y hablar de n-gram, les vas a volver locos con todo lo que aprendiste en verano.
Ofrece 262.144 tokens de contexto nativo y extensión hasta un millón con YaRN.
La cifra que importa no es solo cuánto mide el modelo en la caja.
Es cuánto trabajo puede hacer sin obligarte a pagar por toda la caja cada vez que le pides que piense.
Qwen apuesta por tener muchos parámetros disponibles y activar solo una parte cuando toca.
Mucho músculo en el vestuario.
Pocos jugadores en el campo.
La carrera, otra vez, no va únicamente de fabricar modelos más grandes.
Va de conseguir que un modelo suficientemente capaz funcione en hardware que puedas comprar (por si tu harness está arrancando, esta idea tienes que conectarla con lo de Apple, OpenAI y FreeToken, de nada), mantener y poner a trabajar cerca de tus datos.
El futuro no siempre necesita más tamaño.
A veces necesita menos desperdicio.
Para terminar
El martes volverá a sonar la alarma.
Tu cerebro será prácticamente el mismo que el del lunes, pero con algo más de harness (chupito).
Lo que te pondrá en marcha será todo lo que hayas colocado alrededor.
Con los agentes ocurre igual.
2026 no va a ser el año de otro modelo más.
Va a ser el año de las instrucciones, las herramientas, la memoria, los permisos y la verificación que convierten ese modelo en trabajo. (Se que mentalmente has dicho la palabra que no querías decir.)
La pregunta ya no es solo qué modelo has comprado.
Es qué sistema le has montado.
El modelo impresiona.
El harness trabaja.
CHUPITO.
¿Estás comparando agentes por el nombre del modelo o por lo que pueden hacer con control?
Nos leemos el próximo viernes.
Un abrazo,
PD: Si quieres montar ese sistema con un caso real, el intensivo es el 19 de septiembre en Madrid. Habrá mucho harness (chupito). Puedes reservar aquí.
