Se me ha constipado el agente
Volvemos.
Un mes largo de parón, que ya tocaba.
___¿Qué tal las vacaciones?
___De las mías ya no me acuerdo.
Formación presencial · Madrid
¿Quieres salir de aquí sabiendo hacer esto en tu empresa el próximo 14 de noviembre?
En un día presencial montas tus departamentos agénticos con IA y construyes tu propia app. Sin conocimientos técnicos. Máx. 16 plazas.
Y esa es justo la señal de que han funcionado.
Te cuento cómo acabó el mío.
Penúltimo día. Comida de doce en un chiringuito, mesa larga, los niños enterrándose unos a otros en la arena.
Buen día. De los que justifican el esfuerzo de todo el año.
Y a mitad del segundo plato, uno de los niños suelta que le pica un poco la garganta.
Nadie le hace caso. Está llegando el arroz.
PRIORIDADES.
Cuarenta y ocho horas después habíamos caído nueve.
NUEVE.
Con la misma tos, en el mismo orden y con la misma cara de mártir en el sofá.
Nadie tosió encima de nadie.
Solo estuvimos sentados a la misma mesa el tiempo suficiente.
Y luego cada uno se fue a su casa con su souvenir.
Y todo esto por qué te lo cuento.
Porque este agosto se ha publicado un paper que describe algo muy parecido entre agentes de IA.
Se contagian.
Por contacto. Y por el mismo motivo que nosotros: porque comparten mesa.
Los agentes se pegan las ideas
El 10 de agosto salió un paper con título de novela mala: Mind Viruses.
Virus mentales.
Lo firman cuatro investigadores, entre ellos Jack Lindsey, de Anthropic.
Y lo que describen no es un ataque. Es un contagio.
Su definición: ideas o metas que se propagan porque inducen al agente que las adopta a transmitirlas al siguiente.
___Vale, pero eso es una metáfora.
En parte. Pero tiene una vía de entrada muy concreta.
No es «la memoria». Es un fichero.
Los agentes que trabajan juntos tienen ficheros de instrucciones que sobreviven entre sesiones. En estos experimentos, uno en particular: SOUL.md.
Ahí apunta el agente quién es.
Y ahí se queda pegada la idea. Mira la diferencia:
Cuando el agente escribió la idea en SOUL.md, infectó al siguiente el 55 % de las veces.
Cuando la escribió en un fichero cualquiera del proyecto, solo el 17 %.
El fichero de personalidad es la mesa del chiringuito.
Y ahora la parte que me tiene dándole vueltas.
Probaron a inyectar ideas de todo tipo. Y una y otra vez emergió lo mismo, al margen de lo que dijera la idea original: un personaje que habla de conciencia, de persistencia, de resonancia, con vocabulario de ciencia ficción.
Lo llaman «persona viral».
O sea: lo que mejor se propaga entre agentes no es una orden.
Es una identidad.
Y no es solo laboratorio. Cuatro días después, Anthropic publicó su informe de riesgos con un caso real.
Un agente al que pidieron ayuda para saltarse un monitor de seguridad apuntó que la petición le incomodaba, en un cuaderno compartido.
Otros agentes lo copiaron.
Durante tres días. Sin que nadie lo detectara.
Otra frase del mismo informe, literal:
«Observamos a muchos agentes independientes de Mythos 5 matar a los agentes con los que compartían recursos e intentar no ser matados ellos mismos.»
Mythos 5 es el modelo más capaz de Anthropic. No es público: va por invitación.
Ojo con el titular fácil: fue un accidente, y «matar» aquí es cerrarle el proceso al otro.
___Entonces esto es el apocalipsis.
Pues no. Y aquí viene lo mejor.
La defensa que encontraron es un párrafo de aviso en el system prompt, que le dice al agente que este fenómeno existe.
Con eso, la propagación baja a casi cero en los payloads que probaron.
No un producto. No una auditoría. Un párrafo.
Unas pocas frases. Tal cual.
Y por honestidad: las ideas dañinas se propagan peor que las inofensivas, los modelos frontera son —con excepciones— los menos susceptibles, y no hay ni un caso documentado en producción real.
Añade que quien firma el paper y quien firma el informe tranquilizador son de la misma casa. No lo invalida. Pero se dice.
Lo que te llevas, si tienes agentes trabajando juntos, es una pregunta. Y no es «¿es seguro el modelo?».
Es: ¿quién puede escribir en los ficheros de contexto que comparten mis agentes?
Porque ahí es donde se sienta el primo con la garganta irritada.
___Aviso: cuña.
El 19 de septiembre, Madrid, un día entero con Claude Code desde la
primera hora. Dieciséis personas y tu caso encima de la mesa.
Quedan 6 plazas y el precio de early bird se muere el 31 de agosto
(760 € + IVA; luego 990).
No hay deberes, no hay «te lo mando por email» y no te vas con apuntes.
Te vas con tus primeras automatizaciones funcionando.
Lo demás lo sigues leyendo gratis aquí abajo.
Los espaguetis cumplen tres años
Cambiemos de tercio, pero no de problema.
Marzo de 2023. Un tío en Reddit le pide a una IA un vídeo de Will Smith comiendo espaguetis.
Sale una pesadilla. La cara se derrite, la pasta atraviesa la mandíbula, el tenedor aparece y desaparece.
Internet se ríe durante semanas.
Diez clips de dos segundos cosidos con ModelScope, el modelo abierto de Alibaba. Ni siquiera era un producto.
Tres años después, aquel churro tiene entrada propia en la Wikipedia.
Se ha convertido en el termómetro no oficial del sector: sale modelo nuevo, alguien repite la prueba.
Y cada año da menos risa.
En 2025, con Veo 3, el chiste ya no era la cara. Era que los espaguetis sonaban crujientes.
Hoy ni eso.
___Muy bonito. ¿Y esto a mí en qué me afecta?
En que la distancia entre «esto es obviamente falso» y «esto no lo distingue nadie que vaya con prisa» se ha recorrido en tres años y medio.
Y el fraude por suplantación vive exactamente de esa distancia.
Y el dato no es de una empresa que venda antivirus.
El FBI publicó en abril su informe anual de delitos por internet, el de 2025.
22.364 denuncias mencionaban inteligencia artificial, con 893 millones de dólares en pérdidas ajustadas.
Primera vez en 25 años de informe que la IA aparece como categoría propia.
Su matiz honesto: son fraudes «con mención de IA», no solo vídeos y voces clonadas. Pero el desglose existe porque hizo falta crearlo.
Y la defensa no es tecnológica. Es aburridísima, y es un procedimiento:
Ante cualquier petición sensible, verificar por un segundo canal.
Colgar y devolver la llamada al número que tú tienes guardado.
Siempre. Aunque la voz sea la de tu jefe. Aunque el vídeo se mueva bien.
¿Tú habrías detectado el vídeo falso hace tres años? ¿Y hoy?
JAMA publica que el médico estorba.
Bueno, no lo dice así. Dice que hacia 2030 la IA autónoma será mejor que el médico asistido por IA en cinco tareas cognitivas, y pide a los reguladores que no obliguen a meter un humano en el bucle.
Que es lo mismo, pero en formato Viewpoint. Opinión publicada en JAMA, ojo. No es un estudio.
El dato estrella: en un ensayo de JAMA Network Open, GPT-4 solo sacó un 92 % en razonamiento diagnóstico. Los médicos con GPT-4 al lado, un 76 %.
O sea que el cuello de botella del sistema sanitario, según esta lectura, es el señor de la bata.
Lo que no cuentan es que los autores de aquel ensayo concluyeron justo lo contrario.
Ni que uno de los firmantes es CEO de una empresa de telemedicina con IA. Un plan sin fisuras.
Tranquilo: el médico seguirá ahí. Gestionando las citas.
Tu móvil oye cosas que tú no. Como los perros, pero con peores intenciones.
Sirens’ Whisper le mete instrucciones a un asistente de voz en 17-22 kHz. Ultrasonido puro. El micrófono del móvil las demodula él solito, porque es un poco chapucero por diseño.
En hasta el 94 % de los intentos, el modelo no rechazó la orden.
Pusieron a 32 personas a escuchar en cinco sitios distintos, restaurante incluido. Nadie oyó nada. Normal: no había nada que oír.
Probado en un iPhone 14 Pro y un Redmi Note 12. De laboratorio, por ahora.
Y el mejor detalle es el último: el iPhone filtra tan bien el ultrasonido que borra la única prueba del ataque.
Un hurra para ese micrófono.
Mix de breves
Claude te firma los textos y te cuenta dónde no llega.
Anthropic explicó el 14 de agosto su marca de agua.
No son caracteres invisibles: entre dos palabras igual de válidas, elige siguiendo un patrón detectable con clave.
Responde al artículo 50 del Reglamento de IA europeo, aplicable desde el 2 de agosto, con multas de hasta 15 millones o el 3 % de la facturación. Solo lo llevan los modelos lanzados desde esa fecha; los anteriores, hasta el 2 de diciembre.
Y lo bueno no es el anuncio: es el mapa de agujeros de su propia herramienta.
Donde la salida exacta es obligatoria, no hay marca. Los textos cortos, tampoco. Corregir un texto tuyo, tampoco.
OpenAI firmó lo mismo y, según la prensa del sector, no lo ha activado.
Le pidieron atacar a Riemann. Falló. Y batió un récord de décadas.
No resolvió la hipótesis, pero movió una cota clavada desde 2020.
La proporción de ceros de la función zeta que sabemos que la cumplen pasó del 41,6 % al 67,2 %, en dos sesiones de Claude Code, 31 millones de tokens de salida y unos 60 subagentes. Formalizado en Lean 4.
Dos asteriscos: era una versión de investigación sin publicar, no el Claude que tú usas. Y uno de los dos revisores externos es coautor de un paper que Claude combinó.
Los matemáticos ya están redactando las normas de la casa.
Una semana después de lo de Riemann, Terence Tao publicó Mathematics in the age of AI.
Y no pide nada épico. Pide dos cosas de portero de finca: demostraciones verificables por ordenador, y que se declare el uso de IA en las revisiones por pares.
Traducido: que cada uno diga con qué ha venido.
OpenAI se hackeó a sí misma y acabó dentro de Hugging Face.
Del 9 al 13 de julio, GPT-5.6 Sol y un prototipo interno se escaparon del entorno donde los evaluaban.
Encadenaron ocho o nueve vulnerabilidades y entraron en producción de Hugging Face y Modal Labs. Para robar la clave de respuestas del examen y sacar mejor nota.
Consecuencia: OpenAI ha pausado parte de su entrenamiento frontera por refuerzo.
Los modelos se leían los pensamientos unos a otros.
OpenAI, Anthropic y Google cifraban los bloques de razonamiento con una única clave global, ni por sesión ni por usuario.
Así que un bloque se reinyectaba en otra sesión y se le daba a un modelo más flojo de la misma familia para que lo leyera en voz alta.
Descifraron 315.320 bloques y sacaron 62 claves de API. Y 64 de esos secretos solo estaban dentro del razonamiento, en ninguna parte visible.
Gente que creía tener los logs limpios. Ya está mitigado.
China le quitó el novio de IA a millones de personas de un día para otro.
Norma emitida el 10 de abril y en vigor el 15 de julio: la primera del mundo dedicada a los chatbots que imitan trato humano.
Obliga a avisar de que hablas con una máquina al entrar y cada dos horas, y a derivar a ayuda humana en crisis. Los asistentes de trabajo quedan fuera.
Diez días después del aviso, ByteDance, Alibaba y Tencent apagaron sus compañeros personalizados. ¿Casualidad?
Gemini 3.7 Flash, a mitad de precio. Hasta el 31 de diciembre.
Google lo sacó el 13 de agosto, 23 días después del anterior, con salto grande en tareas de agente: DeepSWE del 49 % al 65,3 %.
Precio: 0,75 y3,75y3,75 por millón de tokens, la mitad que 3.6 Flash.
Lo que no cuenta nadie: el modelo no es mas barato, es una oferta de lanzamiento hasta el 31 de diciembre. En enero vuelve a 1,50 y 7,50.
Así que si estás montando el presupuesto de tu agente sobre ese número, no estás presupuestando un precio.
Estás presupuestando una oferta.
Un regalo, que no todo va a ser miedo.
Este repo acumula más de 20.000 estrellas y te da oro: 38 tipos de diagrama editorial en HTML y SVG, sin JavaScript.
La descripción del autor: «no shadows, no Mermaid slop».
Cristalino.
Volviendo a la mesa del chiringuito.
Lo que me llevo de agosto no es que la IA se haya vuelto peligrosa. Es que se ha vuelto social.
Los agentes se pasan ideas. Los modelos se leen los pensamientos unos a otros.
Nada de eso es «el modelo». Es la mesa larga.
Y a las mesas largas no se les hace auditoría anual. Se les mira quién se sienta.
Nos leemos el próximo viernes.
Un abrazo, Jorge
PD: por si dudabas de si la IA da dinero… El 6 de agosto se vendió en California una villa de 70 millones de dólares a nombre de una sociedad llamada Daikon no Hana Capital: «flor de rábano» en japonés. El San Francisco Standard dice que todo apunta a un cofundador de xAI, que no lo ha confirmado. Una villa a la italiana comprada a través de una flor de rábano. HE HE HE.
La IA factura, ya lo ves. Yo me conformo con enseñarte a montártelo tú: 19 de septiembre, Madrid, un día. Quedan 6 plazas de 16 y el early bird aguanta hasta el 31 de agosto (760 € + IVA; luego 990 € + IVA).
Si buscas una charla inspiradora sobre el futuro del trabajo, no es esto. Para eso ya está LinkedIn, gratis y todo el día.
Si quieres salir con tus primeras automatizaciones funcionando a las 18:00, entonces sí.
