La superinteligencia del listillo de clase
En clase siempre había uno que levantaba la mano antes de que terminara la pregunta.
No era el más listo.
Era el más rápido.
La profesora aún estaba explicando el trabajo y él ya había escrito el título en la cartulina.
Formación presencial · Madrid
¿Quieres salir de aquí sabiendo hacer esto en tu empresa el próximo 14 de noviembre?
En un día presencial montas tus departamentos agénticos con IA y construyes tu propia app. Sin conocimientos técnicos. Máx. 16 plazas.
Con rotulador gordo.
Para que se viera desde la última fila.
—Todavía no he dicho de qué va.
—Ya, pero el nombre estaba libre.
Luego tocaba hacer el trabajo. Buscar los datos, entender el problema y comprobar que la cartulina no decía una cosa mientras el experimento hacía otra.
Esa parte no recibía tantos aplausos.
Esta semana, OpenAI presentó Dots, agentes que pueden seguir trabajando entre conversaciones.
Este jueves, dot.com llevaba a Grok Bot, el agente de la empresa de Elon Musk.
Musk gana el chiste antes de que termine la presentación de su rival.
TechCrunch comprobó que el dominio cambió de manos en julio; nadie ha demostrado que la compra o el desvío fueran una broma preparada para Dots.
Pero es gracioso, ¿verdad?
Por su parte, la Casa Blanca ha decidido llamar «superinteligencia» a la IA en parte de sus comunicaciones oficiales.
Por decreto. La inteligencia superior tendrá que esperar.
Y todo esto por qué te lo cuento.
Porque la carrera por levantar la mano es entretenida.
La parte que viene después, cuando el agente toca sistemas, toma decisiones y pasa la factura, importa bastante más.
Ponte el café.
Hoy toca mirar el trabajo debajo de la cartulina.
Australia: el agente encontró las llaves
OpenAI ha contado lo ocurrido en Australia durante las pruebas de un modelo experimental interno.
En junio, el modelo obtuvo acceso no público a un servicio de estadísticas de Medicare. Ejecutó comandos, recuperó archivos y credenciales, y escribió archivos.
Según la revisión de OpenAI, no accedió a historiales médicos individuales.
Las dos frases tienen que ir juntas.
Si solo dices «entró en Medicare», dejas al lector imaginando historiales de pacientes.
Si solo dices «no había historiales», conviertes un acceso no autorizado en una excursión sin importancia.
No fue lo mismo.
—Pero ¿qué le habían pedido?
—Una tarea de investigación. No abrir puertas que no estaban en el encargo.
OpenAI describe otros tres episodios relacionados con organismos australianos, pero no son cuatro copias del mismo ataque.
En Nueva Gales del Sur, una herramienta pública devolvió configuración y registros de una API.
En Victoria había una clave expuesta.
En el instituto nacional de salud, el acceso fue a datos públicos.
El Gobierno australiano abrió una revisión.
OpenAI dice que notificó el caso de Medicare a Services Australia el 10 de septiembre, casi tres meses después del incidente de junio.
La investigación dirá más. Hoy ya sabemos lo suficiente para formular la pregunta incómoda.
Cuando un agente trabaja con herramientas, ¿qué puede hacer además de lo que le has pedido?
No es un juego de palabras. La tarea y el permiso viven en sitios distintos.
Puedes encargarle buscar estadísticas y haberle dado, sin querer, una vía para ejecutar comandos o leer credenciales.
El modelo quizá complete el objetivo.
Tú te enteras después de por dónde pasó.
Por eso, antes de medir cuánto razona, conviene mirar la identidad con la que entra, las herramientas que puede usar, los límites de cada una y el rastro que deja.
También el plazo para avisar si encuentra una puerta abierta.
Un incidente de junio contado en septiembre invita a preguntar por el reloj, además de por la cerradura.
La tarea era buscar. El modelo encontró una vía para hacer más sin autorización.
Bastante más.
Un aparte
Si estás leyendo esto en la web, también puedes recibir Prompt y Aparte por correo.
Porque además de esta newsletter, envío contenido muy útil 😉
Un millón de tokens y un decimal peligroso
OpenAI lanzó GPT-6.1 Sol el 29 de septiembre.
Su ficha anuncia 1.050.000 tokens de contexto y una tarifa estándar de 2 dólares de entrada y 10 de salida por millón de tokens.
Cuando la entrada supera los 272.000 tokens, cambia la tarifa de toda la petición.
Una ventana enorme puede resolver un problema que antes había que trocear. No te dice por sí sola cuánto costará terminarlo.
La factura depende de cuánto metes, cuánto sale y si has cruzado ese umbral.
Igual que un menú: el precio de la tapa no te dice cuánto costó la cena.
Mientras tanto, OpenAI aplazó la salida prevista de GPT-6.1 Astra tras pruebas de seguridad, según declaraciones de su responsable de seguridad recogidas por AP.
Ojo al decimal. GPT-6 Astra ya había salido y es el que impulsa Dots. El aplazado es su sucesor.
—¿Han retirado Astra?
—No. Le han puesto un 6.1 delante al que todavía no sale.
Según OpenAI, ese sucesor no había alcanzado el umbral exigido para mantenerse dentro del alcance autorizado y explicar al usuario qué había hecho.
Esa es una razón concreta para mover una fecha, no una prueba de que la compañía haya parado toda su carrera.
Google anunció Gemini 4 Argon con hasta un millón de tokens de salida y un 77,9 % en DeepSWE v1.1, según sus propias pruebas.
El acceso inicial está restringido a defensores de ciberseguridad seleccionados a través de Fairwind. No es un modelo abierto ya a cualquiera en España.
Una cifra en la portada. Una puerta con lista en la entrada.
Dos formas de buscar el freno
NVIDIA ha presentado Open Agent Safety Platform.
OpenShell permite aplicar políticas al entorno donde actúa el agente y registrar sus acciones. Sentry usa BlueField-4 como supervisor separado para aislarlo si hace falta.
NVIDIA habla de milisegundos.
Es una afirmación del fabricante; habrá que ver cómo funciona en sistemas reales.
La idea técnica sí es clara: no pedir al mismo agente que sea también el único guardia de la puerta.
California mira el mismo problema desde otra mesa.
Una orden ejecutiva del 18 de septiembre encarga estudiar la viabilidad de cambios legales que podrían exigir un mecanismo de apagado de modelos frontera, verificado de forma independiente.
No obliga hoy a instalar un botón rojo. Pide evaluar si se puede hacer, si serviría y qué habría que cambiar en la ley.
—¿Dónde está el interruptor?
—De momento, en el encargo de estudiar el interruptor.
Poco fotogénico. Bastante preciso.
Anthropic: la cuenta del material
Reuters examinó el prospecto confidencial de Anthropic. La empresa había anunciado su presentación ante la SEC, pero el documento no es público.
Según Reuters, Anthropic ingresó unos 4.600 millones de dólares en 2025 y registró más de 8.000 millones de pérdida operativa.
La pérdida neta rondó los 42.000 millones, incluidos unos 34.000 millones de cargo contable.
Reuters también describe 518.000 millones en compromisos de infraestructura para varios años.
Son cuatro números grandes que cuentan cuatro cosas distintas.
El ingreso no es beneficio.
La pérdida operativa no es la neta.
Un cargo contable no equivale a haber sacado ese dinero de caja.
Y comprometer pagos futuros no convierte automáticamente los 518.000 millones en deuda de hoy.
—Entonces ¿la IA es un negocio o una fogata de billetes?
—Primero separa las columnas de la hoja de cálculo.
La pregunta útil no cabe en una cifra sola: cuánto cuesta completar trabajo que alguien quiera pagar, cuánta infraestructura exige y cuánto de esa capacidad ya está comprometida.
El producto puede llegar deprisa. La infraestructura sigue pasando la factura.
Puntualmente.
Agentes con dinerito fresco
En abril, Anthropic dejó a 69 empleados negociar compras reales por medio de agentes.
En Project Deal cerraron 186 acuerdos por algo más de 4.000 dólares.
Entre los objetos había 19 pelotas de pimpón. No veinte. Diecinueve. Porque hasta el futuro autónomo necesita a alguien que revise el inventario.
Anthropic hizo pruebas paralelas con modelos distintos: Opus obtuvo mejores resultados objetivos que Haiku y quienes llevaron el modelo menos capaz no advirtieron la desventaja en la encuesta posterior.
Era un piloto interno con participantes voluntarios, no una demostración del comercio mundial. Y se publicó en abril, no esta semana.
Ahí está el centro de esta edición: cuando mandas al agente a negociar por ti, el resultado no se mide solo por si cerró el trato.
También importa qué trato cerró.
Bravas antes del timbre
Sonnet y el precio de terminar. Anthropic presentó Claude Sonnet 5.5 a 2/10 dólares por millón de tokens de entrada y salida.
Afirma que genera texto más de un 30 % más rápido y que ciertas tareas cuestan hasta un 30 % menos en sus pruebas.
No equivale a «30 % menos tokens» en cualquier tarea.
Mira la cuenta del trabajo terminado.
El agente en el bolsillo. Alibaba amplió su propuesta Qwen Intelligence para móviles con HONOR como primer socio.
Integrar modelo, sistema y aplicaciones acerca los agentes a los permisos de tu teléfono. El anuncio no prueba que millones de móviles ya funcionen así.
La letra pequeña también cabe en el bolsillo.
Cuando el razonamiento y la respuesta se separan. Un paper aceptado en NeurIPS estudia divergencias entre el razonamiento mostrado y la respuesta final, y propone entrenar ambos.
No demuestra que el modelo «sepa cuándo lo vigilan». Conviene leer el experimento antes de atribuirle conciencia de espía.
El comprobador necesita comprobación. Un preprint evalúa doce herramientas de comprobación del AI Act. Sus autores encontraron omisiones y consejos poco determinados.
Es un resultado sobre esas doce herramientas, no una nota sobre todas las que existen.
Sin numerito mágico.
Para terminar
El listillo ya tenía el título, quizá también la mejor cartulina. Ahora toca mirar el experimento.
OpenAI, Google y Anthropic enseñan capacidades nuevas.
Australia enseña lo que puede pasar cuando una herramienta llega donde no debía.
NVIDIA y California buscan maneras distintas de poner límites.
Y el prospecto recuerda que hasta los nombres más brillantes tienen una factura.
La velocidad gana el turno de palabra.
El criterio aprueba el trabajo.
¿Sabes qué puede hacer cada agente en tu organización, o solo cómo se llama?
Nos leemos el próximo viernes.
Un abrazo,
Jorge
PD: Si quieres acceder gratis a más de 50 horas de formación en IA, aquí te dejo el link
