Hemos sido engañaos

Hemos sido engañaos

En la reunión de vecinos ya está decidido: vamos a poner ascensor.

El vecino del quinto casi aplaude. Lleva años subiendo las bolsas por la escalera.

El administrador llama a la empresa. Podrían empezar el lunes.

Entonces una vecina levanta la mano.

Formación presencial · Madrid

¿Quieres salir de aquí sabiendo hacer esto en tu empresa el próximo 14 de noviembre?

En un día presencial montas tus departamentos agénticos con IA y construyes tu propia app. Sin conocimientos técnicos. Máx. 16 plazas.

Ver el curso → 990€ + IVA

—Un momento. Antes tiene que venir alguien de fuera a revisar el hueco.

—¿Otra vez se paraliza el ascensor?

—No. Quiero saber si podemos abrir esa pared sin llevarnos media casa.

El administrador apunta: «Se frena el proyecto».

A los dos minutos, el grupo de WhatsApp ya anuncia que no habrá ascensor.

—Nos han engañado.

—Habéis leído media frase.

Cuarenta y tres mensajes después, alguien pregunta si el técnico puede venir el jueves.

Puede.

El ascensor sigue en marcha. La inspección también.

Una cosa es impedir la obra. Otra, dejar entrar a quien puede decirte si la obra es segura.

¿Y esto por qué te lo cuento?

Porque esta semana hay dos historias que invitan al mismo grito.

«Hemos sido engañaos».

En una, hemos leído media frase. En la otra, había alguien al teléfono.

Y las dos merecen algo más que un meme.

Ponte el café.

El auditor también quiere entrar

Dario Amodei, CEO de Anthropic, propuso acompasar la carrera de la IA avanzada.

El 21 de septiembre, xAI anunció Grok 4.7.

El 22, Anthropic presentó Opus 5.5. OpenAI añadió GPT-6 Sol y Luna a su catálogo para desarrolladores.

—¿Habéis entendido que querían dejar de sacar modelos?

—Pues no. Leamos la propuesta.

Amodei sí pide ralentizar el aumento de capacidades si la seguridad no puede seguirlo.

Pero aclara algo importante: acompasar no significa parar el entrenamiento ni el progreso técnico.

Su primer paso es más concreto que el eslogan.

Quiere evaluadores externos dentro de los laboratorios. Con acceso continuo, parecido al de un empleado.

Que puedan mirar entrenamientos, pruebas e incidentes. Y publicar conclusiones sin que la empresa las retoque a su gusto.

Hay excepciones justificadas por seguridad, privacidad y secretos protegidos.

Anthropic dice que asume ese primer paso.

¿Y Opus 5.5?

La empresa afirma que lo evaluaron antes de salir equipos externos, entre ellos METR y Frontier Design.

Eso cuenta. Y cambia la lectura del lanzamiento.

No es «pedimos parar y publicamos a escondidas».

Es «pedimos mejores controles y publicamos un modelo que pasó por evaluación externa», según Anthropic.

Hay una diferencia que no conviene borrar: esa evaluación previa no demuestra aún que exista el acceso permanente al entrenamiento que Amodei acaba de proponer.

Tampoco hace falta inventar hipocresía para pedir cuentas.

La pregunta útil es qué pudieron ver esos evaluadores. Qué pudieron contar. Y qué hallazgo habría cambiado la fecha de salida.

A mi no me han respondido. No se si a ti.

El vecino del quinto no necesita otro cartel de «obra segura».

Necesita que el técnico entre, mire la pared y pueda decir lo que encontró.

Primer «engaño»: confundimos acompasar con dejar de publicar.

Que entre el técnico. Luego hablamos del cartel.

La cuña

El sábado 19 de septiembre di una formación de un día sobre cómo demonios usar agentes de IA.

Una de las alumnas escribió después en LinkedIn:

> «Entré pensando que era imposible que yo pudiera crear una red de agentes. Salí viendo un sinfín de oportunidades».

Y lo mejor, no fueron oportunidades, salió con agentes IA creados por ella misma.

La próxima jornada será el 14 de noviembre en Madrid. De 09:00 a 18:00. Máximo 16 personas.

Aún hay plazas.

Lo demás lo sigues leyendo gratis aquí abajo.

Meta: la IA llama, alguien habla

¿Os acordáis de cuando Meta presentó Muse como agente personal?

Entre sus funciones probadas, hacer llamadas para resolver gestiones.

WOW

404 Media y Reuters contaron lo que había detrás de algunas llamadas en una prueba interna: contratistas humanos.

Espera, espera, ¿eran personas llamando a personas?

Meta pausó ese desvío a personas durante la prueba interna.

—Mi agente ya llama por mí.

—Estupendo. ¿Quién habla?

Que intervenga una persona puede ser buena idea.

Lo que no funciona es vender autonomía y esconder al humano dentro de la métrica.

«Hemos sido engañados» (Segunda vez esta semana)

Una reserva completada no nos dice si la hizo Muse o alguien al teléfono.

Antes de contratar un agente, pide la película entera.

¿Cuántas tareas resolvió solo? ¿Cuántas pasaron a una persona? ¿Cuánto tardó y costó cada relevo?

La prueba era interna. No sabemos que ocurriera con usuarios públicos.

El caso ya tiene bastante gracia sin inventarle una centralita mundial.

Aquí el problema cambia de dueño.

No interpretamos mal «acompasar». Algunas llamadas de una prueba interna acabaron en manos humanas.

Meta anunció el agente. Ahora falta saber quién hizo cada llamada.

Paris Hilton y las cien personas de la IA

TIME incluyó a Paris Hilton en su TIME100 AI.

El motivo: su defensa de las víctimas de imágenes íntimas falsas creadas con IA.

La broma fácil se cae al leer la ficha.

Influir en esta tecnología también es obligar a mirar sus daños.

Pero «las cien personas de la IA» suena a clasificación deportiva. Y cada lista juega con reglas distintas.

TIME elige a quienes representan las historias del año.

Florin Armasu Popu, de Data Innovation, publicó otra lista.

Su pregunta es distinta: ¿qué cambiaría en la IA si faltara cada persona?

Sitúa a Demis Hassabis primero. Separa a defensores y divulgadores.

Florin fijó el criterio y editó el trabajo de un agente Claude. También publicó un registro de revisión con modelos de doce casas.

Lo llama opinión editorial.

—Entonces, ¿cuál es la lista buena?

—La que te diga qué está midiendo.

Pasar una opinión por doce modelos sigue dejando una opinión.

Eso sí: mejor acompañada.

Jev: cambia el menú, cambia la decisión

La semana pasada hablamos de Jev.

Decide entre opciones definidas. No puede salirse del menú.

Bla bla bla.

Eso evita respuestas fuera de formato.

Bla bla bla.

No evita elegir mal.

Bla bla bla.

Pero aquí viene lo interesante, para mi, claro.

Una auditoría abierta de Kunko AI Labs le pidió decidir qué tareas enviar a un modelo más potente.

Con etiquetas escuetas, derivó 0 de 40 tareas difíciles.

Al describir las opciones, derivó 37 de 40.

Mismo modelo.

Otro resultado.

Escribir mejor en esta prueba cambió 0/40 por 37/40.

Al final si que hay que hablar bien a Jev, aunque el responda con un «Si, No».

Bravas para repartir contradicciones

España quiere gigafactoría. Y más requisitos para centros de datos.

El Plan IA360 quiere ampliar la capacidad. El Gobierno también tramita nuevas exigencias para esa infraestructura. O amplías, o limitas, hacer ambas…

El real decreto ley vigente ordena desarrollar requisitos. El detalle adicional sigue siendo un proyecto. No se han cerrado centros por ese texto.

Mi posición es sencilla: menos regular y más facilitar.

Los modelos no se entrenan con ruedas de prensa.

Jensen pregunta por las leyes que ya existen.

En CBS, Jensen Huang defendió aplicar las normas vigentes a daños reales antes de añadir otras.

Se puede discrepar de él. Pero primero dime qué norma actual no estamos aplicando.

Papel hay.

Cuatro laboratorios, una invitación.

Un comité británico invitó a Meta, Google, OpenAI y Anthropic a comparecer. Plantea posibles preguntas sobre seguridad y pruebas.

Es una invitación, no una ley.

Ahora toca explicar el freno sin las diapositivas de lanzamiento.

Para terminar

Volvamos a la junta.

El ascensor no se canceló. Entró alguien a revisar la pared.

Esa distinción cambia la lectura de la noticia principal.

Acompasar la IA no significa guardar los modelos en un armario.

Significa que los controles tengan tiempo y acceso para hacer su trabajo.

Con Opus 5.5 hubo evaluación externa previa, según Anthropic. El acceso continuo prometido es otro paso. Habrá que comprobarlo.

El mismo grito sirve para las dos noticias. La causa no es la misma.

Con Claude, el titular nos llevó demasiado lejos. Con Muse, la etiqueta de agente no contaba toda la prueba.

La misma pregunta recorre el resto de la edición.

¿Quién hizo la llamada de Muse? ¿Qué mide cada lista? ¿Quién escribió las opciones de Jev?

Menos titulares que lo explican todo.

Más puertas abiertas a quien puede comprobarlo.

Nos leemos la semana que viene.

Un abrazo,

Jorge

PD: Hoy no hay PD, que «hemos sido engañaos».

Publicaciones Similares