Cómo medir un modelo de IA para tu empresa (sin ser técnico)
Si buscas cómo evaluar un modelo de IA para tu empresa, lo primero que encuentras son comparativas llenas de gráficos, siglas y porcentajes. GPT-4o saca un 87,3 en algo llamado MMLU. Claude gana en «reasoning». Gemini lidera en «multimodal». Cierras la pestaña con más confusión que cuando la abriste.
Te entiendo. Esos rankings no miden lo que a ti te importa. Miden lo que le importa a los investigadores que diseñaron esos tests. Tu negocio no es un test académico.
La buena noticia: hay una forma sencilla de saber qué modelo te sirve a ti. Y no necesitas saber programar para montarla.
—
Formación presencial · Madrid
¿Quieres salir de aquí sabiendo hacer esto en tu empresa el próximo 14 de noviembre?
En un día presencial montas tus departamentos agénticos con IA y construyes tu propia app. Sin conocimientos técnicos. Máx. 16 plazas.
Por qué los benchmarks públicos no te sirven para evaluar un modelo de IA
Un benchmark es una prueba estándar. Traduce problemas complejos en preguntas con respuesta correcta conocida, los pasa por distintos modelos y puntúa. Es útil para comparar modelos entre sí en condiciones controladas.
El problema es la palabra «estándar». Tests como MMLU —que mide conocimiento general en 57 materias— o las arenas de comparación tipo LMArena, donde usuarios votan cuál de dos modelos responde mejor, son referencias reales y útiles para los investigadores que los diseñaron. Pero están concebidos para ser universales, no para tu sector ni para tus procesos. Un modelo que saca 90 en un benchmark de razonamiento matemático puede ser un desastre resumiendo tus informes comerciales. Uno que aparece en tercera posición en la tabla general puede ser exactamente lo que necesitas para revisar contratos con el lenguaje que usan tus proveedores.
Además, los rankings cambian cada pocas semanas. En el tiempo que lees esto, probablemente hay un modelo nuevo que ha «batido todos los récords». Seguir esa carrera es agotador y, para tomar una decisión práctica, irrelevante.
Lo que de verdad necesitas es saber cómo se comporta cada modelo con tus casos concretos. Y eso solo lo puedes medir tú.
—
El concepto que lo cambia todo: el golden set
En mi experiencia evaluando herramientas de IA para proyectos reales, el primer paso siempre es el mismo: construir lo que se llama un golden set.
Un golden set es una colección de entre 10 y 20 casos reales de tu empresa, cada uno con la respuesta correcta ya escrita por alguien con criterio. Es tu prueba de referencia: no la del investigador que diseñó el benchmark, sino la tuya. Cuando un modelo supera tu golden set, ya sabes que puede resolver lo que necesitas. Cuando falla en él, ya sabes que no te sirve, aunque encabece todos los rankings públicos. No inventas nada. Sacas ejemplos de lo que ya pasa en tu día a día.
Si quieres evaluar un modelo para atención a clientes, coges 15 consultas reales que recibiste el mes pasado y escribes cómo deberían haberse respondido. Si es para revisar contratos, coges 10 cláusulas reales y anotas qué riesgos debe detectar. Si es para resumir informes, coges 12 informes y escribes el resumen que tú darías en una reunión.
Ese conjunto de casos es tu vara de medir. No la de Google. La tuya.
—
Los cuatro criterios que importan
Antes de hacer la prueba, decide por qué vas a puntuar. En mi experiencia, hay cuatro criterios que cubren casi cualquier caso empresarial:
Acierto. ¿El modelo da la respuesta correcta o útil? ¿Detecta lo que debe detectar? ¿Comete errores que un humano con experiencia no cometería? Es el criterio más importante, pero no el único.
Coste. Los modelos cobran por cantidad de texto procesado. Un modelo excelente que cueste diez veces más puede ser descartable si el volumen de tu uso es alto. Comprueba el precio por millón de tokens de cada candidato antes de hacer la prueba.
Velocidad. Para algunos usos no importa mucho. Para otros, importa todo. Si un proceso necesita respuesta en segundos (un chatbot de atención al cliente, un análisis en tiempo de negociación), un modelo que tarda 30 segundos en responder no sirve aunque acierte el 100%.
Privacidad de los datos. Cuando pasas información por un modelo externo, esa información sale de tu empresa. Necesitas saber si el proveedor usa tus datos para entrenamiento, si hay opción de contrato con garantías, y si los datos son suficientemente sensibles como para que eso sea un problema legal o de confianza. Para muchos sectores —salud, finanzas, legal— este criterio puede descartar opciones de entrada.
—
Cómo montar tu propia evaluación de modelos de IA en una tarde
No necesitas herramientas especiales. Con acceso a los chats web de los modelos que quieres comparar es suficiente para empezar.
Paso 1: Reúne tus casos reales. Dedica 30-45 minutos a seleccionar entre 10 y 20 ejemplos de tu golden set. Escríbelos en un documento con la respuesta correcta al lado. Cuanto más específicos y representativos, mejor.
Paso 2: Elige 2 o 3 modelos candidatos. No necesitas comparar diez. Con dos o tres modelos razonablemente distintos tienes suficiente para tomar una decisión informada. Por ejemplo: uno conocido y consolidado, otro más económico y uno especializado en tu idioma o sector si existe.
Paso 3: Pasa cada caso por cada modelo. Usa el mismo prompt en todos. Copia la respuesta en tu documento. Tarda lo que tarda, que no es mucho.
Paso 4: Puntúa. Para cada caso y cada modelo, puntúa del 1 al 3 en los criterios que hayas elegido como relevantes para tu uso. No busques precisión matemática: busca un orden claro. ¿Qué modelo resuelve mejor lo que necesitas, a un precio razonable, con la velocidad suficiente y sin comprometer datos que no debes comprometer?
Paso 5: Elige. El modelo que gana en tu golden set es el modelo que debes usar. No el que encabeza el ranking de la semana.
—
Una plantilla sencilla para puntuar los modelos
No hace falta nada sofisticado. Una hoja de cálculo con esta estructura es suficiente para evaluar un modelo de IA con tus propios criterios:
| Caso | Respuesta correcta (golden) | Modelo A — acierto (1-3) | Modelo B — acierto (1-3) | Modelo C — acierto (1-3) | |——|—————————–|————————–|————————–|————————–| | Consulta cliente 1 | «Debe ofrecer devolución y disculparse…» | 3 | 2 | 1 | | Cláusula contrato 2 | «Riesgo: penalización automática en…» | 2 | 3 | 2 | | Informe ventas 3 | «Resumen ejecutivo en 3 líneas…» | 3 | 3 | 2 | | … | … | … | … | … | | Total acierto | | 8 | 8 | 5 | | Coste por 1M tokens | | 3€ | 15€ | 1€ | | Velocidad aceptable | | Sí | Sí | No | | Privacidad OK | | Sí | Sí | Sí |
En este ejemplo hipotético, el Modelo A y el B empatan en acierto, pero el A cuesta cinco veces menos. La decisión se toma sola.
Lo que me ha funcionado: rellenar la columna «respuesta correcta» antes de pasar los casos por los modelos. Si lo haces después, inconscientemente adaptas lo que consideras correcto al mejor resultado que ya has visto. El golden set pierde su valor.
—
Lo que no te dice la prueba
La prueba que acabo de describir te dice cuál modelo se ajusta mejor a tu caso de uso hoy. No te dice cómo va a evolucionar, qué integraciones técnicas necesitas para usarlo en producción, ni si el proveedor va a cambiar los precios el próximo trimestre.
Para todo eso hay otras consideraciones. Pero para la pregunta de partida —¿este modelo es bueno para mi empresa?— la prueba con casos reales te da una respuesta mucho más útil que cualquier benchmark público.
La diferencia entre las empresas que están usando bien la IA y las que no suele estar aquí: en si han hecho el trabajo de medir con sus propios casos o siguen esperando a que alguien les diga cuál es el mejor modelo del mundo.
El mejor modelo del mundo es el que resuelve tu problema. Y eso solo lo puedes saber tú.
Leer también: Claude vs ChatGPT para empresas y Cómo usa la IA un directivo.
—
Preguntas frecuentes
¿Cuántos casos necesito para que la prueba sea fiable? Con 10 casos ya tienes señal útil. Con 20 tienes bastante confianza. No hace falta más para tomar una primera decisión. Si el caso de uso es muy crítico o el volumen de uso es muy alto, puedes ampliar, pero la mayoría de las empresas toman decisiones correctas con 15 ejemplos bien elegidos.
¿Tengo que hacer esto cada vez que salga un modelo nuevo? No necesariamente. Una vez que tienes tu golden set montado, reutilizarlo para probar un nuevo candidato es rápido. Eso sí: si el modelo que estás usando empieza a dar problemas o aparece una alternativa significativamente más barata, vale la pena repetir la prueba. Como norma, revisarlo cada seis meses es suficiente para la mayoría de los usos.
¿Qué hago si los resultados de dos modelos son muy parecidos? Si el acierto es similar, decide por coste y privacidad. Si todo es igual, quédate con el que tenga mejor soporte y documentación en español, o con el que tu equipo ya conoce. La fricción de adopción es un coste real que no aparece en los benchmarks.
