El coste que la tabla de tokens no muestra
Por qué la inteligencia y el coste por tarea cambian la comparación entre modelos
.png)
Cuando llega el momento de elegir un modelo, el camino más habitual sigue siendo abrir la tabla de precios y mirar el coste por millón de tokens de input y de output. Los nombres grandes aparecen primero, los números parecen objetivos, y la decisión se cierra sobre esa comparación. Tiene sentido. Es la unidad que publican los vendors, es lo que entiende la hoja de cálculo, y durante mucho tiempo fue la forma más práctica de comparar opciones.
El problema es que esa lectura, sola, deja fuera muchas cosas.
Qué mide realmente el precio por token
El precio de input y el de output dicen cuánto cuesta mover una unidad de texto. No dicen cuánto texto generará el modelo para llegar a un resultado, cuántos reintentos necesita, ni si la regla de conteo del provider es la misma que en la versión anterior.
Dos modelos con precio de token parecido pueden acabar con cuentas muy distintas en la misma tarea. Uno responde corto y resuelve. Otro escribe más, revisita el razonamiento, o simplemente cuenta tokens de otra manera.
Un ejemplo concreto: en Claude Sonnet 5, Anthropic documenta un tokenizer nuevo en el que el mismo texto genera alrededor de un 30% más de tokens que en Sonnet 4.6. El aumento exacto depende del contenido. Eso no significa, automáticamente, una factura un 30% más cara en dólares, porque el precio por millón de tokens también cambió. Significa otra cosa, más importante para la comparación: mirar solo el $/1M tokens entre generaciones (o entre modelos) engaña, porque la unidad "token" no representa el mismo trozo de texto para todo el mundo.
Por eso el precio por token sigue siendo útil como referencia, e incompleto como criterio único.
La otra mitad: calidad
Si solo optimizamos precio, el modelo más barato siempre gana. En la práctica nadie elige así, y con razón. Sin un suelo de calidad, "barato" puede ser solo un modelo débil para ese trabajo.
La lectura más limpia junta las dos cosas: cuánto cuesta el modelo para entregar un resultado, y cuán capaz es en ese resultado. Por separado, cada métrica miente un poco. Juntas, empiezan a parecer una decisión.
Coste por tarea como lente
Artificial Analysis publica un gráfico que ayuda exactamente con eso: Intelligence Index en el eje vertical, y coste medio por tarea de ese índice en el eje horizontal (en escala logarítmica). En lugar de preguntar solo "¿cuánto cuesta el token?", la pregunta pasa a ser "¿cuánto cuesta, de media, completar una tarea en este nivel de inteligencia?".
Esto no sustituye la prueba en tu propio workload. Sustituye la ilusión de que la tabla de $/1M tokens ya es la respuesta. El coste por tarea se acerca mejor a lo que pagas por resultado, porque absorbe diferencias de generación, de camino y, en parte, de comportamiento del modelo.
Un recorrido por los datos
Mirando el mapa, tres regiones quedan claras.
En la franja más eficiente, una calidad suficientemente buena aparece con coste por tarea bajo. Variantes como GPT-5.6 Luna quedan en el extremo barato, con inteligencia sólida en la zona de los 30 y pico por pocos céntimos por tarea. GLM-5.3-Flash aparece cerca de la frontera, con inteligencia en torno a 42 por unos US$ 0,25 por tarea. DeepSeek V4.1 Flash entrega algo cerca de 39 por unos US$ 0,28. Gemini 3.8 Flash entra en el mismo tipo de zona atractiva, con inteligencia en los 40 a una fracción de lo que muchos modelos "premium" cobran por tarea. En el medio de la curva, nombres como GPT-5.6 Terra y GPT-5.6 Sol compiten con inteligencia competitiva sin el ticket del tope absoluto.
En el otro extremo, modelos de inteligencia muy alta (algunas variantes Claude Opus / Fable, por ejemplo) llegan a 50+ en el índice, con coste por tarea en el rango de varios dólares. Eso puede ser exactamente lo que pide una tarea difícil. Solo no necesita ser el default de todo.
Claude Sonnet 5 (max) ayuda a ver la distorsión. Inteligencia cerca de 38, coste en torno a US$ 5 por tarea. En el mismo gráfico, Terra, Gemini 3.8 Flash e incluso Luna aparecen con inteligencia parecida o mejor por una fracción del coste. La lectura útil no es "Sonnet es malo". Es "la percepción de calidad asociada a un nombre mainstream puede estar desalineada del coste por tarea que muestran los datos".
Mirar más allá del mainstream
Una cosa que el gráfico deja difícil de ignorar es cuánta eficiencia aparece fuera de la lista de siempre. Modelos como GLM, DeepSeek y Kimi surgen con frecuencia cerca de la frontera: calidad respetable con coste por tarea bajo.
Si la comparación es solo precio de token entre dos o tres nombres famosos, esa franja casi no entra en la conversación. Si la comparación es calidad mínima aceptable más coste por tarea, entra de forma natural. A veces el mejor coste-beneficio no está en el modelo que todo el mundo cita primero.
Cómo usar esto a la hora de elegir
Un guion simple, y suficiente para la mayor parte de las decisiones:
- Escribe la tarea con claridad. Qué necesita salir bien, y qué es inaceptable.
- Define un suelo de calidad. Usa un índice público como el Intelligence Index como punto de partida, y confirma con ejemplos reales de tu uso.
- En esa franja de calidad, compara coste por tarea, no solo $/1M tokens de input y output.
- Pon al menos una o dos opciones fuera del default famoso sobre la mesa, sobre todo si aparecen en la frontera de eficiencia.
- Ejecuta el mismo conjunto de ejemplos en los finalistas y mira gasto real, estabilidad y calidad lado a lado.
- Cuando el provider cambie precio o regla de conteo, vuelve a leer. La tabla de ayer puede estar describiendo otro producto.
Nada de esto pide una hoja de cálculo infinita. Pide el hábito de no pararse en el primer número visible.
Cierre
La pregunta "¿cuál es el mejor modelo?" sigue mal hecha si llega sola. ¿Mejor para qué, con qué calidad mínima, y a qué coste por resultado?
El precio de token sigue siendo un dato. La calidad sigue siendo un dato. El coste por tarea es lo que empieza a juntar los dos en una elección legible. Y cuando esa lente entra, el mainstream deja de ser automático, y modelos menos obvios pasan a competir por mérito.
Fuente: Artificial Analysis, gráfico Intelligence Index vs Cost per Intelligence Index Task (21 sep 2026). Valores aproximados a partir del recorte público del panel. Sobre el tokenizer de Sonnet 5: documentación de Anthropic (What's new / Migration guide).