GPT-6 Astra: What Analysis and Benchmarks Say About the Model

Independent benchmarks show GPT-6 Astra excels in agentic coding at a fraction of the cost, but its higher price offsets efficiency gains in general intelligence tasks.

GPT-6 Astra: Qué indican los análisis y benchmarks sobre el modelo

GPT-6 Astra, lanzado el 3 de septiembre de 2026, presenta avances relevantes en tareas de programación con agentes. Iguala a los modelos más fuertes del mercado por menos de la mitad de su costo. En inteligencia general, sin embargo, su menor uso de tokens queda compensado por un precio más alto.

Por qué esto importa para quienes usan Tess

Tess reúne varios modelos de IA en un mismo espacio de trabajo. Elegir el modelo adecuado para cada tarea impacta directamente en la calidad y el costo. GPT-6 Astra es el nuevo modelo de razonamiento de OpenAI y sucesor de GPT-5.6 Sol. Los resultados independientes de Artificial Analysis ayudan a entender dónde destaca — y dónde el cambio todavía puede no compensar.

Precio: aumento significativo

El precio de GPT-6 Astra es 2,5 veces mayor que el de GPT-5.6 Sol: pasó de US$ 4 / US$ 20 a US$ 10 / US$ 50 por millón de tokens de entrada/salida. Mantiene el descuento del 90% para lecturas de caché y el recargo del 25% para escrituras de caché.

Resumen rápido: hay dos historias distintas. En el Coding Agent Index, Astra iguala a los principales modelos por menos de la mitad del costo. En el Intelligence Index, es más eficiente en tokens que su predecesor, pero el aumento de precio anula esa ventaja.

Resultados destacados en el Índice de Agentes de Código

➤ Compite con los líderes del mercado

En Codex, GPT-6 Astra obtiene 67 puntos — prácticamente igual que Claude Opus 5 y Fable 5 en Claude Code, y Muse Spark 1.3 en Muse Code. Fable 5.1 en Claude Code lidera el índice con 70 puntos.

➤ 70% más eficiente en tokens que GPT-5.6 Sol

Astra usa un tercio de los tokens de GPT-5.6 Sol (esfuerzo máximo) en el entorno Codex y una quinta parte de los tokens de Claude Opus 5 (xhigh). Sus niveles de esfuerzo ocupan la frontera de Pareto de eficiencia de tokens.

➤ Lidera la frontera de costo-eficiencia en programación

Con esfuerzo máximo, GPT-6 Astra cuesta aproximadamente lo mismo que GPT-5.6 Sol (máximo), pero puntúa dos puntos más. Por tarea, cuesta menos de la mitad que Claude Fable 5 para la misma puntuación.

Artificial Analysis — Coding Agent Index
Fuente: Artificial Analysis — Coding Agent Index

Las mejoras de costo en programación se explican principalmente por la eficiencia de tokens: con esfuerzo máximo, Astra reduce aproximadamente 3 veces el uso de tokens frente a GPT-5.6 Sol (máximo).

Artificial Analysis — eficiencia de tokens en programación
Fuente: Artificial Analysis — eficiencia de tokens en el Coding Agent Index

Artificial Analysis — Coding Agent Index vs. costo por tarea
Fuente: Artificial Analysis — Coding Agent Index vs. costo por tarea

Resultados destacados en el Índice de Inteligencia

➤ Empata con GPT-5.6 Sol en inteligencia general

GPT-6 Astra alcanza 61 puntos, igual que GPT-5.6 Sol. Esto lo deja cinco puntos por debajo de Claude Fable 5.1 (máximo con fallback) y también detrás de Muse Spark 1.3 (máximo), de Meta.

➤ Cerca de 10% menos tokens de salida, pero con mayor precio

Con esfuerzo máximo, Astra usa alrededor de 10% menos tokens de salida que GPT-5.6 Sol y establece una nueva frontera de eficiencia entre inteligencia y tokens de salida por tarea. Aun así, el incremento de precio de 2,5 veces lo hace 75% más caro por tarea que su predecesor.

➤ Reduce aproximadamente a la mitad las alucinaciones

En AA-Omniscience, el benchmark de conocimiento y alucinación de Artificial Analysis, la tasa de alucinación baja de 92% a 51% con esfuerzo máximo. A diferencia de otros modelos, esta mejora no reduce la precisión: la exactitud de Astra aumenta cuatro puntos.

➤ Gana aproximadamente 80 puntos de Elo en AA-Briefcase

GPT-6 Astra mejora cerca de 80 puntos en AA-Briefcase, una evaluación de trabajo de conocimiento de largo plazo con proyectos de varias semanas, tareas conectadas y miles de archivos de origen. Mejora las puntuaciones de rúbrica y el Elo de Calidad Analítica, mientras que el Elo de Calidad de Presentación disminuye.

➤ Progreso mixto en otras evaluaciones

El modelo gana seis puntos en Humanity's Last Exam, pero pierde cerca de 80 puntos de Elo en GDPval-AA v2, que mide tareas de valor económico en 44 profesiones. También hay regresiones de 2 a 3 puntos en τ³-Banking, SciCode y AA-LCR.

Artificial Analysis — Intelligence Index vs. tokens de salida por tarea
Fuente: Artificial Analysis — Intelligence Index vs. tokens de salida por tarea

Artificial Analysis — Intelligence Index vs. costo por tarea
Fuente: Artificial Analysis — Intelligence Index vs. costo por tarea

Artificial Analysis — AA-Omniscience
Fuente: Artificial Analysis — AA-Omniscience (conocimiento y alucinación)

Artificial Analysis — AA-Briefcase y GDPval-AA v2
Fuente: Artificial Analysis — AA-Briefcase y GDPval-AA v2

Artificial Analysis — desglose de evaluaciones del Intelligence Index
Fuente: Artificial Analysis — desglose de evaluaciones del Intelligence Index v4.1.1

En la práctica

  • Para programación y tareas con agentes: GPT-6 Astra es una opción sólida, con rendimiento al nivel de modelos líderes y una fracción del costo de la alternativa más cara.
  • Para razonamiento e inteligencia general: el menor uso de tokens no compensa el aumento de precio; conviene comparar alternativas antes de migrar.
  • Para tareas sensibles a hechos: la reducción de alucinaciones es uno de los avances más importantes de Astra, aunque las respuestas siguen requiriendo revisión adecuada.
  • Para proyectos largos y complejos: la calidad analítica mejora de forma relevante, pero la presentación puede requerir edición adicional.

La mejor manera de elegir un modelo es probarlo con tu propio flujo de trabajo. Tess permite hacer esa comparación al ofrecer varios modelos de IA en un único espacio de trabajo.


Datos, gráficos y metodología originales: Artificial Analysis — “Benchmarking GPT-6 Astra”, publicado el 3 de septiembre de 2026.

Sigue leyendo

Explora más novedades y mejores prácticas para equipos que construyen con Plataforma Tess prod.

Construye con TESS

Convierte ideas de este artículo en flujos de IA funcionales.

Crea agentes, automatizaciones y flujos con conocimiento en una plataforma hecha para equipos.