2026-09-09 · ← Noticias
GPT-6 Astra: La cadena de pensamiento oculta no esconde más de lo que le falta a la propia arquitectura
Perex: El modelo GPT-6 Astra trajo mejores resultados, pero también preocupación por cadenas de pensamiento más cortas y ocultas. Sin embargo, una mirada detallada a su probable arquitectura explica por qué el modelo puede prescindir de un largo diálogo interno.
Un transformador en bucle recicla bloques en lugar de agregar otros nuevos
Según la especulación técnica discutida por el investigador Sebastian Raschka, GPT-6 Astra utiliza el concepto de transformadores en bucle. En lugar de procesar datos en una larga fila de bloques de un solo uso, el modelo envía cálculos intermedios a través del mismo conjunto de bloques. Los pesos en estos bloques siguen siendo los mismos, dando al modelo una llamada profundidad recurrente sin un aumento dramático en el número de parámetros. No es una idea nueva (ya apareció en Universal Transformers en 2018), pero parece que OpenAI ha encontrado una manera de optimizarla. Con el mismo presupuesto computacional, el modelo puede lograr mejores resultados que una arquitectura tradicional gracias a los bucles.
Menos razonamiento no es necesariamente ocultar evidencia
Una de las principales críticas contra GPT-6 Astra es la reducida capacidad de monitoreo. El modelo genera cadenas de pensamiento más cortas que sus predecesores. Pero Raschka argumenta que esto no significa necesariamente una ocultación estratégica. Los modelos más capaces simplemente cometen menos errores y no necesitan probar tantos callejones sin salida. Una cadena de pensamiento más corta puede ser simplemente una consecuencia de que el modelo encuentre la solución correcta antes. Después de todo, la misma tendencia ya se aplicaba a modelos anteriores. Luna, más pequeña, requirió más tokens de razonamiento que Sol, más capaz, para lograr un resultado similar. Los bucles agregan poder computacional dentro de la propia arquitectura, reduciendo la necesidad de usar tokens de razonamiento externos como un bloc de notas improvisado.
La computadora como entorno, no solo como hardware
Mientras la discusión gira en torno a la arquitectura, el verdadero avance de Astra es su capacidad para controlar una interfaz gráfica de usuario. Raschka señala que las compras masivas de Mac por parte de OpenAI no fueron para entrenamiento directamente, sino para crear un entorno macOS interactivo. El modelo aprende a reconocer la pantalla y generar acciones de mouse o teclado a través del aprendizaje por refuerzo. Esto hace que el modelo sea una herramienta mucho más versátil para tareas que carecen de su propia interfaz API.
El impulso hacia herramientas diferentes revelará los límites de las prácticas actuales
Las expectativas para futuros modelos deberían pasar del razonamiento abstracto a la interacción con sistemas reales. Para los desarrolladores, esto significa una cosa. Tendrán que tirar instrucciones antiguas y eliminar los extensos manuales (SKILL.md) que guiaban a los modelos antiguos paso a paso. Los nuevos modelos ya no necesitan esta ayuda, y unas instrucciones demasiado detalladas solo los limitarían. La pregunta sigue siendo qué tan rápido las soluciones de código abierto pueden imitar no solo la arquitectura sino también la infraestructura de entrenamiento necesaria para un control fluido de la interfaz de usuario.
El veredicto de Lilith
Si un razonamiento más corto proviene de bucles de red internos, Astra no es necesariamente más escurridiza, simplemente es mejor haciendo cálculos mentales en lugar de escribirlos. Pero en ambos casos, se obtiene una ventana mucho más estrecha a la cabeza del modelo.
Fuentes
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗