Releases
GPT 6 Astra
GPT 6 Astra got released this week, with most people getting access to it on Friday.
Because of this, we have not had enough time to get a good sense of the model’s full capabilities yet (as we saw with Opus 5 it takes 3-4 days to learn how well the model truly performs in the real world) but it does give a preview of what to look out for as you are using it this week.
We will do a more thorough breakdown next week, but for now we will go over what we do know about the model and what to potentially look out for.

GPT 6’s most notable improvements come from its increased vision capabilities.
It maxes out various private vision benchmarks, exceeding human baseline scores on them.
This then leads it to have very strong browser/computer use, and impressive performance in 3D tools like Blender and CAD programs.
This of course is the ideal thing to post about on social media (a cool Blender render gets far more engagement than a generic benchmark chart), and does showcase how the model’s vision capabilities are by far and away the best of any model we have ever seen, but I think this may be overinflating how good we think the model is.
This is not image gen. GPT-6 designed all of these in Bricklink Studio (brick by brick) then rendered them in Blender. From dominik kundel on Twitter
We can see a few cracks potentially forming, some people have reported very low code quality (worse than any previous frontier model) which may also be an indication of poor writing abilities in general.
It has also been found that the model underperforms GPT 5.6 and Fable when given multiple attempts at a problem, which could be a sign of brittleness and lack of diversity in the model, which would impact things like auto research.
This is not to say that the model is bad, just that further investigation is needed, and that the model is not some silver bullet that has fixed every issue that we have had with LLMs.
Then there is the issue of price.
Similar to previous major releases from OpenAI, GPT 6 comes with a price hike from $30 to $50 per million output tokens, but claims to be about equal in price due to a decrease in token usage since the model is much smarter and efficient.
| Model | $ per million (input) | $ per million (output) | Tokens per second |
|---|
| GPT 6 Astra | $10 | $50 | 35 |
| GPT 5.6 Sol | $5 | $30 | 45 |
| Claude Fable 5.1 | $10 | $50 | 40 |
| GLM 5.3 | $1.40 | $4.40 | 47 |
| Grok 4.6 | $2 | $6 | 56 |
The issue is that for easy tasks, GPT 5.6 Sol was already as efficient as you could be for them, and there are no big token savings to be had, which means for those easy tasks you will be paying more.
On the Artificial Analysis benchmark suite, they find that GPT 6 with low reasoning is more expensive that GPT 5.6 Sol high, even with a 70% increase in token efficiency.

Because of this, I would expect Codex limits to drain faster than before, and if you are using it via the API be sure to monitor its costs since it will be notably higher than its predecessor.
I will continue to use the model this week and gather feedback from the community, and will have a more thorough writeup for next week, so be sure to subscribe to the newsletter so that you don’t miss out.
Fable 5.1
Anthropic released an update to Fable and Mythos a few days before the release of GPT 6, to much less fanfare.
For those that are unaware, Fable and Mythos are the same model, with Fable having extra safety training and guardrails added to it so that the general public can use it without causing too much havoc.
Mythos is only available to select organizations who are participating in Anthropic’s Project Glasswing, which is focused on cybersecurity.
They did not bother making a separate benchmark image, this is just a screenshot from the system card
Fable 5.1 is a marginal upgrade to its predecessor, with the main notable difference being the drastic reduction in jargon that the model uses to communicate, making it feel much more natural to talk and work with.
The only other notable changes come with token use and pricing.
The model uses more tokens, which is caused by its reluctance to use parallel tool calls, and desire to completely rewrite files when performing code edits, which seem like a training issue from Anthropic, as I can’t imagine this the best way to be working.
This increase in token use is offset by a 75% reduction in cached input token costs (which are the majority of the tokens that you use in agentic applications).
These changes somewhat offset each other, ending up with a 20% increase in costs according to Artificial Analysis.
You should also note that when using Fable 5.1 on the low reasoning setting, it is more likely to use its own internal knowledge instead of using its web search tool, which could cause it to hallucinate more or tell you out of date information.
Fable 5.1 vs GPT 6 making a villa in Blender from hesamation on Twitter
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
From Tatiana Tsiguleva on TwitterNota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
Lançamentos
GPT 6 Astra
GPT 6 Astra foi lançado esta semana, com a maioria das pessoas tendo acesso a ele na sexta-feira.
Por causa disso, ainda não tivemos tempo suficiente para ter uma boa noção de todas as capacidades do modelo (como vimos com o Opus 5, leva de 3 a 4 dias para entender o desempenho real do modelo no mundo real), mas isso já dá uma prévia do que observar ao usá-lo esta semana.
Faremos uma análise mais completa na próxima semana, mas, por enquanto, vamos revisar o que já sabemos sobre o modelo e o que potencialmente merece atenção.

As melhorias mais notáveis do GPT 6 vêm do aumento de suas capacidades de visão.
Ele atinge o limite máximo em vários benchmarks privados de visão, superando neles as pontuações de referência humanas.
Isso então faz com que ele tenha um desempenho muito forte no uso de navegador/computador e desempenho impressionante em ferramentas 3D como Blender e programas de CAD.
Isso, é claro, é o tipo ideal de coisa para publicar nas redes sociais (um render legal no Blender gera muito mais engajamento do que um gráfico genérico de benchmark), e mostra que as capacidades de visão do modelo são, de longe, as melhores que já vimos em qualquer modelo. Mas acho que isso pode estar inflando demais nossa percepção de quão bom o modelo é.
Isso não é geração de imagem. O GPT-6 projetou tudo isso no Bricklink Studio (peça por peça) e depois renderizou no Blender. De dominik kundel no Twitter
Podemos ver algumas possíveis rachaduras se formando. Algumas pessoas relataram baixa qualidade de código (pior do que qualquer modelo frontier anterior), o que também pode ser uma indicação de baixa capacidade de escrita em geral.
Também foi constatado que o modelo fica abaixo do GPT 5.6 e do Fable quando recebe múltiplas tentativas para resolver um problema, o que pode ser um sinal de fragilidade e falta de diversidade no modelo, algo que afetaria tarefas como pesquisa automática.
Isso não quer dizer que o modelo seja ruim, apenas que mais investigação é necessária, e que o modelo não é uma solução mágica que corrigiu todos os problemas que tivemos com LLMs.
Depois há a questão do preço.
De forma semelhante a lançamentos importantes anteriores da OpenAI, o GPT 6 vem com um aumento de preço de US$ 30 para US$ 50 por milhão de tokens de saída, mas afirma ter um custo mais ou menos equivalente por causa de uma redução no uso de tokens, já que o modelo é muito mais inteligente e eficiente.
| Modelo | US$ por milhão (entrada) | US$ por milhão (saída) | Tokens por segundo |
|---|
| GPT 6 Astra | US$ 10 | US$ 50 | 35 |
| GPT 5.6 Sol | US$ 5 | US$ 30 | 45 |
| Claude Fable 5.1 | US$ 10 | US$ 50 | 40 |
| GLM 5.3 | US$ 1,40 | US$ 4,40 | 47 |
| Grok 4.6 | US$ 2 | US$ 6 | 56 |
O problema é que, para tarefas fáceis, o GPT 5.6 Sol já era tão eficiente quanto possível, e não há grandes economias de tokens a obter. Isso significa que, para essas tarefas fáceis, você pagará mais.
No conjunto de benchmarks da Artificial Analysis, eles mostram que o GPT 6 com raciocínio baixo é mais caro do que o GPT 5.6 Sol alto, mesmo com um aumento de 70% na eficiência de tokens.

Por causa disso, eu esperaria que os limites do Codex se esgotem mais rápido do que antes. E, se você estiver usando o modelo via API, monitore bem os custos, pois eles serão significativamente mais altos do que os do antecessor.
Vou continuar usando o modelo esta semana e coletar feedback da comunidade, e terei uma análise mais completa na próxima semana. Então assine a newsletter para não perder.
Fable 5.1
A Anthropic lançou uma atualização para Fable e Mythos alguns dias antes do lançamento do GPT 6, com bem menos alarde.
Para quem não sabe, Fable e Mythos são o mesmo modelo, com o Fable recebendo treinamento adicional de segurança e guardrails para que o público geral possa usá-lo sem causar problemas demais.
Mythos está disponível apenas para organizações selecionadas que participam do Project Glasswing da Anthropic, que é focado em cibersegurança.
Eles nem se deram ao trabalho de criar uma imagem separada de benchmark; isto é apenas uma captura de tela do system card
Fable 5.1 é uma atualização marginal em relação ao antecessor, com a principal diferença notável sendo a redução drástica do jargão que o modelo usa para se comunicar, fazendo com que pareça muito mais natural conversar e trabalhar com ele.
As únicas outras mudanças notáveis estão no uso de tokens e nos preços.
O modelo usa mais tokens, o que é causado por sua relutância em usar chamadas de ferramentas em paralelo, e por seu desejo de reescrever arquivos inteiros ao fazer edições de código. Isso parece um problema de treinamento da Anthropic, pois não consigo imaginar que essa seja a melhor forma de trabalhar.
Esse aumento no uso de tokens é compensado por uma redução de 75% nos custos de tokens de entrada em cache (que são a maioria dos tokens usados em aplicações agênticas).
Essas mudanças acabam se compensando em parte, resultando em um aumento de 20% nos custos, segundo a Artificial Analysis.
Você também deve observar que, ao usar o Fable 5.1 na configuração de raciocínio baixo, é mais provável que ele use seu próprio conhecimento interno em vez de usar sua ferramenta de pesquisa na web, o que pode fazer com que ele alucine mais ou forneça informações desatualizadas.
Fable 5.1 vs GPT 6 criando uma villa no Blender de hesamation no Twitter
Final
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, entre na nossa lista de emails abaixo.
De Tatiana Tsiguleva no TwitterNota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Lanzamientos
GPT 6 Astra
GPT 6 Astra se lanzó esta semana, y la mayoría de las personas obtuvo acceso el viernes.
Por este motivo, todavía no hemos tenido tiempo suficiente para hacernos una buena idea de todas las capacidades del modelo (como vimos con Opus 5, toma 3-4 días saber qué tan bien funciona realmente el modelo en el mundo real), pero sí da una vista previa de qué observar mientras lo usas esta semana.
Haremos un análisis más completo la próxima semana, pero por ahora repasaremos lo que sí sabemos sobre el modelo y a qué conviene prestar atención.

Las mejoras más notables de GPT 6 vienen de sus mayores capacidades de visión.
Alcanza el máximo en varios benchmarks privados de visión, y supera en ellos las puntuaciones base humanas.
Esto hace que tenga un uso de navegador/computadora muy potente y un rendimiento impresionante en herramientas 3D como Blender y programas CAD.
Por supuesto, esto es ideal para publicar en redes sociales (un render interesante de Blender obtiene mucha más interacción que un gráfico de benchmark genérico), y sí muestra que las capacidades de visión del modelo son, con mucha diferencia, las mejores que hemos visto en cualquier modelo, pero creo que esto puede estar inflando demasiado lo bueno que creemos que es el modelo.
Esto no es generación de imágenes. GPT-6 diseñó todos estos en Bricklink Studio (ladrillo por ladrillo) y luego los renderizó en Blender. De dominik kundel en Twitter
Podemos ver algunas grietas que quizá empiezan a formarse. Algunas personas han reportado una calidad de código muy baja (peor que la de cualquier modelo frontier anterior), lo que también podría indicar capacidades deficientes de escritura en general.
También se ha visto que el modelo rinde peor que GPT 5.6 y Fable cuando se le dan múltiples intentos para resolver un problema, lo que podría ser una señal de fragilidad y falta de diversidad en el modelo, algo que afectaría tareas como la investigación automática.
Esto no quiere decir que el modelo sea malo, solo que se necesita más investigación y que el modelo no es una bala de plata que haya solucionado todos los problemas que hemos tenido con los LLM.
Luego está el problema del precio.
De forma similar a lanzamientos importantes anteriores de OpenAI, GPT 6 viene con una subida de precio de $30 a $50 por millón de tokens de salida, pero afirma tener un precio aproximadamente igual debido a una disminución en el uso de tokens, ya que el modelo es mucho más inteligente y eficiente.
| Modelo | $ por millón (entrada) | $ por millón (salida) | Tokens por segundo |
|---|
| GPT 6 Astra | $10 | $50 | 35 |
| GPT 5.6 Sol | $5 | $30 | 45 |
| Claude Fable 5.1 | $10 | $50 | 40 |
| GLM 5.3 | $1.40 | $4.40 | 47 |
| Grok 4.6 | $2 | $6 | 56 |
El problema es que, para tareas fáciles, GPT 5.6 Sol ya era tan eficiente como se podía ser, y no hay grandes ahorros de tokens disponibles, lo que significa que pagarás más por esas tareas fáciles.
En el conjunto de benchmarks de Artificial Analysis, encuentran que GPT 6 con razonamiento bajo es más caro que GPT 5.6 Sol alto, incluso con un aumento del 70% en eficiencia de tokens.

Por esto, esperaría que los límites de Codex se agoten más rápido que antes, y si lo usas mediante la API, asegúrate de controlar sus costos, ya que serán notablemente más altos que los de su predecesor.
Seguiré usando el modelo esta semana y recopilaré comentarios de la comunidad. Tendré un análisis más completo para la próxima semana, así que asegúrate de suscribirte al newsletter para no perdértelo.
Fable 5.1
Anthropic lanzó una actualización para Fable y Mythos unos días antes del lanzamiento de GPT 6, con mucha menos atención.
Para quienes no lo sepan, Fable y Mythos son el mismo modelo, pero Fable tiene entrenamiento de seguridad y guardrails adicionales para que el público general pueda usarlo sin causar demasiado caos.
Mythos solo está disponible para ciertas organizaciones que participan en Project Glasswing de Anthropic, centrado en ciberseguridad.
No se molestaron en crear una imagen de benchmarks separada; esto es solo una captura de pantalla de la system card
Fable 5.1 es una mejora marginal frente a su predecesor, y la principal diferencia notable es la reducción drástica de la jerga que usa el modelo para comunicarse, lo que hace que se sienta mucho más natural hablar y trabajar con él.
Los únicos otros cambios notables tienen que ver con el uso de tokens y el precio.
El modelo usa más tokens, causado por su reticencia a usar llamadas paralelas a herramientas, y por su deseo de reescribir archivos completos al hacer ediciones de código. Esto parece un problema de entrenamiento de Anthropic, ya que no puedo imaginar que esta sea la mejor forma de trabajar.
Este aumento en el uso de tokens se compensa con una reducción del 75% en los costos de tokens de entrada en caché (que son la mayoría de los tokens que usas en aplicaciones agénticas).
Estos cambios se compensan parcialmente entre sí, y terminan con un aumento del 20% en costos según Artificial Analysis.
También debes tener en cuenta que, al usar Fable 5.1 con la configuración de razonamiento bajo, es más probable que use su propio conocimiento interno en lugar de usar su herramienta de búsqueda web, lo que podría hacer que alucine más o te dé información desactualizada.
Fable 5.1 frente a GPT 6 creando una villa en Blender de hesamation en Twitter
Final
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo abajo.
De Tatiana Tsiguleva en Twitter