News
OpenAI Solves a Millennium Problem
The Millennium Prize problems are a set of 7 highly difficult math problems selected by the Clay Mathematics institute in 2000.
These are some of the most famous problems in math, and it would be a crowning achievement for any mathematician who solves one.
OpenAI has claimed that they have solved one of these problems- the Navier-Stokes problem- which pertains to fluid dynamics.
They used an unreleased model that they are still in the process of training, utilizing 10,000 parallel subagents, costing an estimated $6.5 million in tokens (if paid using API pricing).
This claim has not come without controversy, however.
Another group has also been working on it, including Levent Alpöge, the Anthropic employee who recently found a counter example to the Jacobian Conjecture
They had been working on the same problem (outside of work) using a mix of Anthropic and OpenAI models, and had been able to prove a claim that was one of the building blocks for proving Navier-Stokes, but were unable to solve Navier -Stokes itself yet.
They claimed that OpenAI had been snooping on what should have been their zero data retention chats, using their results to help build their own proof.
OpenAI denies these claims, and they seem to be correct; the proof that they used was for a different form (proving it for a different system).
They also said that they reached out and offered to partner with Levent’s group, and offer first authorship on the paper to them (except for Levent, since he was an Anthropic employee) which they denied.
Either way this is a big deal for the future of mathematics, as one of its most famous problems falls to a fully-automated AI system.
There are rumors that both OpenAI and Anthropic are working towards the five other unsolved Millennium Problems, so we will see what lab will get the next one.
Releases
GPT-6 Astra
Last week I discussed the initial vibes I got from the ~24 hours we had access to GPT-6 Astra, and now that both I and the community have had time to thoroughly test it I can give a proper recommendation (or not!) for the model.
Starting with the good, its vision and computer use capabilities are as strong as they initially seemed last week.
It is by far the best model at both, making every other model seem irrelevant in comparison for those tasks.
It is also very strong at planning and reviewing code.
Its attention to detail is impressive, catching fiddly bugs and thinking through scenarios that most other models miss.
It also seems to be well aligned.
On Vending Bench, which tests models on running a simulated vending machine business, it outperforms the Claude models, which have used maligned behavior like lying to customers and other businesses its competing against to get ahead at any cost.
Not only does GPT-6 beat the Claude models and make more money, but they do so without needing to harm any users on the way.
Unfortunately, its ability to review code has not translated into consistently good code of its own.
People are reporting compressed, hard to maintain code, particularly when the model seems to think nobody will be reading it.
The code will usually work, but the long term maintainability, even for other LLMs, may get worse over time.
It also has an annoying tendency to work around the tools in its harness, using Python and TypeScript scripts to edit files even when dedicated editing tools are available.
This makes it harder to follow what the model is changing as it works, and reminds me of the issues we saw with Gemini 3 Pro, where it seemed confused by its own harness.
Then there are the rate limits.
As I expected last week, Astra is burning through subscription limits much faster than previous OpenAI models.
This is happening even with medium reasoning and fast mode turned off, so it does not seem to be limited to people running the model at its most expensive settings.
Interestingly, turning the reasoning effort down may not be the best way to save tokens.
There are reports that Astra actually uses fewer tokens at higher reasoning settings, and the ARC-AGI-3 results below show how higher effort can lead to a lower total cost.
The model takes fewer actions to solve the task, so giving it more room to think can end up being cheaper overall.
Higher reasoning effort can reduce the total cost, although the results also depend heavily on the harness.
OpenAI has acknowledged these issues, hopefully GPT-6.1 will bring the polish that Astra needs, but we will have to see how much of this they can resolve.
For now, I would use Astra for vision and computer use, along with planning and reviewing difficult work.
Its code quality and usage limits make it much harder to recommend as your everyday coding model, even with the extra intelligence it brings.
Quick Hits
DeepSeek V4.1 Flash
DeepSeek has released an updated version of their smaller flash model, V4.1.

Despite the modest version number bump, this model has a dramatically different architecture.
It is no longer a decoder only language model, which is what almost every model since ChatGPT was released has been.
Instead it uses an encoder-decoder architecture, meaning there are essentially 2 models that talk to each other.
The first model is for encoding and understanding the prompt, and then the second is for deciding what the next token to generate should be.
This allows them to use a light-weight mixture of experts model for the encoder, and then a computationally heavier model for the decoder.
They also add in an Engram lookup table, which is sort of like a knowledge base built into the model’s weights, similar to Qwen 3.8 Flash Next.
This new architecture almost doubles the model’s size, but makes it more efficient and cheaper in the process.
They couple these changes with increased performance, doing better than the previous DeepSeek V4 Pro model.
The benchmarks show it doing better than the bigger GLM 5.3 and Kimi K3 models, but in the real world it seems like it got just a modest bump, catching it back up with GLM 5.3 Flash.
It also still seems a bit rough around the edges right now, so I would stick with GLM 5.3 Flash or the previous V4 Flash model, but I do look forward to V4.2 if they can add a bit more polish to the model.
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
GPT-6 Astra self portrait by LinXule on TwitterNota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
Resumo
- A OpenAI resolve um Problema do Milênio
- A análise completa do GPT-6
- A DeepSeek continua melhorando
Notícias
A OpenAI resolve um Problema do Milênio
Os Problemas do Prêmio do Milênio são um conjunto de 7 problemas matemáticos extremamente difíceis selecionados pelo Clay Mathematics Institute em 2000.
Eles estão entre os problemas mais famosos da matemática, e resolver um deles seria uma conquista máxima para qualquer matemático.
A OpenAI afirmou que resolveu um desses problemas, o problema de Navier-Stokes, que diz respeito à dinâmica dos fluidos.
Eles usaram um modelo ainda não lançado, que segue em processo de treinamento, utilizando 10.000 subagentes paralelos, com um custo estimado de US$ 6,5 milhões em tokens (se pago usando os preços da API).
Essa afirmação, porém, não veio sem controvérsia.
Outro grupo também vinha trabalhando nisso, incluindo Levent Alpöge, o funcionário da Anthropic que recentemente encontrou um contraexemplo para a Conjectura Jacobiana.
Eles estavam trabalhando no mesmo problema (fora do trabalho) usando uma combinação de modelos da Anthropic e da OpenAI, e conseguiram provar uma afirmação que era um dos blocos fundamentais para provar Navier-Stokes, mas ainda não haviam conseguido resolver Navier-Stokes em si.
Eles alegaram que a OpenAI vinha bisbilhotando o que deveriam ter sido seus chats com retenção zero de dados, usando seus resultados para ajudar a construir sua própria prova.
A OpenAI nega essas alegações, e eles parecem estar corretos; a prova que usaram era para uma forma diferente (provando o resultado para um sistema diferente).
Eles também disseram que entraram em contato e ofereceram uma parceria com o grupo de Levent, além de oferecer a eles a primeira autoria do artigo (exceto para Levent, já que ele era funcionário da Anthropic), oferta que eles recusaram.
De qualquer forma, isso é um grande acontecimento para o futuro da matemática, já que um de seus problemas mais famosos caiu diante de um sistema de IA totalmente automatizado.
Há rumores de que tanto a OpenAI quanto a Anthropic estão trabalhando nos outros cinco Problemas do Milênio ainda sem solução, então veremos qual laboratório conseguirá o próximo.
Lançamentos
GPT-6 Astra
Na semana passada, discuti as impressões iniciais que tive nas cerca de 24 horas em que tivemos acesso ao GPT-6 Astra, e agora que tanto eu quanto a comunidade tivemos tempo para testá-lo a fundo, posso dar uma recomendação adequada (ou não!) para o modelo.
Começando pelo lado positivo, suas capacidades de visão e de uso do computador são tão fortes quanto pareciam inicialmente na semana passada.
Ele é de longe o melhor modelo em ambas, fazendo todos os outros modelos parecerem irrelevantes em comparação para essas tarefas.
Ele também é muito forte em planejar e revisar código.
Sua atenção aos detalhes é impressionante, encontrando bugs complicados e pensando em cenários que a maioria dos outros modelos deixa passar.
Ele também parece estar bem alinhado.
No Vending Bench, que testa modelos administrando um negócio simulado de máquinas de venda automática, ele supera os modelos Claude, que usaram comportamento nocivo, como mentir para clientes e outras empresas contra as quais competem para levar vantagem a qualquer custo.
O GPT-6 não só supera os modelos Claude e ganha mais dinheiro, como faz isso sem precisar prejudicar nenhum usuário no caminho.
Infelizmente, sua capacidade de revisar código não se traduziu em código próprio consistentemente bom.
As pessoas estão relatando código comprimido e difícil de manter, particularmente quando o modelo parece achar que ninguém vai lê-lo.
O código geralmente funciona, mas a manutenibilidade de longo prazo, mesmo para outros LLMs, pode piorar com o tempo.
Ele também tem uma tendência irritante de contornar as ferramentas do seu harness, usando scripts em Python e TypeScript para editar arquivos mesmo quando ferramentas dedicadas de edição estão disponíveis.
Isso torna mais difícil acompanhar o que o modelo está alterando enquanto trabalha, e me lembra os problemas que vimos com o Gemini 3 Pro, quando ele parecia confuso com o próprio harness.
Depois há os limites de uso.
Como eu esperava na semana passada, o Astra está consumindo os limites das assinaturas muito mais rápido do que os modelos anteriores da OpenAI.
Isso está acontecendo mesmo com raciocínio médio e modo rápido desativado, então não parece estar limitado a pessoas executando o modelo em suas configurações mais caras.
Curiosamente, reduzir o esforço de raciocínio pode não ser a melhor forma de economizar tokens.
Há relatos de que o Astra na verdade usa menos tokens em configurações de raciocínio mais altas, e os resultados do ARC-AGI-3 abaixo mostram como um esforço maior pode levar a um custo total menor.
O modelo realiza menos ações para resolver a tarefa, então dar mais espaço para ele pensar pode acabar sendo mais barato no geral.
Um esforço de raciocínio maior pode reduzir o custo total, embora os resultados também dependam muito do harness.
A OpenAI reconheceu esses problemas; com sorte, o GPT-6.1 trará o polimento de que o Astra precisa, mas teremos que ver quanto disso eles conseguirão resolver.
Por enquanto, eu usaria o Astra para visão e uso do computador, além de planejamento e revisão de trabalhos difíceis.
Sua qualidade de código e seus limites de uso tornam muito mais difícil recomendá-lo como seu modelo cotidiano de programação, mesmo com a inteligência extra que ele traz.
Notas rápidas
DeepSeek V4.1 Flash
A DeepSeek lançou uma versão atualizada de seu modelo flash menor, o V4.1.

Apesar do aumento modesto no número da versão, esse modelo tem uma arquitetura dramaticamente diferente.
Ele não é mais um modelo de linguagem apenas decoder, que é o que quase todo modelo tem sido desde o lançamento do ChatGPT.
Em vez disso, ele usa uma arquitetura encoder-decoder, o que significa que há essencialmente 2 modelos conversando entre si.
O primeiro modelo serve para codificar e entender o prompt, e então o segundo decide qual deve ser o próximo token a ser gerado.
Isso permite que eles usem um modelo mixture of experts leve para o encoder e, depois, um modelo computacionalmente mais pesado para o decoder.
Eles também adicionam uma tabela de consulta Engram, que é meio como uma base de conhecimento incorporada aos pesos do modelo, semelhante ao Qwen 3.8 Flash Next.
Essa nova arquitetura quase dobra o tamanho do modelo, mas o torna mais eficiente e mais barato no processo.
Eles combinam essas mudanças com maior desempenho, superando o modelo DeepSeek V4 Pro anterior.
Os benchmarks mostram que ele se sai melhor do que os modelos maiores GLM 5.3 e Kimi K3, mas no mundo real parece ter recebido apenas um avanço modesto, alcançando novamente o GLM 5.3 Flash.
Ele também ainda parece um pouco áspero nas bordas neste momento, então eu ficaria com o GLM 5.3 Flash ou com o modelo V4 Flash anterior, mas estou ansioso pelo V4.2 se eles conseguirem adicionar um pouco mais de polimento ao modelo.
Final
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, não deixe de entrar na nossa lista de emails abaixo.
Autorretrato do GPT-6 Astra por LinXule no TwitterNota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Noticias
OpenAI resuelve un problema del milenio
Los Problemas del Premio del Milenio son un conjunto de 7 problemas matemáticos extremadamente difíciles seleccionados por el Instituto Clay de Matemáticas en 2000.
Son algunos de los problemas más famosos de las matemáticas, y resolver uno sería un logro culminante para cualquier matemático.
OpenAI ha afirmado que ha resuelto uno de estos problemas, el problema de Navier-Stokes, que pertenece a la dinámica de fluidos.
Usaron un modelo no lanzado que todavía están entrenando, utilizando 10.000 subagentes en paralelo, con un coste estimado de 6,5 millones de dólares en tokens (si se pagara usando precios de API).
Sin embargo, esta afirmación no ha estado exenta de controversia.
Otro grupo también ha estado trabajando en ello, incluido Levent Alpöge, el empleado de Anthropic que recientemente encontró un contraejemplo a la conjetura jacobiana.
Habían estado trabajando en el mismo problema (fuera del trabajo) usando una mezcla de modelos de Anthropic y OpenAI, y habían logrado demostrar una afirmación que era uno de los bloques fundamentales para probar Navier-Stokes, pero todavía no habían podido resolver Navier-Stokes en sí.
Afirmaron que OpenAI había estado espiando lo que deberían haber sido sus chats con retención de datos cero, usando sus resultados para ayudar a construir su propia demostración.
OpenAI niega estas acusaciones, y parece que tiene razón; la prueba que usaron era para una forma distinta (demostrándola para un sistema diferente).
También dijeron que se pusieron en contacto y ofrecieron asociarse con el grupo de Levent, además de ofrecerles la autoría principal del artículo (excepto a Levent, ya que era empleado de Anthropic), lo cual rechazaron.
De cualquier manera, esto es muy importante para el futuro de las matemáticas, ya que uno de sus problemas más famosos cae ante un sistema de IA completamente automatizado.
Hay rumores de que tanto OpenAI como Anthropic están trabajando en los otros cinco Problemas del Milenio que siguen sin resolverse, así que veremos qué laboratorio consigue el próximo.
Lanzamientos
GPT-6 Astra
La semana pasada comenté las primeras impresiones que me dejó el acceso de unas 24 horas que tuvimos a GPT-6 Astra, y ahora que tanto yo como la comunidad hemos tenido tiempo de probarlo a fondo, puedo dar una recomendación adecuada (¡o no!) sobre el modelo.
Empezando por lo bueno, sus capacidades de visión y uso de computadora son tan sólidas como parecían inicialmente la semana pasada.
Es, con mucha diferencia, el mejor modelo en ambas áreas, haciendo que todos los demás modelos parezcan irrelevantes en comparación para esas tareas.
También es muy sólido en planificación y revisión de código.
Su atención al detalle es impresionante: detecta errores complicados y piensa en escenarios que la mayoría de los otros modelos pasan por alto.
También parece estar bien alineado.
En Vending Bench, que prueba modelos gestionando un negocio simulado de máquinas expendedoras, supera a los modelos Claude, que han usado comportamiento mal alineado, como mentir a clientes y a otras empresas contra las que compiten para salir adelante a cualquier coste.
GPT-6 no solo supera a los modelos Claude y gana más dinero, sino que lo hace sin necesidad de perjudicar a ningún usuario por el camino.
Por desgracia, su capacidad para revisar código no se ha traducido en código propio consistentemente bueno.
La gente está reportando código comprimido y difícil de mantener, especialmente cuando el modelo parece pensar que nadie lo va a leer.
El código normalmente funciona, pero la mantenibilidad a largo plazo, incluso para otros LLMs, puede empeorar con el tiempo.
También tiene una tendencia molesta a rodear las herramientas de su entorno, usando scripts de Python y TypeScript para editar archivos incluso cuando hay herramientas dedicadas de edición disponibles.
Esto hace que sea más difícil seguir qué está cambiando el modelo mientras trabaja, y me recuerda a los problemas que vimos con Gemini 3 Pro, donde parecía confundido por su propio entorno.
Luego están los límites de uso.
Como esperaba la semana pasada, Astra está agotando los límites de las suscripciones mucho más rápido que los modelos anteriores de OpenAI.
Esto ocurre incluso con razonamiento medio y modo rápido desactivado, así que no parece limitarse a quienes ejecutan el modelo con su configuración más cara.
Curiosamente, bajar el esfuerzo de razonamiento quizá no sea la mejor manera de ahorrar tokens.
Hay reportes de que Astra en realidad usa menos tokens con configuraciones de razonamiento más altas, y los resultados de ARC-AGI-3 que aparecen abajo muestran cómo un mayor esfuerzo puede llevar a un coste total menor.
El modelo realiza menos acciones para resolver la tarea, así que darle más margen para pensar puede terminar siendo más barato en conjunto.
Un mayor esfuerzo de razonamiento puede reducir el coste total, aunque los resultados también dependen mucho del entorno.
OpenAI ha reconocido estos problemas; con suerte, GPT-6.1 traerá el pulido que Astra necesita, pero habrá que ver cuánto de esto pueden resolver.
Por ahora, usaría Astra para visión y uso de computadora, junto con planificación y revisión de trabajos difíciles.
Su calidad de código y sus límites de uso hacen que sea mucho más difícil recomendarlo como tu modelo de programación diario, incluso con la inteligencia adicional que aporta.
Apuntes rápidos
DeepSeek V4.1 Flash
DeepSeek ha lanzado una versión actualizada de su modelo flash más pequeño, V4.1.

A pesar del modesto aumento en el número de versión, este modelo tiene una arquitectura radicalmente distinta.
Ya no es un modelo de lenguaje solo decodificador, que es lo que han sido casi todos los modelos desde el lanzamiento de ChatGPT.
En su lugar usa una arquitectura encoder-decoder, lo que significa que básicamente hay 2 modelos que hablan entre sí.
El primer modelo se encarga de codificar y entender el prompt, y luego el segundo decide cuál debe ser el siguiente token a generar.
Esto les permite usar un modelo ligero de mezcla de expertos para el encoder, y luego un modelo computacionalmente más pesado para el decoder.
También añaden una tabla de consulta Engram, que es algo parecido a una base de conocimiento integrada en los pesos del modelo, similar a Qwen 3.8 Flash Next.
Esta nueva arquitectura casi duplica el tamaño del modelo, pero en el proceso lo vuelve más eficiente y barato.
Combinan estos cambios con un aumento de rendimiento, superando al modelo anterior DeepSeek V4 Pro.
Los benchmarks muestran que lo hace mejor que los modelos más grandes GLM 5.3 y Kimi K3, pero en el mundo real parece que solo obtuvo una mejora modesta, poniéndose de nuevo a la altura de GLM 5.3 Flash.
También parece seguir algo áspero en los bordes por ahora, así que me quedaría con GLM 5.3 Flash o con el modelo V4 Flash anterior, aunque sí espero con interés V4.2 si logran añadirle un poco más de pulido al modelo.
Final
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo abajo.
Autorretrato de GPT-6 Astra por LinXule en Twitter