Note
Sorry there was no AI news last week, I was out in the woods camping so was completely unaware of all the new models and news that came out during the week. That coupled with all of the new models released this week will make for the biggest AI news yet. I am once again going away on a trip this weekend, so I am writing this on Thursday afternoon, hopefully nothing else important happens after today.
News
OpenAI Dev Day
OpenAI had their yearly Dev Day this week where they announced a number of things, here are some of the highlights.
Dots, an AI personal assistant that is meant to be a competitor to OpenClaw, Meta Muse, and GrokBot.
Seems fairly similar capability-wise to the competition, which makes sense since OpenAI owns OpenClaw already.
It works directly with your subscription, and for the first few weeks has effectively infinite usage.
Decisions API: OpenAI’s Jev competitor. It uses GPT-6 Luna under the hood to perform zero shot classification, making it more expensive than Jev (about 2x the price for input tokens, and you have to pay for output tokens as well) but with the benefit of being able to handle multimodal inputs.
They did not release any benchmarks with it (red flag), which coupled with the higher costs, makes it a pass for me right now.
A new subscription plan for $500 a month.
It mostly just gets you access to more usage (no need to juggle as many accounts), with the only notable feature being access to UltraFast, which gives 5-10x faster inference speeds for Astra (300 tokens per second), but at 6x higher cost/ rate limit usage.
Sign in with ChatGPT.
Developers can now add a sign in with ChatGPT option to their sites, and when a user does so they can use their subscription on that site, allowing them to bring their subscription wherever they go.
OpenAI seems to be taking the opposite stance from Anthropic, who are closing down the ecosystem around their models and where they can use them.
OpenAI also announced that enterprise users can use 3rd party open source models through their partner BaseTen.
This means that enterprises will have access to models like GLM 5.3 and Kimi K3 through their OpenAI deals.
This is also a vast departure from Anthropic, who just this week called GLM 5.3 a dangerous model due to its lack of guardrails.
All of these announcements will probably have less effect on you than this final one that they were hiding during Dev Day, which is that rate limits (in terms of API dollars) on the subscription plan are being halved.
They say this is due to the API prices of their models going down dramatically. For instance Sol and Luna saw a 50% price decrease last week, so your usage for those will feel unchanged.
The main way you will notice is for Astra usage, since that has not seen any price cuts, so it will feel like you get to use it half as much.
Releases
Opus 5.5
Anthropic’s big release from 2 weeks ago was Opus 5.5.

The previous couple of Opus models have been a bit lackluster, with the last great Opus model being 4.6.
Opus 5.5 bucks that trend, as this model appears to be the real deal now and not just a model that moves the benchmark needle.
The thing that stands out about this model is its artistic taste.
There are many examples on Twitter of it using javascript to make artwork or putting together a unique and interesting music video for a song.
Video from NotinReality on Twitter
The issues with the previous Claude models was the unreliability and overzealousness on tasks. They would often skip over things you would have wanted them to do, or go and add additional features or complexity that you did not ask for.
Anthropic has fixed this wide variety in outcomes, making it much more usable day to day.
They also have decreased the pricing for it by 20% compared to previous versions of Opus, and drastically reduced the number of reasoning tokens it uses, especially at lower reasoning levels (low, medium, and high), making it even cheaper than the decrease in sticker price would entail.
| Model | $ per million (input) | $ per million (output) | Tokens per second |
|---|
| Claude Opus 5.5 | $4 | $20 | 68 |
| Claude Opus 5 | $5 | $25 | 69 |
| Claude Sonnet 5.5 | $2 | $10 | 84 |
| GPT 6.1 Sol | $2 | $10 | 31 |
| GPT 6 Luna | $0.10 | $0.50 | 35 |
| GPT 6 Astra | $10 | $50 | 35 |
| Claude Fable 5.1 | $10 | $50 | 40 |
| GLM 5.3 | $1.40 | $4.40 | 47 |
Anthropic models have always been better at inferring the intent of your prompt vs OpenAI’s models, and they also tend to write high quality code, but they have lacked a good option to use since Fable burns through limits fast and you can only use it for up to 50% of your subscription quota.
Opus 5.5 is bringing people back to Claude from Codex and OpenAI, as people had been migrating away after so many lackluster releases from Anthropic. I haven’t had too much time with the model yet but I will certainly be dusting off my Claude Code subscription to try out this model more in the coming weeks.
New GPT models
GPT 6 Sol and Luna
We will start with the models from 2 weeks ago that I was not able to cover.
GPT-6 Sol and Luna are mostly refreshes of the 5.6 models.
With the GPT-6 release Terra got dropped entirely, leaving just Sol, Luna, and Astra, and many people seemed to think that GPT-6 Sol was just a rebranded Terra, but that is now irrelevant with the 6.1 Sol release which we will talk about in the moment.

Notably, both Sol and Luna saw drastic 50% price decreases, and also token usage improvements, making them even more affordable than they were before, with Luna now being 1/100th the price of Astra.
We have not talked much about Luna outside of the initial release, but it has turned out to be one of the best price to performance models on the market right now. It is now the default model that I use in agentic systems, as it is fast, low cost, and fairly intelligent.
GPT 6.1 Sol
GPT-6 Sol’s initial poor performance got quickly released with the 6.1 version.
This model feels much more like what we expected GPT-6 Sol to be, with benchmarks rivaling Astra at 1/5th the price.

As expected the model is around Astra level, with it difficult to distinguish between the two.
Compared to Opus 5.5, the lack of taste and more rigid instruction following becomes apparent, and I have seen many people who have tried both decide to go with Opus 5.5 instead of Sol 6.1 for their daily driver.
One of the big things I have noticed with it this week is its lack of speed.
By making it cheaper many more people have started using it, and they have failed to scale up enough to meet demand.
Even though it is fairly token efficient, running at 20 tokens per seconds means that most prompts still take 5-10 minutes to complete, whereas Opus 5.5 is running around 70 tokens per second, making it more than 3x faster.
I would still consider it a very good model, and place it right below Opus 5.5 as the best day to day model to use right now.
Quick Hits
Gemini 4 Argon
Google saw Anthropic and OpenAI releasing models and wanted to get in on the action as well, but their model is just more of the same old Gemini BS.

The model benchmarks well, but in the real world its intelligence is very jagged and unpleasant to use.
From leaked conversations from within the Gemini team, by their own admission, the model is behind on coding compared to Anthropic and OpenAI’s offerings.
At $4 per million input tokens and $20 for output, it is not on the cost/intelligence frontier at all as well, making it an easy pass.
Sonnet 5.5
Sonnet 5.5 is another breath of fresh air for the Sonnet models similar to Opus 5.5.

Capability wise it is fairly similar to Opus, with higher token usage, making it about 30% cheaper in the real world at the same reasoning level as Opus.
The main way to describe the difference between Opus and Sonnet 5.5 is that Opus has wisdom that comes from being a larger model with Sonnet does not.
This means that Opus will be better at planning and decision making vs Sonnet.
Given Opus’ price decrease and its better capabilities, I find it hard to recommend Sonnet unless you are really trying to maximize your Claude Code usage (I would use Opus as a planning agent and Sonnet as the implementer).
For most people though, I would just recommend using Opus and saving Sonnet for your easier tasks.
Also a part of this announcement was that Haiku is going to return in the future (it hasn’t been updated for almost 2 years now) and I think Opus 5.5 and haiku 5.5 will be the best combo to use together, further making Sonnet feel irrelevant.
Nemotron 3 Diarization
Amongst all these LLM releases, I wanted to briefly mention that we have a new SOTA diarization model from Nvidia.
Diarization models split a single audio track with multiple voices into individual voice tracks, making it easy to isolate which speaker is saying what.
Previous models were all rather lack luster, and usually behind some kind of pay wall, but the Nemotron 3 Diarization model is both open source and has a 25% lower error rate than the next best model on Diarization Bench.
This is great for things like podcast transcriptions, allowing you to break it into individual tracks and sort your data into who said what and when, which can be very beneficial when passing information to an LLM, since it does not have native audio listen capabilities on its own (unless you are using a Gemini model).
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
Code art generation by Opus 5.5 from owl on TwitterNota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
resumo
- Opus e Sonnet 5.5
- GPT 6.1 Sol e 6 Luna
- Resumo do OpenAI Dev Day
Nota
Desculpem por não ter havido notícias de IA na semana passada; eu estava acampando na floresta, então fiquei completamente por fora de todos os novos modelos e notícias que saíram durante a semana. Isso, somado a todos os novos modelos lançados esta semana, vai render a maior edição de notícias de IA até agora. Vou viajar de novo neste fim de semana, então estou escrevendo isto na tarde de quinta-feira; espero que nada importante aconteça depois de hoje.
Notícias
OpenAI Dev Day
A OpenAI realizou seu Dev Day anual nesta semana, onde anunciou várias coisas; aqui estão alguns dos destaques.
Dots, um assistente pessoal de IA que pretende competir com OpenClaw, Meta Muse e GrokBot.
Parece bastante semelhante à concorrência em termos de capacidade, o que faz sentido, já que a OpenAI já é dona do OpenClaw.
Ele funciona diretamente com sua assinatura e, nas primeiras semanas, tem uso efetivamente infinito.
Decisions API: concorrente do Jev da OpenAI. Ela usa o GPT-6 Luna por baixo para realizar classificação zero-shot, tornando-a mais cara que o Jev (cerca de 2x o preço para tokens de entrada, e você também precisa pagar pelos tokens de saída), mas com o benefício de conseguir lidar com entradas multimodais.
Eles não divulgaram nenhum benchmark junto com ela (sinal de alerta), o que, somado aos custos mais altos, faz com que eu passe por enquanto.
Um novo plano de assinatura por US$ 500 por mês.
Ele basicamente só dá acesso a mais uso (sem precisar ficar alternando entre tantas contas), com o único recurso notável sendo o acesso ao UltraFast, que oferece velocidades de inferência 5-10x mais rápidas para o Astra (300 tokens por segundo), mas com custo/uso de limite de taxa 6x maior.
Entrar com ChatGPT.
Agora desenvolvedores podem adicionar uma opção de entrar com ChatGPT aos seus sites e, quando um usuário fizer isso, ele poderá usar sua assinatura naquele site, levando sua assinatura para onde quer que vá.
A OpenAI parece estar adotando uma postura oposta à da Anthropic, que está fechando o ecossistema ao redor de seus modelos e de onde eles podem ser usados.
A OpenAI também anunciou que usuários empresariais podem usar modelos open source de terceiros por meio de sua parceira BaseTen.
Isso significa que empresas terão acesso a modelos como GLM 5.3 e Kimi K3 por meio de seus acordos com a OpenAI.
Isso também é um afastamento enorme da Anthropic, que justamente nesta semana chamou o GLM 5.3 de modelo perigoso devido à falta de guardrails.
Todos esses anúncios provavelmente terão menos efeito sobre você do que este último, que eles estavam escondendo durante o Dev Day: os limites de taxa (em termos de dólares de API) no plano de assinatura serão cortados pela metade.
Eles dizem que isso se deve à queda drástica nos preços de API dos seus modelos. Por exemplo, Sol e Luna tiveram uma redução de preço de 50% na semana passada, então o uso desses modelos vai parecer igual.
A principal forma como você vai notar isso é no uso do Astra, já que ele não teve nenhum corte de preço, então vai parecer que você pode usá-lo metade do tempo.
Lançamentos
Opus 5.5
O grande lançamento da Anthropic de 2 semanas atrás foi o Opus 5.5.

Os dois últimos modelos Opus foram um pouco sem graça, com o último grande modelo Opus sendo o 4.6.
O Opus 5.5 quebra essa tendência, já que este modelo parece ser de verdade agora, e não apenas um modelo que mexe o ponteiro dos benchmarks.
O que se destaca neste modelo é seu gosto artístico.
Há muitos exemplos no Twitter dele usando javascript para criar arte ou montando um videoclipe único e interessante para uma música.
Vídeo de NotinReality no Twitter
Os problemas com os modelos Claude anteriores eram a falta de confiabilidade e o excesso de zelo nas tarefas. Eles frequentemente pulavam coisas que você gostaria que tivessem feito, ou iam lá e adicionavam recursos ou complexidade extras que você não pediu.
A Anthropic corrigiu essa grande variedade de resultados, tornando-o muito mais utilizável no dia a dia.
Eles também reduziram o preço em 20% em comparação com versões anteriores do Opus, e diminuíram drasticamente o número de tokens de raciocínio que ele usa, especialmente em níveis de raciocínio mais baixos (baixo, médio e alto), tornando-o ainda mais barato do que a redução no preço de tabela sugeriria.
| Modelo | US$ por milhão (entrada) | US$ por milhão (saída) | Tokens por segundo |
|---|
| Claude Opus 5.5 | $4 | $20 | 68 |
| Claude Opus 5 | $5 | $25 | 69 |
| Claude Sonnet 5.5 | $2 | $10 | 84 |
| GPT 6.1 Sol | $2 | $10 | 31 |
| GPT 6 Luna | $0.10 | $0.50 | 35 |
| GPT 6 Astra | $10 | $50 | 35 |
| Claude Fable 5.1 | $10 | $50 | 40 |
| GLM 5.3 | $1.40 | $4.40 | 47 |
Os modelos da Anthropic sempre foram melhores em inferir a intenção do seu prompt em comparação com os modelos da OpenAI, e também tendem a escrever código de alta qualidade, mas faltava uma boa opção para usar, já que o Fable consome limites rapidamente e você só pode usá-lo em até 50% da cota da sua assinatura.
O Opus 5.5 está trazendo pessoas de volta para o Claude vindas do Codex e da OpenAI, já que muita gente tinha migrado para longe depois de tantos lançamentos sem graça da Anthropic. Ainda não tive muito tempo com o modelo, mas certamente vou tirar a poeira da minha assinatura do Claude Code para experimentar mais este modelo nas próximas semanas.
Novos modelos GPT
GPT 6 Sol e Luna
Vamos começar com os modelos de 2 semanas atrás que eu não consegui cobrir.
GPT-6 Sol e Luna são principalmente atualizações dos modelos 5.6.
Com o lançamento do GPT-6, o Terra foi totalmente descartado, restando apenas Sol, Luna e Astra, e muitas pessoas pareciam achar que o GPT-6 Sol era apenas um Terra rebatizado, mas isso agora é irrelevante com o lançamento do 6.1 Sol, sobre o qual falaremos em instantes.

Notavelmente, tanto Sol quanto Luna tiveram reduções drásticas de preço de 50%, além de melhorias no uso de tokens, tornando-os ainda mais acessíveis do que já eram antes, com o Luna agora custando 1/100 do preço do Astra.
Não falamos muito sobre o Luna fora do lançamento inicial, mas ele acabou se revelando um dos melhores modelos em relação preço/desempenho no mercado atualmente. Agora ele é o modelo padrão que uso em sistemas agentic, pois é rápido, barato e razoavelmente inteligente.
GPT 6.1 Sol
O desempenho inicial ruim do GPT-6 Sol foi rapidamente corrigido com a versão 6.1.
Este modelo parece muito mais com o que esperávamos que o GPT-6 Sol fosse, com benchmarks rivalizando com o Astra por 1/5 do preço.

Como esperado, o modelo está por volta do nível do Astra, sendo difícil distinguir entre os dois.
Comparado ao Opus 5.5, a falta de gosto e o seguimento de instruções mais rígido ficam aparentes, e vi muitas pessoas que testaram ambos decidirem usar o Opus 5.5 em vez do Sol 6.1 como modelo diário.
Uma das grandes coisas que notei nele esta semana é sua falta de velocidade.
Ao torná-lo mais barato, muito mais pessoas começaram a usá-lo, e eles não conseguiram escalar o suficiente para atender à demanda.
Mesmo sendo bastante eficiente em tokens, rodar a 20 tokens por segundo significa que a maioria dos prompts ainda leva 5-10 minutos para ser concluída, enquanto o Opus 5.5 roda por volta de 70 tokens por segundo, tornando-o mais de 3x mais rápido.
Eu ainda o consideraria um modelo muito bom, e o colocaria logo abaixo do Opus 5.5 como o melhor modelo para uso diário neste momento.
Notas rápidas
Gemini 4 Argon
O Google viu a Anthropic e a OpenAI lançando modelos e quis entrar na onda também, mas o modelo deles é só mais do mesmo velho besteirol do Gemini.

O modelo se sai bem em benchmarks, mas no mundo real sua inteligência é muito irregular e desagradável de usar.
A partir de conversas vazadas de dentro da equipe do Gemini, por admissão deles mesmos, o modelo está atrás em programação quando comparado às ofertas da Anthropic e da OpenAI.
A US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída, ele também não está nem um pouco na fronteira de custo/inteligência, tornando fácil deixá-lo passar.
Sonnet 5.5
Sonnet 5.5 é outro sopro de ar fresco para os modelos Sonnet, semelhante ao Opus 5.5.

Em termos de capacidade, ele é bastante semelhante ao Opus, com maior uso de tokens, tornando-o cerca de 30% mais barato no mundo real no mesmo nível de raciocínio que o Opus.
A principal forma de descrever a diferença entre Opus e Sonnet 5.5 é que o Opus tem sabedoria, que vem de ser um modelo maior, enquanto o Sonnet não tem.
Isso significa que o Opus será melhor em planejamento e tomada de decisão em comparação com o Sonnet.
Dada a redução de preço do Opus e suas capacidades melhores, acho difícil recomendar o Sonnet, a menos que você esteja realmente tentando maximizar seu uso do Claude Code (eu usaria o Opus como agente de planejamento e o Sonnet como implementador).
Para a maioria das pessoas, porém, eu simplesmente recomendaria usar o Opus e guardar o Sonnet para suas tarefas mais fáceis.
Também fez parte deste anúncio que o Haiku vai voltar no futuro (ele não é atualizado há quase 2 anos), e acho que Opus 5.5 e Haiku 5.5 serão a melhor combinação para usar em conjunto, fazendo o Sonnet parecer ainda mais irrelevante.
Nemotron 3 Diarization
Em meio a todos esses lançamentos de LLMs, queria mencionar rapidamente que temos um novo modelo SOTA de diarização da Nvidia.
Modelos de diarização dividem uma única faixa de áudio com múltiplas vozes em faixas de voz individuais, tornando fácil isolar qual falante está dizendo o quê.
Os modelos anteriores eram todos bastante sem graça e geralmente ficavam atrás de algum tipo de paywall, mas o modelo Nemotron 3 Diarization é open source e tem uma taxa de erro 25% menor que o próximo melhor modelo no Diarization Bench.
Isso é ótimo para coisas como transcrições de podcasts, permitindo que você divida em faixas individuais e organize seus dados por quem disse o quê e quando, o que pode ser muito benéfico ao passar informações para um LLM, já que ele não tem capacidades nativas de ouvir áudio por conta própria (a menos que você esteja usando um modelo Gemini).
Final
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, entre na nossa lista de e-mails abaixo.
Geração de arte por código pelo Opus 5.5 de owl no TwitterNota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Nota
Perdón por no haber tenido noticias de IA la semana pasada; estaba acampando en el bosque, así que estuve completamente desconectado de todos los nuevos modelos y noticias que salieron durante la semana. Eso, sumado a todos los nuevos modelos lanzados esta semana, hará que esta sea la mayor entrega de noticias de IA hasta ahora. Este fin de semana vuelvo a irme de viaje, así que estoy escribiendo esto el jueves por la tarde; esperemos que no pase nada más importante después de hoy.
Noticias
OpenAI Dev Day
OpenAI tuvo esta semana su Dev Day anual, donde anunció varias cosas; estos son algunos de los puntos destacados.
Dots, un asistente personal de IA pensado para competir con OpenClaw, Meta Muse y GrokBot.
En cuanto a capacidades, parece bastante similar a la competencia, lo cual tiene sentido, ya que OpenAI ya es dueña de OpenClaw.
Funciona directamente con tu suscripción y, durante las primeras semanas, tiene uso efectivamente infinito.
Decisions API: el competidor de Jev de OpenAI. Usa GPT-6 Luna por debajo para realizar clasificación zero-shot, lo que lo hace más caro que Jev (aproximadamente el doble de precio para tokens de entrada, y también tienes que pagar por tokens de salida), pero con la ventaja de poder manejar entradas multimodales.
No publicaron benchmarks con esto (mala señal), lo cual, sumado a los costos más altos, hace que por ahora lo descarte.
Un nuevo plan de suscripción por $500 al mes.
Principalmente te da acceso a más uso (sin necesidad de hacer malabares con tantas cuentas), con la única función destacable siendo el acceso a UltraFast, que ofrece velocidades de inferencia entre 5 y 10 veces más rápidas para Astra (300 tokens por segundo), pero con un costo/uso de límite de tasa 6 veces mayor.
Iniciar sesión con ChatGPT.
Los desarrolladores ahora pueden añadir a sus sitios una opción de inicio de sesión con ChatGPT y, cuando un usuario lo haga, podrá usar su suscripción en ese sitio, llevándose su suscripción adonde vaya.
OpenAI parece estar adoptando la postura opuesta a Anthropic, que está cerrando el ecosistema alrededor de sus modelos y los lugares donde pueden usarse.
OpenAI también anunció que los usuarios enterprise pueden usar modelos open source de terceros a través de su socio BaseTen.
Esto significa que las empresas tendrán acceso a modelos como GLM 5.3 y Kimi K3 mediante sus acuerdos con OpenAI.
Esto también supone un gran alejamiento de Anthropic, que justo esta semana calificó a GLM 5.3 como un modelo peligroso debido a su falta de guardrails.
Probablemente todos estos anuncios tengan menos efecto en ti que este último que estaban ocultando durante Dev Day: los límites de tasa (en términos de dólares de API) del plan de suscripción se están reduciendo a la mitad.
Dicen que esto se debe a que los precios de API de sus modelos han bajado drásticamente. Por ejemplo, Sol y Luna tuvieron una reducción de precio del 50% la semana pasada, así que tu uso de esos modelos se sentirá igual.
La principal forma en que lo notarás será con el uso de Astra, ya que ese modelo no ha tenido recortes de precio, por lo que se sentirá como si pudieras usarlo la mitad.
Lanzamientos
Opus 5.5
El gran lanzamiento de Anthropic de hace 2 semanas fue Opus 5.5.

Los últimos modelos Opus habían sido algo decepcionantes, siendo Opus 4.6 el último gran modelo Opus.
Opus 5.5 rompe con esa tendencia, ya que este modelo parece ser de verdad y no solo un modelo que mueve la aguja de los benchmarks.
Lo que destaca de este modelo es su gusto artístico.
Hay muchos ejemplos en Twitter de cómo usa JavaScript para hacer arte o arma un videoclip único e interesante para una canción.
Video de NotinReality en Twitter
Los problemas con los modelos Claude anteriores eran la falta de fiabilidad y el exceso de celo en las tareas. A menudo omitían cosas que habrías querido que hicieran, o añadían funciones adicionales o complejidad que no habías pedido.
Anthropic ha corregido esta amplia variabilidad en los resultados, haciéndolo mucho más usable en el día a día.
También han reducido su precio un 20% en comparación con versiones anteriores de Opus, y han reducido drásticamente la cantidad de tokens de razonamiento que usa, especialmente en niveles de razonamiento más bajos (low, medium y high), lo que lo hace incluso más barato de lo que implicaría la reducción del precio anunciado.
| Modelo | $ por millón (entrada) | $ por millón (salida) | Tokens por segundo |
|---|
| Claude Opus 5.5 | $4 | $20 | 68 |
| Claude Opus 5 | $5 | $25 | 69 |
| Claude Sonnet 5.5 | $2 | $10 | 84 |
| GPT 6.1 Sol | $2 | $10 | 31 |
| GPT 6 Luna | $0.10 | $0.50 | 35 |
| GPT 6 Astra | $10 | $50 | 35 |
| Claude Fable 5.1 | $10 | $50 | 40 |
| GLM 5.3 | $1.40 | $4.40 | 47 |
Los modelos de Anthropic siempre han sido mejores para inferir la intención de tu prompt que los modelos de OpenAI, y también tienden a escribir código de alta calidad, pero les ha faltado una buena opción para usar, ya que Fable consume los límites muy rápido y solo puedes usarlo hasta el 50% de tu cuota de suscripción.
Opus 5.5 está trayendo a la gente de vuelta a Claude desde Codex y OpenAI, ya que muchas personas se habían ido tras tantos lanzamientos flojos de Anthropic. Todavía no he tenido demasiado tiempo con el modelo, pero sin duda voy a desempolvar mi suscripción de Claude Code para probarlo más en las próximas semanas.
Nuevos modelos GPT
GPT 6 Sol y Luna
Empezaremos con los modelos de hace 2 semanas que no pude cubrir.
GPT-6 Sol y Luna son principalmente actualizaciones de los modelos 5.6.
Con el lanzamiento de GPT-6, Terra desapareció por completo, quedando solo Sol, Luna y Astra, y muchas personas parecían pensar que GPT-6 Sol era simplemente Terra rebautizado, pero eso ahora ya no importa con el lanzamiento de Sol 6.1, del que hablaremos en un momento.

Cabe destacar que tanto Sol como Luna tuvieron reducciones drásticas de precio del 50%, además de mejoras en el uso de tokens, lo que los hace aún más asequibles que antes, con Luna costando ahora 1/100 del precio de Astra.
No hemos hablado mucho de Luna fuera de su lanzamiento inicial, pero ha resultado ser uno de los mejores modelos del mercado en relación precio-rendimiento ahora mismo. Ahora es el modelo predeterminado que uso en sistemas agénticos, ya que es rápido, barato y bastante inteligente.
GPT 6.1 Sol
El pobre rendimiento inicial de GPT-6 Sol se corrigió rápidamente con la versión 6.1.
Este modelo se siente mucho más como lo que esperábamos que fuera GPT-6 Sol, con benchmarks que rivalizan con Astra a una quinta parte del precio.

Como era de esperar, el modelo está alrededor del nivel de Astra, y cuesta distinguir entre los dos.
Comparado con Opus 5.5, se vuelve evidente su falta de gusto y su seguimiento de instrucciones más rígido, y he visto a muchas personas que probaron ambos decidir usar Opus 5.5 en lugar de Sol 6.1 como modelo diario.
Una de las cosas importantes que he notado esta semana es su falta de velocidad.
Al hacerlo más barato, mucha más gente empezó a usarlo, y no han conseguido escalar lo suficiente para cubrir la demanda.
Aunque es bastante eficiente en tokens, funcionar a 20 tokens por segundo significa que la mayoría de los prompts siguen tardando entre 5 y 10 minutos en completarse, mientras que Opus 5.5 funciona alrededor de 70 tokens por segundo, lo que lo hace más de 3 veces más rápido.
Aun así, lo consideraría un muy buen modelo, y lo colocaría justo por debajo de Opus 5.5 como el mejor modelo para usar día a día ahora mismo.
Apuntes rápidos
Gemini 4 Argon
Google vio a Anthropic y OpenAI lanzar modelos y quiso sumarse también a la acción, pero su modelo es más de la misma vieja basura de Gemini.

El modelo tiene buenos benchmarks, pero en el mundo real su inteligencia es muy irregular y desagradable de usar.
Según conversaciones filtradas desde dentro del equipo de Gemini, ellos mismos admiten que el modelo está por detrás de las ofertas de Anthropic y OpenAI en programación.
A $4 por millón de tokens de entrada y $20 por tokens de salida, tampoco está en absoluto en la frontera costo/inteligencia, así que es fácil descartarlo.
Sonnet 5.5
Sonnet 5.5 es otro soplo de aire fresco para los modelos Sonnet, similar a Opus 5.5.

En cuanto a capacidades, es bastante similar a Opus, con mayor uso de tokens, lo que lo hace aproximadamente 30% más barato en el mundo real al mismo nivel de razonamiento que Opus.
La principal forma de describir la diferencia entre Opus y Sonnet 5.5 es que Opus tiene una sabiduría que viene de ser un modelo más grande y que Sonnet no tiene.
Esto significa que Opus será mejor en planificación y toma de decisiones que Sonnet.
Dada la reducción de precio de Opus y sus mejores capacidades, me cuesta recomendar Sonnet a menos que de verdad estés intentando maximizar tu uso de Claude Code (yo usaría Opus como agente de planificación y Sonnet como implementador).
Para la mayoría de la gente, sin embargo, simplemente recomendaría usar Opus y reservar Sonnet para las tareas más fáciles.
También como parte de este anuncio se dijo que Haiku va a volver en el futuro (no se ha actualizado en casi 2 años), y creo que Opus 5.5 y Haiku 5.5 serán la mejor combinación para usar juntos, lo que hará que Sonnet se sienta aún más irrelevante.
Nemotron 3 Diarization
Entre todos estos lanzamientos de LLMs, quería mencionar brevemente que tenemos un nuevo modelo SOTA de diarización de Nvidia.
Los modelos de diarización separan una única pista de audio con varias voces en pistas de voz individuales, haciendo fácil aislar qué hablante dice qué.
Los modelos anteriores eran todos bastante decepcionantes y normalmente estaban detrás de algún tipo de paywall, pero el modelo Nemotron 3 Diarization es open source y tiene una tasa de error un 25% menor que el siguiente mejor modelo en Diarization Bench.
Esto es excelente para cosas como transcripciones de podcasts, ya que permite separarlas en pistas individuales y organizar los datos según quién dijo qué y cuándo, lo cual puede ser muy útil al pasar información a un LLM, dado que no tiene capacidades nativas para escuchar audio por sí solo (a menos que estés usando un modelo Gemini).
Cierre
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo abajo.
Generación de arte con código por Opus 5.5 de owl en Twitter