News
Opus 5 Update
Last week I said that Opus 5 was comparable to Fable 5 and GPT 5.6 Sol based on the limited testing the community and I were able to do in the few hours before I wrote the news.
Upon further testing from both myself and many members of the community, I am revoking this claim.
Opus 5 is a smart model; the issue is that it is unreliable.
There have been many cases where its overeagerness has caused it to implement far more than is needed for a given task, leading to technical debt compounding even faster than normal in an LLM-written codebase.
It also has the inverse issue, where it is not thorough with its changes, making a fix in a single specified instance but not implementing it across the codebase, requiring multiple passes or leaving hidden bugs that you or your customer will find out about later.
It also can get stuck on tasks or focus on small parts of them, losing sight of the bigger picture, wasting thousands of tokens in the process while making little progress on the task that you actually care about.
Talking with the community during AI Tools Club, this feeling of Opus 5’s inadequacy was almost universal, with all users of the model reporting issues with it and the desire to revert back to Fable, GPT 5.6, or an older Opus model, (4.6 or 4.8).
Because of this I no longer recommend using Opus 5, and instead use one of the models above.
Releases
DeepSeek V4 Flash 0726
The DeepSeek V4 preview models had a lot of potential, but lacked proper post-training, causing them to be fairly useless in the real world.
DeepSeek is back now, with a much improved post-training pipeline, and have released a new version of their smaller (~230 billion parameter) Flash model.
While not being the best model, it is extremely good for coding tasks, especially at its price point.
Frontend code arena shows that it can make apps that work and look good, which is about all you can ask for from a small model
| Model | $ per million (input) | $ per million (output) | Tokens per second |
|---|
| DeepSeek V4 Flash | $0.09 | $0.18 | 106 |
| Kimi K3 | $3 | $15 | 27 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
| GPT 5.6 Luna | $0.2 | $1.20 | 73 |
Its cached input token cost ratio is 10x better than the other models (10x vs 100x cheaper for cached input tokens).
These are the majority of tokens that you use in agentic scenarios, so you can expect to save even more than the sticker price would entail.
It is an extremely capable small model, and you can get far for very little, competing with and even beating GPT 5.6 Luna (which also got an 80% price decrease this week) on the cost-to-performance frontier.
If you were to run this model at 100 tokens per second for 24 hours straight, it would only cost $1.55, or only 6.5 cents per hour.
If you are looking to optimize your costs, this is a competitive model.
I cannot wait to see what they do with the larger DeepSeek V4 model in the coming weeks.
Quick Hits
Codex Security CLI
Last week Huggingface got hacked by OpenAI models, but couldn’t use OpenAI models to help diagnose what happened and defend themselves.
This highlighted a power imbalance that favored the attacker, so to help level the playing field and get users access to models to help cybersecurity defense, OpenAI has released the Codex Security CLI.
The CLI allows you to scan your repositories for vulnerabilities.
It is not a full-featured terminal app where you can prompt the model; instead, you pass in a knowledge base path for the model to understand what your codebase is meant for.
It works with your regular ChatGPT subscription, but you will need to verify your identity to be able to use it.
It is not a full fix for the issues that we will experience as defenders against cyber attacks, but it is a start and it is good to see that OpenAI is taking it seriously (unlike Anthropic).
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
From Pixel Symphony on TwitterNota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
Notícias
Atualização do Opus 5
Na semana passada, eu disse que o Opus 5 era comparável ao Fable 5 e ao GPT 5.6 Sol com base nos testes limitados que a comunidade e eu conseguimos fazer nas poucas horas antes de eu escrever as notícias.
Depois de mais testes, tanto meus quanto de muitos membros da comunidade, estou retirando essa afirmação.
O Opus 5 é um modelo inteligente; o problema é que ele é pouco confiável.
Houve muitos casos em que seu excesso de iniciativa fez com que ele implementasse muito mais do que era necessário para uma determinada tarefa, fazendo a dívida técnica se acumular ainda mais rápido do que o normal em uma base de código escrita por LLM.
Ele também tem o problema inverso, em que não é minucioso nas alterações: faz uma correção em uma única instância especificada, mas não a implementa em toda a base de código, o que exige várias passagens ou deixa bugs ocultos que você ou seu cliente descobrirão depois.
Ele também pode ficar travado em tarefas ou se concentrar em pequenas partes delas, perdendo de vista o panorama geral e desperdiçando milhares de tokens no processo, enquanto faz pouco progresso na tarefa que realmente importa para você.
Conversando com a comunidade durante o AI Tools Club, essa sensação de inadequação do Opus 5 foi quase universal, com todos os usuários do modelo relatando problemas com ele e o desejo de voltar para o Fable, GPT 5.6 ou um modelo Opus mais antigo, (4.6 ou 4.8).
Por causa disso, eu não recomendo mais usar o Opus 5; em vez disso, use um dos modelos acima.
Lançamentos
DeepSeek V4 Flash 0726
Os modelos DeepSeek V4 preview tinham muito potencial, mas careciam de pós-treinamento adequado, o que os tornava bastante inúteis no mundo real.
A DeepSeek voltou agora, com um pipeline de pós-treinamento muito melhor, e lançou uma nova versão de seu modelo menor (~230 bilhões de parâmetros) Flash.
Embora não seja o melhor modelo, ele é extremamente bom para tarefas de programação, especialmente considerando seu preço.
A Frontend code arena mostra que ele consegue criar apps que funcionam e têm boa aparência, que é praticamente tudo o que se pode pedir de um modelo pequeno
| Modelo | US$ por milhão (entrada) | US$ por milhão (saída) | Tokens por segundo |
|---|
| DeepSeek V4 Flash | $0.09 | $0.18 | 106 |
| Kimi K3 | $3 | $15 | 27 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
| GPT 5.6 Luna | $0.2 | $1.20 | 73 |
Sua proporção de custo de tokens de entrada em cache é 10x melhor do que a dos outros modelos (10x vs 100x mais barato para tokens de entrada em cache).
Esses são a maioria dos tokens que você usa em cenários agênticos, então você pode esperar economizar ainda mais do que o preço de tabela sugere.
É um modelo pequeno extremamente capaz, e você pode avançar bastante por muito pouco, competindo com e até superando o GPT 5.6 Luna (que também teve uma redução de preço de 80% esta semana) na fronteira de custo-benefício.
Se você quer otimizar seus custos, este é um modelo competitivo em custo.
Mal posso esperar para ver o que eles farão com o modelo DeepSeek V4 maior.
Notas Rápidas
Codex Security CLI
Na semana passada, a Huggingface foi hackeada por modelos da OpenAI, mas não pôde usar modelos da OpenAI para ajudar a diagnosticar o que aconteceu e se defender.
Isso destacou um desequilíbrio de poder que favorecia o atacante. Assim, para ajudar a equilibrar o jogo e dar aos usuários acesso a modelos que auxiliem na defesa de cibersegurança, a OpenAI lançou a Codex Security CLI.
A CLI permite que você escaneie seus repositórios em busca de vulnerabilidades.
Ela não é um app de terminal completo em que você pode dar prompts ao modelo; em vez disso, você informa um caminho para uma base de conhecimento para que o modelo entenda para que serve sua base de código.
Ela funciona com sua assinatura normal do ChatGPT, mas você precisará verificar sua identidade para poder usá-la.
Isso não é uma solução completa para os problemas que enfrentaremos como defensores contra ataques cibernéticos, mas é um começo, e é bom ver que a OpenAI está levando isso a sério (ao contrário da Anthropic).
Encerramento
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, não deixe de entrar na nossa lista de emails abaixo.
De Pixel Symphony no TwitterNota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Noticias
Actualización de Opus 5
La semana pasada dije que Opus 5 era comparable con Fable 5 y GPT 5.6 Sol, según las pruebas limitadas que la comunidad y yo pudimos hacer en las pocas horas antes de que escribiera las noticias.
Tras más pruebas, tanto mías como de muchos miembros de la comunidad, retiro esa afirmación.
Opus 5 es un modelo inteligente; el problema es que es poco fiable.
Ha habido muchos casos en los que su exceso de entusiasmo lo ha llevado a implementar mucho más de lo necesario para una tarea dada, lo que causa que la deuda técnica se acumule incluso más rápido de lo normal en una base de código escrita por un LLM.
También tiene el problema inverso: no es minucioso con sus cambios. Hace una corrección en una sola instancia especificada, pero no la implementa en toda la base de código. Esto exige varias pasadas o deja errores ocultos que tú o tu cliente descubrirán más tarde.
También puede quedarse atascado en tareas o centrarse en partes pequeñas de ellas, perder de vista el panorama general y malgastar miles de tokens en el proceso mientras avanza poco en la tarea que realmente te importa.
Al hablar con la comunidad durante AI Tools Club, esta sensación de que Opus 5 no está a la altura fue casi universal. Todos los usuarios del modelo informaron problemas con él y el deseo de volver a Fable, GPT 5.6 o un modelo Opus anterior, (4.6 o 4.8).
Por esto, ya no recomiendo usar Opus 5. En su lugar, usa uno de los modelos anteriores.
Lanzamientos
DeepSeek V4 Flash 0726
Los modelos de vista previa de DeepSeek V4 tenían mucho potencial, pero carecían de un postentrenamiento adecuado, lo que los hacía bastante inútiles en el mundo real.
DeepSeek ha vuelto ahora, con una canalización de postentrenamiento mucho mejor, y ha lanzado una nueva versión de su modelo Flash más pequeño (~230 mil millones de parámetros).
Aunque no es el mejor modelo, es extremadamente bueno para tareas de programación, en especial por su precio.
Frontend code arena muestra que puede crear apps que funcionan y se ven bien, que es casi todo lo que se le puede pedir a un modelo pequeño
| Modelo | $ por millón (entrada) | $ por millón (salida) | Tokens por segundo |
|---|
| DeepSeek V4 Flash | $0.09 | $0.18 | 106 |
| Kimi K3 | $3 | $15 | 27 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
| GPT 5.6 Luna | $0.2 | $1.20 | 73 |
Su relación de coste para tokens de entrada en caché es 10 veces mejor que la de los otros modelos (10x frente a 100x más barato para tokens de entrada en caché).
Estos son la mayoría de los tokens que usas en escenarios agénticos, así que puedes esperar ahorrar incluso más de lo que indica el precio publicado.
Es un modelo pequeño extremadamente capaz, y puedes llegar lejos por muy poco, compitiendo con GPT 5.6 Luna e incluso superándolo (que también recibió una reducción de precio del 80% esta semana) en la frontera de coste-rendimiento.
Si quieres optimizar tus costes, este es un modelo competitivo en precio.
Tengo muchas ganas de ver qué hacen con el modelo DeepSeek V4 más grande.
Notas rápidas
Codex Security CLI
La semana pasada, Huggingface fue hackeado por modelos de OpenAI, pero no pudo usar modelos de OpenAI para ayudar a diagnosticar qué ocurrió y defenderse.
Esto puso de manifiesto un desequilibrio de poder que favorecía al atacante. Por eso, para ayudar a nivelar el terreno y dar a los usuarios acceso a modelos que ayuden en la defensa de ciberseguridad, OpenAI ha lanzado Codex Security CLI.
La CLI te permite escanear tus repositorios en busca de vulnerabilidades.
No es una app de terminal con todas las funciones en la que puedas escribir prompts al modelo; en su lugar, le pasas una ruta a una base de conocimiento para que el modelo entienda para qué está diseñada tu base de código.
Funciona con tu suscripción normal de ChatGPT, pero tendrás que verificar tu identidad para poder usarla.
No es una solución completa para los problemas que tendremos como defensores frente a ciberataques, pero es un comienzo, y es bueno ver que OpenAI se lo toma en serio (a diferencia de Anthropic).
Final
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo a continuación.
De Pixel Symphony en Twitter