Releases
DeepSeek V4 Pro
A few weeks ago DeepSeek released the updated version of the V4 Flash model, which included much better post training versus its predecessor, making it one of the best low cost options for day to day LLM tasks.
Their DeepSeek V4 Pro update aims to be a competitor at the top along side GPT 5.6 and Fable, and not just the value king.

Compared to the impressive amount of intelligence that was packed into the V4 Flash model, V4 Pro is a bit of a flop.
On Artificial Analysis it barely scores better than Flash, while being ~2.5x more expensive.
Like Flash, it is not multimodal, something that the model itself does not like.
In the real world, it seems to do better at handling the planning for longer duration agentic tasks, but its actual coding performance is not that much different.
Further hindering the model is the pricing increases they are enacting (about 3x for Flash and 4x for Pro).
This puts them squarely in competition with GPT 5.6 Luna and Terra pricing wise, once factoring in the increased number of tokens that the DeepSeek models use on average.

| Model | $ per million (input) | $ per million (output) | Tokens per second |
|---|
| DeepSeek V4 Pro | $1.32 | $3.96 | 55 |
| DeepSeek V4 Flash | $0.44 | $1.32 | 82 |
| Grok 4.6 | $2 | $6 | 57 |
| Claude Fable 5 | $10 | $50 | 40 |
| Claude Opus 4.8 | $5 | $25 | 60 |
| GPT 5.6 Sol | $5 | $30 | 45 |
| GPT 5.6 Terra | $2.50 | $15 | 63 |
| GPT 5.6 Luna | $1 | $6 | 84 |
| Kimi K3 | $3 | $15 | 27 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
There is a silver lining with this however.
Flash was most likely distilled from an early version of the Pro model, and the relative parity it has with Pro means that DeepSeek is probably the best in the world at distilling their models down to a smaller size, and is part of why this release is so underwhelming.
If this continues long term, this means that DeepSeek will be able to compact frontier level intelligence down into smaller and cheaper models that we will be able to use and potentially run at home ourselves.
I’d skip V4 Pro right now. If you need a cheap model, look at V4 Flash, but Pro sits in the mushy middle where it is neither the cheapest nor the smartest, making it hard for me to recommend.
Grok 4.6
After a long time in the “meh” category of models, it seems like Grok is finally making a name for itself with iteration 4.6.

For day to day coding tasks, from what I’ve seen, it seems to be on part with GPT 5.6 Sol and Fable, and the initial vibes seem to place it above most of the Chinese models, probably around the Kimi K3 level or better.
For large scale tasks and raw reasoning capability it falls behind the frontier models, so it is not a fully replacement for GPT 5.6 and Fable, but for most people this is probably not an issue.
Similar to its predecessor, many people have talked about how snappy the model feels to use when compared to the competition, especially when using the “low” reasoning setting.
Its also very impressive to see the speed that the SpaceXAI team is iterating at right now.
Grok 4.5 was released one month prior, and they have already announced that Grok 4.7 will be released in month.
This is fast even for the breakneck speeds in the AI world right now, as most other labs take 2-3 months for new models to be released.
Grok 4.6 is not a must use right now, but I would recommend checking it out if you have the chance to see how it works with what you do, with the expectation that we will be seeing more from them in the near future.
Quick Hits
Qwen 3.8 27B
The Qwen 3.6 series has been the go-to for people trying to run LLMs on local consumer hardware, and the latest Qwen 3.8 model perpetuates this.
The 27B model is a multimodal dense model, meaning that you will probably want a dedicated GPU to run it (sorry Mac users, although the mixture of experts variant is rumored to be coming out soon as well).

I haven’t had much time to test it yet (why have labs started releasing models on Fridays?), but the initial vibe seems to be a fairly decent jumpp in agentic capabilities, but the limits for this have yet to be explored, for instance if it can replace DeepSeek V4 Flash as a capable subagent.
Of note, it has variable reasoning modes (from low to xhigh) similar to most other modern reasoning models.
On the xhigh setting, it uses substantially more tokens than its predecessor, so be wary of that.
If you are running local models, you are most likely already using Qwen, and this seems to be a safe upgrade.
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
DeepSeek V4 Pro self portrait — From xule on Twitter using Midjourney v8.2Nota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
Lançamentos
DeepSeek V4 Pro
Há algumas semanas, a DeepSeek lançou a versão atualizada do modelo V4 Flash, que incluiu um pós-treinamento muito melhor em comparação com seu antecessor, tornando-o uma das melhores opções de baixo custo para tarefas diárias com LLMs.
A atualização DeepSeek V4 Pro busca competir no topo, ao lado de GPT 5.6 e Fable, e não ser somente o rei do custo-benefício.

Comparado com a quantidade impressionante de inteligência que foi colocada no modelo V4 Flash, o V4 Pro é um pouco decepcionante.
No Artificial Analysis, ele pontua só um pouco melhor que o Flash, embora seja cerca de 2,5x mais caro.
Assim como o Flash, ele não é multimodal, algo de que o próprio modelo não gosta.
No mundo real, ele parece lidar melhor com o planejamento de tarefas agênticas de maior duração, mas seu desempenho real em programação não é tão diferente assim.
Outro fator que prejudica o modelo são os aumentos de preço que eles estão implementando (cerca de 3x para o Flash e 4x para o Pro).
Isso os coloca em competição direta com os preços do GPT 5.6 Luna e Terra, quando se considera o número maior de tokens que os modelos da DeepSeek usam em média.

| Modelo | US$ por milhão (entrada) | US$ por milhão (saída) | Tokens por segundo |
|---|
| DeepSeek V4 Pro | $1.32 | $3.96 | 55 |
| DeepSeek V4 Flash | $0.44 | $1.32 | 82 |
| Grok 4.6 | $2 | $6 | 57 |
| Claude Fable 5 | $10 | $50 | 40 |
| Claude Opus 4.8 | $5 | $25 | 60 |
| GPT 5.6 Sol | $5 | $30 | 45 |
| GPT 5.6 Terra | $2.50 | $15 | 63 |
| GPT 5.6 Luna | $1 | $6 | 84 |
| Kimi K3 | $3 | $15 | 27 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
Há, porém, um lado positivo nisso.
O Flash provavelmente foi destilado de uma versão inicial do modelo Pro, e a paridade relativa que ele tem com o Pro significa que a DeepSeek provavelmente é a melhor do mundo em destilar seus modelos para um tamanho menor. Isso é parte do motivo pelo qual este lançamento é tão pouco empolgante.
Se isso continuar no longo prazo, significa que a DeepSeek poderá compactar inteligência de nível frontier em modelos menores e mais baratos, que poderemos usar e talvez executar em casa.
Eu pularia o V4 Pro por enquanto. Se você precisa de um modelo barato, veja o V4 Flash, mas o Pro fica no meio indefinido, onde não é nem o mais barato nem o mais inteligente, o que dificulta minha recomendação.
Grok 4.6
Depois de muito tempo na categoria “meh” dos modelos, parece que o Grok finalmente está criando uma reputação com a iteração 4.6.

Para tarefas diárias de programação, pelo que vi, ele parece estar no mesmo nível do GPT 5.6 Sol e do Fable, e as impressões iniciais parecem colocá-lo acima da maioria dos modelos chineses, provavelmente em torno do nível do Kimi K3 ou melhor.
Para tarefas em grande escala e capacidade bruta de raciocínio, ele fica atrás dos modelos frontier, então não é um substituto completo para GPT 5.6 e Fable, mas para a maioria das pessoas isso provavelmente não será um problema.
Assim como seu antecessor, muitas pessoas falaram sobre como o modelo parece ágil em uso quando comparado à concorrência, especialmente ao usar a configuração de raciocínio “low”.
Também é muito impressionante ver a velocidade com que a equipe da SpaceXAI está iterando agora.
O Grok 4.5 foi lançado um mês antes, e eles já anunciaram que o Grok 4.7 será lançado em um mês.
Isso é rápido mesmo para as velocidades vertiginosas do mundo da IA agora, já que a maioria dos outros laboratórios leva 2 a 3 meses para lançar novos modelos.
O Grok 4.6 não é indispensável no momento, mas eu recomendaria testá-lo se você tiver a chance, para ver como ele funciona com o que você faz, com a expectativa de que veremos mais deles no futuro próximo.
Notas Rápidas
Qwen 3.8 27B
A série Qwen 3.6 tem sido a escolha padrão para pessoas que tentam executar LLMs em hardware local de consumo, e o modelo mais recente Qwen 3.8 continua isso.
O modelo 27B é um modelo denso multimodal, o que significa que você provavelmente vai querer uma GPU dedicada para executá-lo (desculpe, usuários de Mac, embora haja rumores de que a variante mixture of experts também será lançada em breve).

Ainda não tive muito tempo para testá-lo (por que os laboratórios começaram a lançar modelos às sextas-feiras?), mas a impressão inicial parece ser a de um salto razoavelmente bom nas capacidades agênticas. Porém, os limites disso ainda precisam ser explorados, por exemplo, se ele pode substituir o DeepSeek V4 Flash como um subagente capaz.
Um ponto importante é que ele tem modos de raciocínio variáveis (de low a xhigh), de forma semelhante à maioria dos outros modelos modernos de raciocínio.
Na configuração xhigh, ele usa substancialmente mais tokens do que seu antecessor, então tenha cuidado com isso.
Se você executa modelos locais, provavelmente já está usando Qwen, e esta parece ser uma atualização segura.
Encerramento
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, entre na nossa lista de emails abaixo.
Autorretrato do DeepSeek V4 Pro — De xule no Twitter usando Midjourney v8.2Nota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Lanzamientos
DeepSeek V4 Pro
Hace unas semanas, DeepSeek lanzó la versión actualizada del modelo V4 Flash, que incluía un post-entrenamiento mucho mejor que su predecesor, lo que lo convirtió en una de las mejores opciones de bajo costo para tareas diarias con LLM.
Su actualización DeepSeek V4 Pro busca competir en la gama alta junto con GPT 5.6 y Fable, y no ser solo el rey del valor.

En comparación con la impresionante cantidad de inteligencia que se incluyó en el modelo V4 Flash, V4 Pro es un pequeño fracaso.
En Artificial Analysis apenas obtiene una puntuación mejor que Flash, aunque cuesta ~2.5 veces más.
Al igual que Flash, no es multimodal, algo que al propio modelo no le gusta.
En el mundo real, parece funcionar mejor al gestionar la planificación de tareas agénticas de mayor duración, pero su rendimiento real en programación no es muy diferente.
El modelo también se ve perjudicado por los aumentos de precios que están aplicando (alrededor de 3 veces para Flash y 4 veces para Pro).
Esto los pone directamente a competir con GPT 5.6 Luna y Terra en términos de precio, una vez que se toma en cuenta la mayor cantidad de tokens que los modelos DeepSeek usan en promedio.

| Modelo | $ por millón (entrada) | $ por millón (salida) | Tokens por segundo |
|---|
| DeepSeek V4 Pro | $1.32 | $3.96 | 55 |
| DeepSeek V4 Flash | $0.44 | $1.32 | 82 |
| Grok 4.6 | $2 | $6 | 57 |
| Claude Fable 5 | $10 | $50 | 40 |
| Claude Opus 4.8 | $5 | $25 | 60 |
| GPT 5.6 Sol | $5 | $30 | 45 |
| GPT 5.6 Terra | $2.50 | $15 | 63 |
| GPT 5.6 Luna | $1 | $6 | 84 |
| Kimi K3 | $3 | $15 | 27 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
Sin embargo, hay un lado positivo.
Lo más probable es que Flash haya sido destilado a partir de una versión temprana del modelo Pro, y la paridad relativa que tiene con Pro significa que DeepSeek probablemente sea el mejor del mundo en destilar sus modelos a un tamaño más pequeño. Esto es parte de por qué este lanzamiento resulta tan decepcionante.
Si esto continúa a largo plazo, significa que DeepSeek podrá compactar inteligencia de nivel frontera en modelos más pequeños y baratos que podremos usar y, potencialmente, ejecutar nosotros mismos en casa.
Yo evitaría V4 Pro por ahora. Si necesitas un modelo barato, mira V4 Flash, pero Pro queda en un punto medio confuso donde no es ni el más barato ni el más inteligente, lo que me dificulta recomendarlo.
Grok 4.6
Después de mucho tiempo en la categoría de modelos “meh”, parece que Grok por fin está haciéndose un nombre con la iteración 4.6.

Para tareas diarias de programación, por lo que he visto, parece estar a la par de GPT 5.6 Sol y Fable, y las primeras impresiones parecen ubicarlo por encima de la mayoría de los modelos chinos, probablemente alrededor del nivel de Kimi K3 o mejor.
Para tareas a gran escala y capacidad de razonamiento en bruto, queda por detrás de los modelos de frontera, así que no es un reemplazo completo de GPT 5.6 y Fable, pero para la mayoría de las personas esto probablemente no será un problema.
Al igual que su predecesor, muchas personas han comentado lo ágil que se siente el modelo frente a la competencia, especialmente cuando se usa la configuración de razonamiento “low”.
También es muy impresionante ver la velocidad a la que el equipo de SpaceXAI está iterando ahora mismo.
Grok 4.5 se lanzó un mes antes, y ya han anunciado que Grok 4.7 se lanzará en un mes.
Esto es rápido incluso para los ritmos vertiginosos del mundo de la IA actual, ya que la mayoría de los otros laboratorios tardan entre 2 y 3 meses en lanzar nuevos modelos.
Grok 4.6 no es imprescindible ahora mismo, pero recomendaría probarlo si tienes la oportunidad para ver cómo funciona con lo que haces, con la expectativa de que veremos más de ellos en el futuro cercano.
Noticias breves
Qwen 3.8 27B
La serie Qwen 3.6 ha sido la opción principal para quienes intentan ejecutar LLM en hardware local de consumo, y el último modelo Qwen 3.8 perpetúa esto.
El modelo 27B es un modelo denso multimodal, lo que significa que probablemente querrás una GPU dedicada para ejecutarlo (lo siento, usuarios de Mac, aunque se rumorea que la variante mixture of experts también saldrá pronto).

Todavía no he tenido mucho tiempo para probarlo (¿por qué los laboratorios han empezado a lanzar modelos los viernes?), pero la impresión inicial parece ser un salto bastante decente en capacidades agénticas. Aun así, sus límites todavía no se han explorado, por ejemplo, si puede reemplazar a DeepSeek V4 Flash como subagente capaz.
Cabe destacar que tiene modos de razonamiento variables (de low a xhigh), similar a la mayoría de los otros modelos modernos de razonamiento.
En la configuración xhigh, usa sustancialmente más tokens que su predecesor, así que tenlo en cuenta.
Si ejecutas modelos locales, lo más probable es que ya estés usando Qwen, y esta parece ser una actualización segura.
Final
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo a continuación.
Autorretrato de DeepSeek V4 Pro — De xule en Twitter usando Midjourney v8.2