Releases
Kimi K3
Moonshot AI has released the latest generation of their Kimi series of models, Kimi K3.
The Kimi models were already some of the largest open source models that we have seen, being 1 trillion parameters, and now they have 3x’d this to 3 trillion parameters for their 3rd gen flagship, double the estimated size of GPT 5.5 and Opus 4.8.

The model is by far the best we have seen from China, and in fact the best from any lab that isn’t Anthropic or OpenAI.
I would place the model right behind the frontier of Fable and GPT 5.6, but is close behind.
It does not have the same high quality judgment ability of Fable, and lacks the extreme token and tool use efficiency of GPT 5.6.
It has a less refined feel and user experience compared to the top two, but in terms of intelligence it seems to be close, making these issues very easy to overcome in future iterations of the model, and they can be ironed out in post training.
Similar to other Chinese models, Kimi K3 excels in frontend design, topping GPT 5.6 and Fable in the Frontend Code Arena.
On the very reliable DeepSWE benchmark we see that it is behind only Fable and GPT 5.6 Sol, further reinforcing the vibes that I and many others have been seeing in the real world that this model is one of the best in the world.
The model is also multimodal, but similar to the Claude models, it does not seem that the Kimi team has focused too much on these capabilities compared to OpenAI.
One of the big departures from previous Chinese releases is the price.
They have decided to price it at $15 per million output tokens, which is the first time any of the frontier Chinese labs have priced a model above $5 per million output tokens.
This shows that they are confident in the model’s capabilities and that they can start taking a much larger profit than they have previously.
| Model | $ per million (input) | $ per million (output) | Tokens per second |
|---|
| Kimi K3 | $3 | $15 | 27 |
| GPT 5.6 Sol | $5 | $30 | 45 |
| Claude Fable 5 | $10 | $50 | 40 |
| Claude Opus 4.8 | $5 | $25 | 60 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
Right now, the model’s high price and high token usage makes it both slower and more expensive to use than GPT 5.6 Sol.
We expect to see these prices come down however, as the model will be open sourced next week, and all of the 3rd party inference providers will start supporting the model and trying to undercut each other on price.
Also due to its open source nature, you will not have to deal with the same guardrails that you do with GPT and Claude.
You will get to use the model however you want, and won’t have to worry about getting blocked for asking about cyber security or biology related tasks.
In just one month we have gone from GLM 5.2 which gave us very usable but not necessarily frontier level capabilities to Kimi K3, which is a roughly frontier LLM.
It is clear that OpenAI and Anthropic will not run away from everyone else and control the entire AI space.
Now it is not even clear if they will be the top labs at the end of the year.
OpenAI and Anthropic had a head start on everyone else, but now that other labs are catching up, the AI race has truly begun.
Quick Hits
React Bench
Many of us who use LLMs for coding have seen frontend tasks as a mostly solved science, as LLMs are capable of making very nice looking frontends for our websites with minimal effort.
React Bench challenges this notion.
It measures bugs and performance issues with LLM-made code, and it finds that even frontier models still struggle.
They test both greenfield tasks and also bug fixing tasks across 51 different scenarios.
Users notice bugs far more than features and are very sensitive to the snappiness of your frontend.
The frontend is also usually the hardest for your LLM to test, since it needs to interact with the browser using a tool like playwright and take screenshots to understand what is happening, and LLM’s vision capabilities are far behind their text capabilities.
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
Floating Companion — from ClankrMedia on TwitterNota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
Lançamentos
Kimi K3
A Moonshot AI lançou a geração mais recente da sua série de modelos Kimi, Kimi K3.
Os modelos Kimi já estavam entre os maiores modelos de código aberto que vimos, com 1 trilhão de parâmetros, e agora eles triplicaram isso para 3 trilhões de parâmetros em seu carro-chefe de 3ª geração, o dobro do tamanho estimado do GPT 5.5 e do Opus 4.8.

O modelo é, de longe, o melhor que vimos vindo da China e, na verdade, o melhor de qualquer laboratório que não seja Anthropic ou OpenAI.
Eu colocaria o modelo logo atrás da fronteira de Fable e GPT 5.6, mas bem próximo.
Ele não tem a mesma capacidade de julgamento de alta qualidade do Fable e carece da extrema eficiência no uso de tokens e ferramentas do GPT 5.6.
Ele tem uma sensação e experiência de usuário menos refinadas em comparação com os dois principais, mas em termos de inteligência parece estar perto, tornando esses problemas muito fáceis de superar em futuras iterações do modelo, e eles podem ser ajustados no pós-treinamento.
Assim como outros modelos chineses, o Kimi K3 se destaca em design de frontend, superando o GPT 5.6 e o Fable na Frontend Code Arena.
No muito confiável benchmark DeepSWE, vemos que ele fica atrás apenas do Fable e do GPT 5.6 Sol, reforçando ainda mais as impressões que eu e muitos outros temos visto no mundo real: este modelo é um dos melhores do mundo.
O modelo também é multimodal, mas, de forma semelhante aos modelos Claude, não parece que a equipe do Kimi tenha focado tanto nessas capacidades em comparação com a OpenAI.
Uma das grandes mudanças em relação aos lançamentos chineses anteriores é o preço.
Eles decidiram precificá-lo a US$ 15 por milhão de tokens de saída, o que é a primeira vez que qualquer um dos laboratórios chineses de fronteira precifica um modelo acima de US$ 5 por milhão de tokens de saída.
Isso mostra que eles estão confiantes nas capacidades do modelo e que podem começar a obter um lucro muito maior do que vinham obtendo anteriormente.
| Modelo | US$ por milhão (entrada) | US$ por milhão (saída) | Tokens por segundo |
|---|
| Kimi K3 | US$ 3 | US$ 15 | 27 |
| GPT 5.6 Sol | US$ 5 | US$ 30 | 45 |
| Claude Fable 5 | US$ 10 | US$ 50 | 40 |
| Claude Opus 4.8 | US$ 5 | US$ 25 | 60 |
| GLM 5.2 | US$ 1,40 | US$ 4,40 | 47 |
No momento, o preço alto e o alto uso de tokens do modelo fazem com que ele seja mais lento e mais caro de usar do que o GPT 5.6 Sol.
No entanto, esperamos ver esses preços caírem, já que o modelo será disponibilizado como código aberto na próxima semana, e todos os provedores de inferência de terceiros começarão a dar suporte ao modelo e tentarão competir entre si reduzindo preços.
Também por causa de sua natureza de código aberto, você não terá que lidar com as mesmas guardrails que enfrenta com GPT e Claude.
Você poderá usar o modelo como quiser e não terá que se preocupar em ser bloqueado por perguntar sobre tarefas relacionadas a cibersegurança ou biologia.
Em apenas um mês, passamos do GLM 5.2, que nos deu capacidades muito utilizáveis, mas não necessariamente de nível fronteira, para o Kimi K3, que é um LLM aproximadamente de fronteira.
Está claro que OpenAI e Anthropic não vão disparar à frente de todos os outros e controlar todo o espaço de IA.
Agora, nem sequer está claro se elas serão os principais laboratórios no fim do ano.
OpenAI e Anthropic tiveram uma vantagem inicial sobre todos os outros, mas agora que outros laboratórios estão alcançando, a corrida da IA começou de verdade.
Notas Rápidas
React Bench
Muitos de nós que usamos LLMs para programação vimos tarefas de frontend como uma ciência praticamente resolvida, já que LLMs são capazes de criar frontends muito bonitos para nossos sites com esforço mínimo.
React Bench desafia essa noção.
Ele mede bugs e problemas de desempenho em código feito por LLMs e descobre que até modelos de fronteira ainda têm dificuldades.
Eles testam tanto tarefas greenfield quanto tarefas de correção de bugs em 51 cenários diferentes.
Encerramento
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, não deixe de entrar na nossa lista de e-mails abaixo.
Floating Companion — de ClankrMedia no TwitterNota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Lanzamientos
Kimi K3
Moonshot AI ha lanzado la última generación de su serie de modelos Kimi, Kimi K3.
Los modelos Kimi ya eran algunos de los modelos open source más grandes que hemos visto, con 1 billón de parámetros, y ahora han triplicado esto hasta 3 billones de parámetros para su buque insignia de 3.ª generación, el doble del tamaño estimado de GPT 5.5 y Opus 4.8.

El modelo es, con mucha diferencia, el mejor que hemos visto de China y, de hecho, el mejor de cualquier laboratorio que no sea Anthropic u OpenAI.
Yo situaría el modelo justo detrás de la frontera de Fable y GPT 5.6, pero muy cerca.
No tiene la misma capacidad de juicio de alta calidad que Fable, y carece de la extrema eficiencia en uso de tokens y herramientas de GPT 5.6.
Tiene una sensación y experiencia de usuario menos refinadas en comparación con los dos principales, pero en términos de inteligencia parece estar cerca, lo que hace que estos problemas sean muy fáciles de superar en futuras iteraciones del modelo, y pueden pulirse en el postentrenamiento.
Al igual que otros modelos chinos, Kimi K3 destaca en diseño frontend, superando a GPT 5.6 y Fable en la Frontend Code Arena.
En el muy fiable benchmark DeepSWE vemos que solo queda por detrás de Fable y GPT 5.6 Sol, reforzando aún más las sensaciones que yo y muchos otros hemos estado viendo en el mundo real: que este modelo es uno de los mejores del mundo.
El modelo también es multimodal, pero, al igual que los modelos Claude, no parece que el equipo de Kimi se haya centrado demasiado en estas capacidades en comparación con OpenAI.
Una de las grandes diferencias con respecto a lanzamientos chinos anteriores es el precio.
Han decidido ponerle un precio de 15 dólares por millón de tokens de salida, lo que supone la primera vez que alguno de los laboratorios chinos de frontera ha fijado el precio de un modelo por encima de 5 dólares por millón de tokens de salida.
Esto muestra que confían en las capacidades del modelo y que pueden empezar a obtener un beneficio mucho mayor que antes.
| Modelo | $ por millón (entrada) | $ por millón (salida) | Tokens por segundo |
|---|
| Kimi K3 | $3 | $15 | 27 |
| GPT 5.6 Sol | $5 | $30 | 45 |
| Claude Fable 5 | $10 | $50 | 40 |
| Claude Opus 4.8 | $5 | $25 | 60 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
Ahora mismo, el alto precio y el alto uso de tokens del modelo hacen que sea más lento y más caro de usar que GPT 5.6 Sol.
Sin embargo, esperamos ver que estos precios bajen, ya que el modelo será publicado como open source la próxima semana, y todos los proveedores de inferencia de terceros empezarán a dar soporte al modelo e intentarán rebajarse los precios entre sí.
Además, debido a su naturaleza open source, no tendrás que lidiar con las mismas barreras de seguridad que tienes con GPT y Claude.
Podrás usar el modelo como quieras, y no tendrás que preocuparte por que te bloqueen por preguntar sobre ciberseguridad o tareas relacionadas con biología.
En solo un mes hemos pasado de GLM 5.2, que nos dio capacidades muy utilizables pero no necesariamente de nivel frontera, a Kimi K3, que es un LLM aproximadamente de frontera.
Está claro que OpenAI y Anthropic no van a escaparse del resto y controlar todo el espacio de la IA.
Ahora ni siquiera está claro si serán los principales laboratorios a finales de año.
OpenAI y Anthropic tenían ventaja sobre todos los demás, pero ahora que otros laboratorios se están poniendo al día, la carrera de la IA ha comenzado de verdad.
Noticias rápidas
React Bench
Muchos de los que usamos LLMs para programar hemos visto las tareas frontend como una ciencia prácticamente resuelta, ya que los LLMs son capaces de crear frontends muy atractivos para nuestros sitios web con un esfuerzo mínimo.
React Bench desafía esta idea.
Mide errores y problemas de rendimiento en código creado por LLMs, y encuentra que incluso los modelos de frontera siguen teniendo dificultades.
Ponen a prueba tanto tareas desde cero como tareas de corrección de bugs en 51 escenarios diferentes.
Final
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo abajo.
Floating Companion — de ClankrMedia en Twitter