News
OpenAI Divorces Cursor
OpenAI announced this week that they would be ending their partnership with Cursor, which will cause Cursor users to lose access to OpenAI models.
The partnership is expected to end on November 12 of this year.
Important background for those that don’t know: Cursor was bought by SpaceX, with the deal being finalized 2 weeks ago.
According to OpenAI, this is because of a lack of trust from Elon Musk’s companies:
We are making this choice because we cannot be confident that SpaceX will use our technology within our terms of service, based on our experience with Elon Musk’s companies violating contracts.
I believe the underlying reasons here are two-fold; the first is Sam Altman and Elon Musk’s hatred of each other.
They recently had a very public court battle (nothing really came of it), stemming from OpenAI’s restructuring from a non-profit to a for-profit company, which Elon (who is one of the OpenAI founders, but left in 2018) took exception to.
The second are more important reason is that OpenAI seems to be implying that SpaceXAI is distilling their models through Cursor and other harnesses to train Grok.
This kind of distillation is useful, but not sufficient, to train a frontier model.
Historically, it has been Anthropic that has cared about this (mostly in regards to Chinese AI Labs), but now OpenAI seems to care as well, but for domestic competition instead.
Interestingly Anthropic doubled down on their commitment to Cursor, saying that they will continue to increase compute to support Claude in Cursor.
This friendliness is most likely not due to Anthopic’s love of Cursor, but rather due to the fact that they have a $45 billion dollar compute contract with SpaceX.
Cursor has said that they are speaking with the OpenAI team right now to try and resolve this, highlighting that OpenAI only serves 5% of Cursor traffic.
If you are a Cursor user and use OpenAI models, you do not need to jump ship yet, but I would be mentally prepared to do so in the coming months (you get much better value from an OpenAI subscription plan than a Cursor plan anyway, so I would recommend switch just for that reason).
Releases
GLM 5.3 Flash
There has been quite a bit of hype around an anonymous model called Ox Alpha the last few weeks, and it has been revealed that it was GLM 5.3 Flash that was being tested.
**
Despite being a “smaller” flash model that is 3x smaller (320B-A18B) than its big brother it is a very capable model.
It passes the real world vibe check, and seems to be a step above DeepSeek V4 Flash and GPT 5.6 Luna, which are the top “small” models that we have right now.
Usually with these smaller models, they use a large number of tokens, partially offsetting their lower pricing, but Z.ai has done a good job restraining the reasoning length for GLM 5.3 Flash. It is still not at the same level of efficient token use as Luna, but makes up for it with increased intelligence.
| Model | $ per million (input) | $ per million (output) | Tokens per second |
|---|
| GLM 5.3 Flash | $0.15 | $0.50 | 28 |
| DeepSeek V4 Flash | $0.44 | $1.32 | 82 |
| GPT 5.6 Luna | $1 | $6 | 84 |
| Grok 4.6 | $2 | $6 | 57 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
The model also has vision capabilities, but they are not in any way impressive, and are not at the same level as its text capabilities.
An interesting thing to note is that the model is being served by Z.ai using only Chinese GPUs, which is the first time that a top tier Chinese lab has (publicly) done so.
It seems that Nvidia is starting to have some major competition from China, which should hopefully be good for GPU prices in the future.
The model is open sourced (along with the big GLM 5.3 model as well), but is a bit too large to run on non-datacenter hardware.
This is yet another very strong, smart, cost efficient model that I would recommend trying out. The best ways to get access to it are OpenCode Go or the Z.ai coding plan.
Quick Hits
Qwen 3.8 Flash
Qwen 3.8 Flash is a peek into the future of what the Qwen 4 model architecture will look like.

They are using an Engram style architecture.
This means that instead of having a big transformer model that must store information and facts alongside learning proper reasoning, there are two separate modules.
The first is the usual transformer we know and love, and then a second engram “memory” module that acts as a fact lookup table (kind of like a database for the LLM’s brain).
The engram module requires very little compute, and just needs memory to load itself, so the model can effectively be split into two: the transformer module gets loaded on to a GPU, and the engram module will reside in system (CPU) memory.
This will allow you to run larger models locally, as you won’t need GPUs with lots of memory.
This release is meant primarily to give the community time to implement and optimize the model in different LLM inference engines, but it is also probably the best model you can run right now on a DGX Spark, although you should be ready for some bugs if you do so.
H3 Max
MiniMax H3 has risen to the top one of the best video generation models, and it is also open source.
One of the biggest image and video inference providers Fal.ai took the model and finetuned it for even more quality and also speed, producing H3 Max.

This results in the best video generation model that we have seen, and it is capable of generating video faster than realtime: it takes 3 seconds to generate a 5 second 768p video, meaning that you can have a continuous video stream from it, for a very low cost ($0.20 per 5 second video).
You can try it for free right now on Fal’s website.
On Device AI Benchmark
I have been asked many times before what the best model to run on a phone is, and now we have a leaderboard made to answer this specific question from Artificial Analysis.

The benchmark aggregates scores from basic tool calling, hallucination, and reasoning benchmarks to get a final score, and also measures token usage and end to end speed on modern phones.
To answer the question of what is the best phone model right now, LFM2.5 2.6B seems to be the answer.
It is near the top on all of the benchmarks, and strikes the right balance of speed, low hallucination rate, and intelligence.
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
Nota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
Notícias
OpenAI se divorcia do Cursor
A OpenAI anunciou esta semana que encerrará sua parceria com o Cursor, o que fará com que usuários do Cursor percam acesso aos modelos da OpenAI.
A expectativa é que a parceria termine em 12 de novembro deste ano.
Contexto importante para quem não sabe: o Cursor foi comprado pela SpaceX, com o acordo finalizado há 2 semanas.
Segundo a OpenAI, isso ocorre por falta de confiança nas empresas de Elon Musk:
Estamos fazendo esta escolha porque não podemos ter confiança de que a SpaceX usará nossa tecnologia dentro dos nossos termos de serviço, com base na nossa experiência com empresas de Elon Musk violando contratos.
Acredito que as razões subjacentes aqui sejam duas; a primeira é o ódio entre Sam Altman e Elon Musk.
Eles tiveram recentemente uma batalha judicial muito pública (nada realmente saiu dela), decorrente da reestruturação da OpenAI de uma organização sem fins lucrativos para uma empresa com fins lucrativos, algo de que Elon (que é um dos fundadores da OpenAI, mas saiu em 2018) discordou.
A segunda razão, mais importante, é que a OpenAI parece estar insinuando que a SpaceXAI está destilando seus modelos por meio do Cursor e de outros ambientes para treinar o Grok.
Esse tipo de destilação é útil, mas não suficiente, para treinar um modelo de fronteira.
Historicamente, a Anthropic era quem se importava com isso (principalmente em relação a laboratórios chineses de IA), mas agora a OpenAI também parece se importar, só que por causa da concorrência doméstica.
Curiosamente, a Anthropic reforçou seu compromisso com o Cursor, dizendo que continuará aumentando a computação para dar suporte ao Claude no Cursor.
Essa cordialidade provavelmente não se deve ao amor da Anthropic pelo Cursor, mas sim ao fato de ela ter um contrato de computação de 45 bilhões de dólares com a SpaceX.
O Cursor disse que está conversando agora com a equipe da OpenAI para tentar resolver isso, destacando que a OpenAI atende apenas 5% do tráfego do Cursor.
Se você é usuário do Cursor e usa modelos da OpenAI, ainda não precisa abandonar o barco, mas eu ficaria mentalmente preparado para fazer isso nos próximos meses (de qualquer forma, você obtém muito mais valor com um plano de assinatura da OpenAI do que com um plano do Cursor, então eu recomendaria a troca só por esse motivo).
Lançamentos
GLM 5.3 Flash
Houve bastante hype em torno de um modelo anônimo chamado Ox Alpha nas últimas semanas, e foi revelado que ele era o GLM 5.3 Flash em teste.
**
Apesar de ser um modelo flash “menor”, 3x menor (320B-A18B) do que seu irmão maior, ele é um modelo muito capaz.
Ele passa no teste prático do mundo real e parece estar um degrau acima do DeepSeek V4 Flash e do GPT 5.6 Luna, que são os principais modelos “pequenos” que temos agora.
Normalmente, com esses modelos menores, eles usam um grande número de tokens, o que compensa parcialmente seu preço menor, mas a Z.ai fez um bom trabalho ao restringir o comprimento do raciocínio do GLM 5.3 Flash. Ele ainda não está no mesmo nível de uso eficiente de tokens do Luna, mas compensa isso com maior inteligência.
| Modelo | $ por milhão (entrada) | $ por milhão (saída) | Tokens por segundo |
|---|
| GLM 5.3 Flash | $0.15 | $0.50 | 28 |
| DeepSeek V4 Flash | $0.44 | $1.32 | 82 |
| GPT 5.6 Luna | $1 | $6 | 84 |
| Grok 4.6 | $2 | $6 | 57 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
O modelo também tem capacidades de visão, mas elas não são impressionantes de forma alguma, e não estão no mesmo nível de suas capacidades de texto.
Um ponto interessante é que o modelo está sendo servido pela Z.ai usando somente GPUs chinesas, o que é a primeira vez que um laboratório chinês de ponta fez isso (publicamente).
Parece que a Nvidia começa a ter uma concorrência importante vinda da China, o que, espera-se, deve ser bom para os preços de GPUs no futuro.
O modelo é open source (junto com o grande modelo GLM 5.3 também), mas é um pouco grande demais para rodar em hardware que não seja de datacenter.
Este é mais um modelo muito forte, inteligente e custo-eficiente que eu recomendaria testar. As melhores formas de acessá-lo são pelo OpenCode Go ou pelo plano de coding da Z.ai.
Notas rápidas
Qwen 3.8 Flash
Qwen 3.8 Flash é uma prévia do futuro da arquitetura do modelo Qwen 4.

Eles estão usando uma arquitetura no estilo Engram.
Isso significa que, em vez de ter um grande modelo transformer que precisa armazenar informações e fatos enquanto aprende raciocínio adequado, há dois módulos separados.
O primeiro é o transformer usual que conhecemos e amamos, e depois há um segundo módulo de “memória” engram que atua como uma tabela de consulta de fatos (mais ou menos como um banco de dados para o cérebro do LLM).
O módulo engram exige muito pouca computação e só precisa de memória para carregar a si mesmo, então o modelo pode efetivamente ser dividido em dois: o módulo transformer é carregado em uma GPU, e o módulo engram fica na memória do sistema (CPU).
Isso permitirá que você rode modelos maiores localmente, pois não precisará de GPUs com muita memória.
Este lançamento tem como objetivo principal dar à comunidade tempo para implementar e otimizar o modelo em diferentes motores de inferência de LLM, mas ele também é provavelmente o melhor modelo que você pode rodar agora em um DGX Spark, embora você deva estar preparado para alguns bugs se fizer isso.
H3 Max
MiniMax H3 subiu ao topo como um dos melhores modelos de geração de vídeo, e também é open source.
Um dos maiores provedores de inferência de imagem e vídeo, a Fal.ai, pegou o modelo e fez fine-tuning nele para ainda mais qualidade e também velocidade, produzindo o H3 Max.

Isso resulta no melhor modelo de geração de vídeo que vimos, e ele é capaz de gerar vídeo mais rápido do que em tempo real: leva 3 segundos para gerar um vídeo de 5 segundos em 768p, o que significa que você pode ter um stream de vídeo contínuo a partir dele, por um custo muito baixo ($0.20 por vídeo de 5 segundos).
Você pode testá-lo de graça agora no site da Fal.
Benchmark de IA no dispositivo
Já me perguntaram muitas vezes qual é o melhor modelo para rodar em um telefone, e agora temos um ranking feito para responder exatamente a essa pergunta, da Artificial Analysis.

O benchmark agrega pontuações de chamadas de ferramentas básicas, alucinação e benchmarks de raciocínio para obter uma pontuação final, e também mede uso de tokens e velocidade de ponta a ponta em telefones modernos.
Para responder à pergunta sobre qual é o melhor modelo para telefone agora, LFM2.5 2.6B parece ser a resposta.
Ele fica perto do topo em todos os benchmarks e atinge o equilíbrio certo entre velocidade, baixa taxa de alucinação e inteligência.
Encerramento
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, entre na nossa mailing list abaixo.
Nota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Noticias
OpenAI se divorcia de Cursor
OpenAI anunció esta semana que pondrá fin a su asociación con Cursor, lo que hará que los usuarios de Cursor pierdan acceso a los modelos de OpenAI.
Se espera que la asociación termine el 12 de noviembre de este año.
Contexto importante para quienes no lo sepan: Cursor fue comprado por SpaceX, y el acuerdo se cerró hace 2 semanas.
Según OpenAI, esto se debe a una falta de confianza en las empresas de Elon Musk:
Estamos tomando esta decisión porque no podemos confiar en que SpaceX usará nuestra tecnología dentro de nuestros términos de servicio, según nuestra experiencia con empresas de Elon Musk que han incumplido contratos.
Creo que las razones subyacentes aquí son dos; la primera es el odio entre Sam Altman y Elon Musk.
Recientemente tuvieron una batalla judicial muy pública (de la que en realidad no salió mucho), derivada de la reestructuración de OpenAI de una organización sin fines de lucro a una empresa con fines de lucro, algo que Elon (uno de los fundadores de OpenAI, pero que se fue en 2018) objetó.
La segunda razón, y más importante, es que OpenAI parece estar insinuando que SpaceXAI está destilando sus modelos mediante Cursor y otros entornos para entrenar Grok.
Este tipo de destilación es útil, pero no suficiente, para entrenar un modelo frontier.
Históricamente, Anthropic es quien se ha preocupado por esto (sobre todo en relación con los laboratorios de IA chinos), pero ahora OpenAI parece preocuparse también, aunque por competencia nacional.
Curiosamente, Anthropic reforzó su compromiso con Cursor, diciendo que seguirá aumentando el cómputo para dar soporte a Claude en Cursor.
Es muy probable que esta actitud amistosa no se deba al amor de Anthropic por Cursor, sino al hecho de que tienen un contrato de cómputo de 45 mil millones de dólares con SpaceX.
Cursor ha dicho que están hablando ahora mismo con el equipo de OpenAI para intentar resolver esto, y subrayó que OpenAI solo representa el 5% del tráfico de Cursor.
Si eres usuario de Cursor y usas modelos de OpenAI, no necesitas abandonar el barco todavía, pero yo estaría preparado mentalmente para hacerlo en los próximos meses (de todos modos, obtienes mucho mejor valor con un plan de suscripción de OpenAI que con un plan de Cursor, así que recomendaría cambiar solo por esa razón).
Lanzamientos
GLM 5.3 Flash
Ha habido bastante expectativa en torno a un modelo anónimo llamado Ox Alpha durante las últimas semanas, y se ha revelado que era GLM 5.3 Flash el que se estaba probando.
**
A pesar de ser un modelo flash “más pequeño”, 3 veces menor (320B-A18B) que su hermano mayor, es un modelo muy capaz.
Pasa la prueba práctica en el mundo real y parece estar un paso por encima de DeepSeek V4 Flash y GPT 5.6 Luna, que son los principales modelos “pequeños” que tenemos ahora mismo.
Normalmente, con estos modelos más pequeños, usan una gran cantidad de tokens, lo que compensa parcialmente su menor precio, pero Z.ai ha hecho un buen trabajo limitando la longitud del razonamiento en GLM 5.3 Flash. Todavía no está al mismo nivel de uso eficiente de tokens que Luna, pero lo compensa con más inteligencia.
| Modelo | $ por millón (entrada) | $ por millón (salida) | Tokens por segundo |
|---|
| GLM 5.3 Flash | $0.15 | $0.50 | 28 |
| DeepSeek V4 Flash | $0.44 | $1.32 | 82 |
| GPT 5.6 Luna | $1 | $6 | 84 |
| Grok 4.6 | $2 | $6 | 57 |
| GLM 5.2 | $1.40 | $4.40 | 47 |
El modelo también tiene capacidades de visión, pero no son para nada impresionantes, y no están al mismo nivel que sus capacidades de texto.
Un punto interesante es que Z.ai está sirviendo el modelo usando solo GPUs chinas, lo que es la primera vez que un laboratorio chino de primer nivel lo hace (públicamente).
Parece que Nvidia empieza a tener competencia importante desde China, lo que con suerte debería ser bueno para los precios de las GPUs en el futuro.
El modelo es open source (junto con el modelo grande GLM 5.3), pero es demasiado grande para ejecutarlo en hardware que no sea de centro de datos.
Este es otro modelo muy sólido, inteligente y rentable que recomendaría probar. Las mejores formas de acceder a él son OpenCode Go o el plan de coding de Z.ai.
Noticias rápidas
Qwen 3.8 Flash
Qwen 3.8 Flash es un vistazo al futuro de cómo será la arquitectura del modelo Qwen 4.

Están usando una arquitectura de estilo Engram.
Esto significa que, en lugar de tener un gran modelo transformer que debe almacenar información y hechos además de aprender razonamiento correcto, hay dos módulos separados.
El primero es el transformer habitual que conocemos y queremos, y luego un segundo módulo de “memoria” engram que actúa como una tabla de consulta de hechos (algo así como una base de datos para el cerebro del LLM).
El módulo engram requiere muy poco cómputo, y solo necesita memoria para cargarse, así que el modelo puede dividirse efectivamente en dos: el módulo transformer se carga en una GPU, y el módulo engram reside en la memoria del sistema (CPU).
Esto te permitirá ejecutar modelos más grandes localmente, ya que no necesitarás GPUs con mucha memoria.
Este lanzamiento está pensado principalmente para dar tiempo a la comunidad a implementar y optimizar el modelo en distintos motores de inferencia de LLMs, pero probablemente también sea el mejor modelo que puedes ejecutar ahora mismo en un DGX Spark, aunque deberías estar preparado para algunos errores si lo haces.
H3 Max
MiniMax H3 ha subido hasta convertirse en uno de los mejores modelos de generación de video, y también es open source.
Uno de los mayores proveedores de inferencia de imagen y video, Fal.ai, tomó el modelo y le hizo finetuning para obtener todavía más calidad y también velocidad, lo que produjo H3 Max.

Esto da como resultado el mejor modelo de generación de video que hemos visto, y es capaz de generar video más rápido que en tiempo real: tarda 3 segundos en generar un video de 5 segundos a 768p, lo que significa que puedes obtener de él un flujo de video continuo, a un coste muy bajo ($0.20 por video de 5 segundos).
Puedes probarlo gratis ahora mismo en el sitio web de Fal.
Benchmark de IA en dispositivo
Muchas veces me han preguntado antes cuál es el mejor modelo para ejecutar en un teléfono, y ahora tenemos un ranking hecho para responder específicamente a esta pregunta, creado por Artificial Analysis.

El benchmark agrega puntuaciones de pruebas básicas de tool calling, alucinación y razonamiento para obtener una puntuación final, y también mide el uso de tokens y la velocidad de extremo a extremo en teléfonos modernos.
Para responder a la pregunta de cuál es el mejor modelo para teléfono ahora mismo, LFM2.5 2.6B parece ser la respuesta.
Está cerca de los primeros puestos en todos los benchmarks y logra el equilibrio correcto entre velocidad, baja tasa de alucinación e inteligencia.
Final
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo abajo.