Releases
Jev
A new startup called TypeSafe AI made waves this week with the release of their model called Jev.
Despite getting a ton of hype as if it was an LLM, it actually isn’t.
Jev benchmarked against LLMs on classification tasks. Note how the x-axis is logarithmic.
Instead it is what is known as a zero shot classification model.
This means that you give it a piece of text and a set of categories, and it will give a probability for the text for each category.
These models tend to be very small, and because they just output probabilities, you only have to pay for the input tokens.
This means that Jev only costs 4.2 cents per million input tokens, and you don’t pay for output tokens at all, since there are none.
This may seem revolutionary (as many people on Twitter think) but if you have been following AI since before the ChatGPT Cambrian explosion, you will know that this is not that revolutionary; we have been training these models (known as BERT models) since 2020!
We have a variety of models that already do this (like Modern Bert Zeroshot) and they are very easy to train (I was training them on my laptop back in 2021!).
Unlike generative AI models, these more traditional ML models are much easier to train and deploy; they can easily run in your user’s browser, even on mobile.
Out of the box, Jev is a better version of what we have in open source right now and also outperforms the cheap LLMs that people have been using for classification tasks (like Gemini 3.5 Flash Lite and GPT 5.6 Luna), but its virality has spawned a number of clones already (many of which are open source) so I expect the gap to dwindle quickly.
It also should be noted that these are zero shot models, meaning they haven’t been trained for the specific classification task they are being used for. Like I said before, these models are very easy to finetune, requiring only a couple dozen samples to train, and can be done on most household hardware, no GPU required.
These finetuned variants will vastly outperform the zeroshot models (and LLMs) while being effectively free for you to train and run.
That being said, if you have a classification pipeline and are using LLMs for it, I would replace them with Jev as it should be just as good if not better than most LLMs and vastly cheaper and quicker. Once you have done that, I would look into finetuning your own version to reduce your costs to 0.
Research
Weird ML V3
Speaking of finetuning models, a new finetuning benchmark has been released: Weird ML V3.
X-axis is logarithmic. GPT-6 Astra gets the same score as Fable 5.1 with 1/10th the tokens.
The benchmark measures how well the model is able to do when dropped in to a machine learning environment with little direction outside its task.
It is up to the model to look at the data, filter and process it, and then decide what architecture to use for the actual model, and then compose a pipeline to successfully train the model (they have only 2 minutes worth of compute to train with, so they must make sure their model is efficient).
The previous iteration was a good benchmark (Epoch AI recently benchmarked the benchmark, and found no issues with it, which is surprisingly rare) but was becoming saturated by the top models, so a new benchmark was in order.
The released 4 samples (while keeping the rest of the problems private) from the benchmark to get an idea of what they are looking for from the models.
Tasks include shape detection and classification, ship detection, telescope data signal processing, and bonanza, which is all 17 tasks from Weird ML V2 that the model must solve in parallel, and the only score it gets is the average across all 17 questions, so it has to figure out itself which ones it is or isn’t doing will on.
The benchmark does a good job in differentiating between models, specifically open vs closed models.
Open models tend to be trained around the major software engineering benchmarks and tasks, and tend to lack diverse coding capabilities, which most benchmarks miss.
Weird ML does not have this issue, as there is a wide gap between most models, which gives a good measure generality.
For the preliminary scores, we see this, as Fable and GPT-6 Astra are far ahead, with GPT-6 in the lead due to its superior image understanding capabilities, since many of the problems benefit from strong multimodal capabilities.
DeepSeek V4.1 Flash and Gemini 3.8 Flash, which seem close to the frontier on many benchmarks, are noticeably behind.
Weird ML V3 will be added to the list of benchmarks that I use for the news, which is nice to see, as many of the benchmarks I have relied on have become contaminated (like DeepSWE), but that is a discussion for another day.
Finish
I hope you enjoyed the news this week. If you want to get the news every week, be sure to join our mailing list below.
Doodles from Claude by Kevin Ngo on TwitterNota: Este artigo foi traduzido automaticamente com OpenAI GPT-5.5 por meio do Codex CLI; a qualidade pode estar reduzida, especialmente na terminologia técnica.
Lançamentos
Jev
Uma nova startup chamada TypeSafe AI chamou bastante atenção esta semana com o lançamento de seu modelo chamado Jev.
Apesar de ter recebido muito hype como se fosse um LLM, na verdade não é.
Jev comparado com LLMs em tarefas de classificação. Note como o eixo x é logarítmico.
Em vez disso, ele é o que se conhece como um modelo de classificação zero-shot.
Isso significa que você fornece a ele um trecho de texto e um conjunto de categorias, e ele dará uma probabilidade para o texto em cada categoria.
Esses modelos tendem a ser muito pequenos e, como eles apenas produzem probabilidades, você só precisa pagar pelos tokens de entrada.
Isso significa que o Jev custa apenas 4,2 centavos por milhão de tokens de entrada, e você não paga nada por tokens de saída, já que não há nenhum.
Isso pode parecer revolucionário (como muitas pessoas no Twitter acham), mas se você acompanha IA desde antes da explosão cambriana do ChatGPT, sabe que isso não é tão revolucionário assim; treinamos esses modelos (conhecidos como modelos BERT) desde 2020!
Temos uma variedade de modelos que já fazem isso (como o Modern Bert Zeroshot), e eles são muito fáceis de treinar (eu treinava esses modelos no meu laptop lá em 2021!).
Ao contrário dos modelos de IA generativa, esses modelos de ML mais tradicionais são muito mais fáceis de treinar e implantar; eles podem rodar facilmente no navegador do seu usuário, até mesmo em dispositivos móveis.
Pronto para uso, o Jev é uma versão melhor do que temos hoje em código aberto e também supera os LLMs baratos que as pessoas têm usado para tarefas de classificação (como Gemini 3.5 Flash Lite e GPT 5.6 Luna), mas sua viralidade já gerou vários clones (muitos deles de código aberto), então espero que a diferença diminua rapidamente.
Também vale notar que esses são modelos zero-shot, o que significa que eles não foram treinados para a tarefa específica de classificação em que estão sendo usados. Como eu disse antes, esses modelos são muito fáceis de ajustar por finetuning, exigindo apenas algumas dezenas de amostras para treinar, e isso pode ser feito na maioria dos hardwares domésticos, sem necessidade de GPU.
Essas variantes ajustadas por finetuning vão superar amplamente os modelos zero-shot (e os LLMs), sendo efetivamente gratuitas para você treinar e executar.
Dito isso, se você tem um pipeline de classificação e está usando LLMs nele, eu os substituiria pelo Jev, já que ele deve ser tão bom quanto, se não melhor que, a maioria dos LLMs, além de ser muito mais barato e rápido. Depois de fazer isso, eu investigaria o finetuning da sua própria versão para reduzir seus custos a 0.
Pesquisa
Weird ML V3
Falando em fazer finetuning de modelos, um novo benchmark de finetuning foi lançado: Weird ML V3.
O eixo X é logarítmico. GPT-6 Astra obtém a mesma pontuação que Fable 5.1 com 1/10 dos tokens.
O benchmark mede o quão bem o modelo consegue se sair quando é colocado em um ambiente de machine learning com pouca orientação além da tarefa em si.
Cabe ao modelo examinar os dados, filtrá-los e processá-los, decidir qual arquitetura usar para o modelo real e então compor um pipeline para treinar o modelo com sucesso (eles têm apenas 2 minutos de computação para treinar, então precisam garantir que o modelo seja eficiente).
A iteração anterior era um bom benchmark (a Epoch AI recentemente avaliou o benchmark e não encontrou problemas nele, o que é surpreendentemente raro), mas estava ficando saturada pelos modelos de ponta, então era hora de um novo benchmark.
Eles divulgaram 4 amostras (mantendo o restante dos problemas privado) do benchmark para dar uma ideia do que esperam dos modelos.
As tarefas incluem detecção e classificação de formas, detecção de navios, processamento de sinais de dados de telescópio e bonanza, que reúne todas as 17 tarefas do Weird ML V2 que o modelo precisa resolver em paralelo, e a única pontuação que ele recebe é a média das 17 perguntas; portanto, ele precisa descobrir sozinho em quais está ou não indo bem.
O benchmark faz um bom trabalho ao diferenciar modelos, especificamente modelos abertos versus fechados.
Modelos abertos tendem a ser treinados em torno dos principais benchmarks e tarefas de engenharia de software, e tendem a carecer de capacidades de codificação diversas, algo que a maioria dos benchmarks deixa passar.
O Weird ML não tem esse problema, pois há uma grande diferença entre a maioria dos modelos, o que oferece uma boa medida de generalidade.
Nas pontuações preliminares, vemos isso: Fable e GPT-6 Astra estão muito à frente, com GPT-6 na liderança devido às suas capacidades superiores de compreensão de imagem, já que muitos dos problemas se beneficiam de fortes capacidades multimodais.
DeepSeek V4.1 Flash e Gemini 3.8 Flash, que parecem próximos da fronteira em muitos benchmarks, ficam perceptivelmente atrás.
Weird ML V3 será adicionado à lista de benchmarks que uso para as notícias, o que é bom de ver, já que muitos dos benchmarks em que eu confiava foram contaminados (como DeepSWE), mas essa é uma discussão para outro dia.
Encerramento
Espero que você tenha gostado das notícias desta semana. Se quiser receber as notícias toda semana, não deixe de entrar na nossa lista de emails abaixo.
Doodles from Claude por Kevin Ngo no TwitterNota: Este artículo fue traducido automáticamente con OpenAI GPT-5.5 mediante Codex CLI; la calidad puede verse degradada, especialmente en la terminología técnica.
Lanzamientos
Jev
Una nueva startup llamada TypeSafe AI causó revuelo esta semana con el lanzamiento de su modelo llamado Jev.
A pesar de recibir muchísima atención como si fuera un LLM, en realidad no lo es.
Jev comparado con LLMs en tareas de clasificación. Observa que el eje x es logarítmico.
En cambio, es lo que se conoce como un modelo de clasificación zero-shot.
Esto significa que le das un fragmento de texto y un conjunto de categorías, y te dará una probabilidad para el texto en cada categoría.
Estos modelos tienden a ser muy pequeños y, como solo generan probabilidades, solo tienes que pagar por los tokens de entrada.
Esto significa que Jev cuesta solo 4.2 centavos por millón de tokens de entrada, y no pagas nada por tokens de salida, ya que no hay ninguno.
Esto puede parecer revolucionario (como muchas personas en Twitter creen), pero si has estado siguiendo la IA desde antes de la explosión cámbrica de ChatGPT, sabrás que no es tan revolucionario; ¡hemos estado entrenando estos modelos (conocidos como modelos BERT) desde 2020!
Tenemos una variedad de modelos que ya hacen esto (como Modern Bert Zeroshot) y son muy fáciles de entrenar (¡yo los entrenaba en mi laptop en 2021!).
A diferencia de los modelos de IA generativa, estos modelos de ML más tradicionales son mucho más fáciles de entrenar y desplegar; pueden ejecutarse fácilmente en el navegador de tus usuarios, incluso en móvil.
De fábrica, Jev es una mejor versión de lo que tenemos ahora mismo en código abierto y también supera a los LLMs baratos que la gente ha estado usando para tareas de clasificación (como Gemini 3.5 Flash Lite y GPT 5.6 Luna), pero su viralidad ya ha generado varios clones (muchos de ellos de código abierto), así que espero que la brecha se reduzca rápidamente.
También cabe señalar que estos son modelos zero-shot, lo que significa que no han sido entrenados para la tarea de clasificación específica en la que se están usando. Como dije antes, estos modelos son muy fáciles de ajustar mediante finetuning: requieren solo unas pocas docenas de muestras para entrenarse, y se puede hacer en la mayoría del hardware doméstico, sin necesidad de GPU.
Estas variantes ajustadas superarán ampliamente a los modelos zeroshot (y a los LLMs), siendo efectivamente gratis de entrenar y ejecutar para ti.
Dicho esto, si tienes un pipeline de clasificación y estás usando LLMs para ello, yo los reemplazaría por Jev, ya que debería ser igual de bueno, si no mejor, que la mayoría de los LLMs, y muchísimo más barato y rápido. Una vez que hayas hecho eso, investigaría cómo ajustar tu propia versión para reducir tus costos a 0.
Investigación
Weird ML V3
Hablando de ajustar modelos mediante finetuning, se ha lanzado un nuevo benchmark de finetuning: Weird ML V3.
El eje x es logarítmico. GPT-6 Astra obtiene la misma puntuación que Fable 5.1 con 1/10 de los tokens.
El benchmark mide qué tan bien puede desempeñarse el modelo cuando se lo deja en un entorno de machine learning con poca orientación más allá de su tarea.
Depende del modelo examinar los datos, filtrarlos y procesarlos, y luego decidir qué arquitectura usar para el modelo real, para después componer un pipeline que entrene el modelo con éxito (solo tienen 2 minutos de cómputo para entrenar, así que deben asegurarse de que su modelo sea eficiente).
La iteración anterior era un buen benchmark (Epoch AI recientemente benchmarkeó el benchmark, y no encontró problemas con él, algo sorprendentemente raro), pero los modelos más avanzados lo estaban saturando, así que hacía falta un benchmark nuevo.
Los 4 ejemplos publicados (manteniendo privados el resto de los problemas) del benchmark sirven para hacerse una idea de lo que esperan de los modelos.
Las tareas incluyen detección y clasificación de formas, detección de barcos, procesamiento de señales de datos de telescopios, y bonanza, que reúne las 17 tareas de Weird ML V2 que el modelo debe resolver en paralelo; la única puntuación que recibe es el promedio de las 17 preguntas, así que tiene que descubrir por sí mismo en cuáles le está yendo bien o mal.
El benchmark hace un buen trabajo diferenciando entre modelos, específicamente entre modelos abiertos y cerrados.
Los modelos abiertos tienden a entrenarse alrededor de los principales benchmarks y tareas de ingeniería de software, y suelen carecer de capacidades de programación diversas, algo que la mayoría de los benchmarks pasan por alto.
Weird ML no tiene este problema, ya que hay una gran brecha entre la mayoría de los modelos, lo que ofrece una buena medida de generalidad.
En las puntuaciones preliminares vemos esto, ya que Fable y GPT-6 Astra están muy por delante, con GPT-6 a la cabeza gracias a sus capacidades superiores de comprensión de imágenes, dado que muchos de los problemas se benefician de fuertes capacidades multimodales.
DeepSeek V4.1 Flash y Gemini 3.8 Flash, que parecen estar cerca de la frontera en muchos benchmarks, quedan notablemente rezagados.
Weird ML V3 se añadirá a la lista de benchmarks que uso para las noticias, lo cual me alegra ver, ya que muchos de los benchmarks en los que he confiado se han contaminado (como DeepSWE), pero esa es una discusión para otro día.
Final
Espero que hayas disfrutado las noticias de esta semana. Si quieres recibir las noticias cada semana, asegúrate de unirte a nuestra lista de correo abajo.
Doodles from Claude de Kevin Ngo en Twitter