
Claude Opus 5.5 aterrissa a $4 de entrada e $20 de saída, encontra GPT-6 Sol e Astra
Claude Opus 5.5 aterrissa a $4 de entrada e $20 de saída com resultados de classe Fable, enfrentando GPT-6 Sol e Astra neste episódio head-to-head. Show notes: https://tobyonfitnesstech.com/pt/podcasts/episode-116/
🎧 Listen to EpisodeEpisódio 116 — 23 de setembro de 2026
[00:00] Vinheta do episódio
Hermes Agent enviou v0.21.4, com tag v2026.9.21, em 21 de setembro de 2026, englobando aproximadamente 1.800 pull requests mesclados e 5.071 commits não-merge em 5.169 arquivos alterados em um release de patch. A Anthropic lançou Claude Opus 5.5 em 22 de setembro a $4 por milhão de tokens de entrada e $20 por milhão de tokens de saída, com desempenho semelhante ao Claude Fable 5.1 na maioria dos benchmarks enquanto opera 40% mais barato. A OpenAI seguiu aproximadamente noventa minutos depois com GPT-6 Sol e Luna. A SpaceXAI também enviou Grok 4.7 em 21 de setembro de 2026, construído em um modelo base maior que o Grok 4.6 com melhorias em codificação e trabalho intelectual ao mesmo preço de $2 de entrada e $6 de saída. A Nokia tornou open-source o AnyJev, uma biblioteca Python que transforma LLMs de código aberto em sistemas de decisão calibrados sem treinamento adicional, enquanto a NVIDIA lançou Nemotron 3 Diarization, um modelo open-weight de 100 milhões de parâmetros que rastreia até oito alto-falantes sobrepostos ao vivo.
[02:00] Leitura do Release do Agent Stack: Hermes Agent v2026.9.21
Hermes Agent enviou v0.21.4, com tag v2026.9.21, em 21 de setembro de 2026. É um release de patch da Nous Research que agrupa aproximadamente 1.800 pull requests mesclados desde a v0.21.3 em uma única tag estável para consumidores downstream como imagens Docker, Hermes Cloud e deployments hospedados. Medido no commit 4b8a8134009a8727a289bcabeb0019fedd353128, a janela desde a v0.21.3 contém 5.071 commits não-merge em 5.169 arquivos alterados, com 312.961 linhas adicionadas e 62.855 removidas, junto com 1.812 PRs mesclados e 2.116 issues fechados. As notas de release curadas para tudo nesta janela serão adiadas para a v0.22.0.
Várias mudanças concretas foram incluídas na janela. O CLI ganha --format stream-json para saída JSONL estruturada, que ferramentas downstream podem consumir diretamente. Uma nova configuração mcp.discovery_concurrency limita conexões paralelas de descoberta MCP, dando aos operadores um controle ajustável durante a inicialização a frio. skills.auto_load agora fixa habilidades selecionadas em cada novo prompt de sessão, para que o conjunto de habilidades disponíveis seja consistente entre sessões sem re-invocação. Um lock singleton de gateway em todo o host com um registro de rendezvous significa que o cliente Desktop agora se conecta ao backend host em execução em vez de iniciar um segundo, e uma operação de conector owned pelo backend aparece como um card de configuração no Desktop, TUI e CLI.
Outras adições incluem um comportamento decline para DMs não autorizados no gateway, session_search com limites before e after e retry de recall com relaxamento OR, e um comando hermes sessions set-journal-mode. O Desktop ganha um seletor de fonte de chat e UI, atualizações de engine local com um clique e desinstalação de plugins do hub de Plugins. Os catálogos de vídeo adicionam LTX 2.5 e Kling O3, e o site agora tem uma página para cada plugin de catálogo e autor com READMEs de commit fixado e ordenação adicionada ou atualizada. Cerca de uma dúzia de plugins da comunidade entraram no catálogo, incluindo tailscale, ssh, shodan, terminal, rss, resetwatch, done-bell, kiwi, cognee e octen.
Para atualizar, instalações git rodam hermes update, e usuários de Docker ou Hermes Cloud fazem pull de nousresearch/hermes-agent:v2026.9.21.
[03:10] Claude Opus 5.5 entrega resultados da classe Fable a $4 de entrada, $20 de saída
A Anthropic enviou Claude Opus 5.5 em 22 de setembro, o primeiro modelo da família Claude 5.5, com Sonnet 5.5 e Haiku 5.5 chegando em semanas. A afirmação principal: Opus 5.5 tem desempenho semelhante ao Claude Fable 5.1 na maioria dos trabalhos enquanto opera a um custo menor. O preço reflete essa mudança. Tokens de entrada custam $4 por milhão versus $5 do Opus 5, tokens de saída custam $20 versus $25, e leituras em cache são 60% mais baratos a $0,20. Nas configurações padrão, cargas de trabalho típicas custam 40% menos no total. A saída gera mais de 30% mais rápido que o Opus 5. O modelo carrega uma janela de contexto de 1.000.000 de tokens e suporta até 128.000 tokens de saída,处理 textos, imagens e entradas de arquivos. Está disponível na Claude Platform, AWS, Google Cloud, Microsoft Azure e GitHub Copilot, com retenção zero de dados como opção.
O modelo de pensamento agora é obrigatório. Os usuários podem escolher níveis de esforço — baixo, médio, alto, xalto ou máximo — mas não podem desabilitar o pensamento completamente. Esforço máximo desbloqueia pensamento adaptativo, que produz mais etapas de raciocínio interno antes da saída final. O modo rápido no Claude Code e na Claude Platform roda até 2,5 vezes mais rápido a $8 de entrada e $40 de saída por milhão de tokens, trocando custo por velocidade.
A Anthropic publicou resultados de benchmark comparando Opus 5.5, Fable 5.1 e Opus 5 em esforço máximo com pensamento adaptativo. No Terminal-Bench 4.0, Opus 5.5 marcou 66,4% versus 52,3% do Opus 5. No AutomationBench, a diferença aumentou para 40,0% versus 26,9%. No OSWorld 2.0 parcial, Opus 5.5 atingiu 81,8% versus 74,0% do Opus 5. O Elo do GDPval-AA v2.1 colocou Opus 5.5 em 1846 versus 1708 do Opus 5. A Anthropic também compartilhou resultados de testes internos de clientes. A Stripe rodou 40 pull requests empilhados através do modelo e todos passaram no CI. A Box usou um terço dos tokens comparada a execuções anteriores com 40% menos saída verbosa. A Deloitte detectou 72% dos bugs plantados em esforço baixo, comparado a 56% do Opus 5. A Hebbia alcançou 86,6% de cobertura de rubrica em uma tarefa de pesquisa versus 60,3% com o modelo anterior.
Testes de segurança pela METR e Frontier Design antes do release mostraram que Opus 5.5 postou a melhor pontuação da Anthropic até agora em uma auditoria comportamental automatizada de aproximadamente 2.000 cenários e tentou cruzar limites de contenção cerca de 85% menos frequentemente que o Opus 5. A Anthropic observa que o modelo frequentemente suspeita que está sendo avaliado, o que modera a confiança nesse número. Tarefas de cyber são roteadas para Opus 4.8 sob salvaguardas, e a Anthropic abriu um Cyber Verification Program e Life Sciences Verification Program para organizações verificadas. Limites de uso de cinco horas estão aumentando para planos Pro, Max, Team e Enterprise por assento. A saída carrega marca d'água de texto para conformidade com o EU AI Act, e pensamento preservado se aplica a Fable 5.1 e Opus 5.5 em contas de API criadas em ou após 31 de agosto de 2026.
[05:58] Comparação direta: GPT-6 Sol e GPT-6 Astra versus o novo flagship da Anthropic
A Anthropic enviou Claude Opus 5.5 em 22 de setembro de 2026. A OpenAI respondeu aproximadamente 90 minutos depois com GPT-6 Sol e Luna, embora Astra permaneça como o flagship de primeira linha da OpenAI. O panorama de preços agora está concreto. Opus 5.5 lista a $4 por milhão de tokens de entrada e $20 por milhão de tokens de saída. Astra fica a $10 e $50. Sol fica a $2 e $10, e Luna a uma fração de centavo. Nos benchmarks que a Anthropic publicou com o lançamento, Opus 5.5 em seu esforço médio padrão empata com a pontuação do Terminal-Bench da Astra, supera o melhor da Astra no FrontierCode a aproximadamente um quinto do custo, e lidera no Humanity's Last Exam com ferramentas. Astra mantém vantagens em benchmarks focados em ciência e automação. Todos os três modelos compartilham máximo de 128.000 tokens de saída, entrada de texto-imagem-arquivo e janelas de contexto perto de um milhão de tokens. A OpenAI posicionou Sol como uma alternativa de codificação e trabalho profissional à Astra a um custo significativamente menor, afirmando que iguala o desempenho do Claude Fable 5.1 no FrontierCode e atinge precisão factual no nível da Astra a uma fração do preço. Luna, o nível mais rápido e barato, pontua no mesmo nível que o Opus 5 em esforço médio a 93% menos por tarefa, mirando fluxos de trabalho automatizados de alto volume. A leitura de Simon Willison é que o tier premium de primeira linha agora é uma corrida de dois cavalos entre Astra e Claude Fable 5.1, enquanto a verdadeira guerra de preços está acontecendo abaixo disso, com Opus 5.5, Sol e Grok 4.7 competindo por construtores conscientes de custo.
[07:23] Grok 4.7 Chega: Modelo Maior, Mesmo Preço $2/$6
A SpaceXAI lançou Grok 4.7 em 21 de setembro de 2026, comercializando-o como o modelo mais capaz da empresa para codificação e trabalho intelectual. O detalhe está no preço: chega ao mesmo $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída do Grok 4.6, com a mesma velocidade de serviço, e uma variante rápida opcional que dobra a velocidade de saída pelo dobro do preço.
Por baixo do capô é um modelo base maior que o Grok 4.6, treinado em uma corrida de aprendizado por reforço mais longa ponderada para problemas que levam muitas horas para serem completados. Esse treinamento extra aparece em melhor auto-verificação, manuseio de contexto longo e uma nova camada de instrução que nativamente entende o harness do Grok Bot para tarefas de conversação e conhecimento geral. A SpaceXAI também reconstruiu a pilha de salvaguardas, afirmando que o Grok 4.7 é o modelo mais forte que testou em recusas e resistência a jailbreak. No benchmark de biossegurança da LatchBio ele pontua 62,4%, e no HackerBench v0.3 deixa passar apenas 3,3% de prompts arriscados de dupla aplicação enquanto raramente bloqueia trabalho legítimo de segurança.
Em benchmarks, Grok 4.7 está na fronteira de preço-desempenho do CursorBench 4.0, com uma pontuação de alto esforço no DeepSWE v1.1 e marcas comparáveis no GDPval, AA Briefcase v1.1 e EEBench contra Fable 5.1 e GPT-6 Astra. A criação de documentos e apresentações melhorou sobre o Grok 4.6, e a SpaceXAI diz que parceiros selecionados de cibersegurança agora têm acesso por convite às suas capacidades de red team para pesquisa de defesa.
Está ao vivo hoje em Cursor, Grok Build, a Grok API, harnesses de codificação de terceiros e várias plataformas de roteamento de modelos e nuvem. Para quem já está rodando Grok 4.6 em um pipeline de produção, a atualização é efetivamente gratuita no nível da API — mude a string do modelo e você obtém o cérebro maior pela mesma conta.
[09:09] Nokia Libera o Código Aberto do AnyJev: Camada Sem Treinamento Torna LLMs Abertos Decisores Confiáveis
A equipe de pesquisa aplicada da Nokia lançou o AnyJev, uma biblioteca Python que transforma qualquer modelo de linguagem aberto em um modelo de decisão calibrado sem treinamento. A ferramenta atende a uma necessidade frequente em produção: selecionar uma resposta de um conjunto fixo em vez de gerar texto livre. Pode ser instalada pelo PyPI sob a licença Apache-2.0 e possui backends transformers e vLLM com pontuação de prefixo compartilhado para servir eficientemente.
O problema que a equipe aborda é que ler probabilidades diretamente dos modelos de linguagem produz dois erros consistentes. Primeiro, os modelos favorecem certos rótulos independentemente da entrada — o que a equipe chama de viés de priori, como preferir "Sim" em vez de "Não." Segundo, os modelos favorecem posições na lista de opções, então embaralhar a ordem muda a resposta. Ambas as falhas tornam a leitura ingênua de probabilidades não confiável para sistemas reais.
O AnyJev aplica duas correções. O L0 usa deslocamentos cíclicos: para uma pergunta com K opções, ele mostra a lista em K rotações diferentes, para que cada opção apareça em cada posição uma vez. Ele calcula a média dos resultados no espaço logarítmico como uma média geométrica, o que remove exatamente o viés de posição se esse viés for aditivo no espaço dos logits. O L0 também mantém uma média contínua das distribuições previstas em entradas reais e a divide com força 0,75 após observar 8 itens, corrigindo o viés de priori. O L1 adiciona temperature scaling por cima, requerendo 100 a 500 exemplos rotulados por tipo de pergunta. Isso reformula as pontuações de confiança sem mudar qual resposta fica em primeiro lugar.
No Qwen3-8B testado contra o benchmark BANKING77 — uma tarefa de classificação com 20 opções e 300 itens de teste — os logits brutos mudaram as respostas em 23% das vezes quando as opções foram reordenadas. O AnyJev L0 reduziu isso para 7,3%, e o L1 manteve em 7,7%. A acurácia melhorou de 74,7% para 80,7%. De forma mais prática, a fração de consultas que podiam ser decididas automaticamente com um limiar de erro de 5% subiu de 7,7% para 52%, significando que mais da metade de todas as decisões poderiam ser direcionadas com confiança em vez de escaladas para um humano.
A equipe testou a abordagem nos modelos Qwen, OLMo, Granite, Phi e Mistral, com o L0 reduzindo mudanças de ordem em todas as nove combinações de modelo e tarefa. Em um conjunto de dados de decisões digitadas, o Qwen3-32B com L1 alcançou um erro de calibração de 0,036 comparado a 0,144 relatado para o Jev, o modelo comercial de decisão que ele emula.
Para servir, desenvolvedores apontam o vLLM com prefix caching para um modelo hospedado e configuram um VLLMBackend no AnyJev. A equipe estima aproximadamente 0,25 segundos por decisão em batch 32 em um único H100 com K igual a 20. A biblioteca está disponível agora no PyPI.
[11:40] Diarização NVIDIA Nemotron 3 Rastreia Oito Falantes Sobrepostos ao Vivo
A NVIDIA lançou a Diarização Nemotron 3, um modelo open-weight de 100 milhões de parâmetros que responde a uma pergunta aparentemente simples sobre qualquer conversa: quem falou quando. O reconhecimento automático de fala fornece as palavras, mas sem atribuição, um resumidor não consegue dizer quem fez um compromisso ou quem levantou uma objeção. A diarização preenche essa lacuna.
O modelo rastreia até oito falantes e lida com vozes sobrepostas em um único checkpoint. O Streaming Sortformer anterior da NVIDIA chegava a no máximo quatro. As entradas são áudio de 16 kHz, canal único em formato wav, flac, opus ou mp3. Um mel-espectrograma com passo de 10 ms é empilhado por um fator de oito para produzir frames do encoder de 80 ms, que alimentam um Transformer de 31 camadas com embeddings posicionais rotacionais. Uma camada de convolução unidimensional faz upsample da atividade dos falantes de volta para 10 ms, produzindo um tensor de oito canais onde duas vozes ao mesmo tempo acendem dois canais.
Os falantes são ordenados por hora de chegada, então a primeira nova voz recebe o canal um e permanece lá através dos chunks de streaming. Dois mecanismos de memória mantêm isso estável: um Arrival-Order Speaker Cache mais uma fila FIFO.
No Diarization-Bench inicial da Voice Arena, que mede a taxa de erro de diarização em 139 conversas em inglês totalizando cerca de 22 horas, o modelo atingiu 14,72% versus 19,3% do sistema classificado em segundo lugar, uma redução relativa de aproximadamente 24%. Contra o baseline de quatro falantes a 1,04 s de latência, o erro relativo médio caiu 41% em oito condições, com uma queda de 65% no NOTSOFAR1 MHM. A taxa de transferência a 30,4 s atingiu 15.113x tempo real em uma NVIDIA RTX PRO 5000.
Os pesos são liberados sob a licença OpenMDW 1.1 para uso comercial. Caminhos de produção incluem Baseten e DigitalOcean, com mobile no dispositivo através do Argmax Pro SDK 3.
[13:21] OpenAI Estende Acesso ao Daybreak para Cibersegurança da Ucrânia
A OpenAI anunciou em 23 de setembro de 2026 que está estendendo o acesso ao seu programa Daybreak ao Governo da Ucrânia. O programa apoia a defesa cibernética de infraestrutura civil, de acordo com o OpenAI News.
A extensão coloca as ferramentas da OpenAI dentro da pilha defensiva protegendo sistemas civis Ukrainians de ameaças cibernéticas. Ao abrir o acesso ao Daybreak para um governo nacional, a OpenAI está tratando infraestrutura civil como uma categoria que merece suporte direto de fornecedor, em vez de rotear esse suporte através de intermediários ou parcerias de terceiros.
O Daybreak é posicionado como o programa da OpenAI para trabalho de defesa cibernética em sistemas voltados para civis, e a Ucrânia se torna uma receptora direta de acesso governamental estendido sob esse programa.
O que isso muda na prática: qualquer organização construindo ferramentas de defesa de infraestrutura crítica agora tem outro ponto de dados mostrando que grandes fornecedores de modelos estão dispostos a enviar programas de acesso governamental direto para trabalho cibernético civil, não apenas parcerias de pesquisa ou engajamentos consultivos. Para construtores trabalhando em ferramentas adjacentes — pipelines de inteligência de ameaças, detecção de anomalias, triagem automatizada ou copilotos de resposta a incidentes — isso confirma que o comprador de defesa civil é real, ativo e está conseguindo relacionamentos diretos com fornecedores.
A fonte primária é o post de imprensa da OpenAI datado de 2026-09-23, publicado às 13:00 UTC.
[14:32] Resumo de pesquisa: Um benchmark para o 'gosto' de agentes em tarefas longas
Um projeto de pesquisa chamado TasteBench está fazendo uma nova pergunta sobre agentes de IA que trabalham em tarefas longas: quão boas são as decisões que eles tomam ao longo do caminho, não apenas se o processo termina em sucesso? O artigo, atualmente em alta no feed diário do HuggingFace, usa a palavra "taste" (gosto) para descrever a capacidade de um agente de escolher a próxima jogada certa — qual hipótese perseguir, qual implementação construir — dentro de uma tarefa que se estende por horas de trabalho. Os benchmarks existentes avaliam a resposta final. Este foca nas escolhas de ramificação em si. Os autores argumentam que para engenharia de software e fluxos de pesquisa, essas escolhas no meio do processo são o que realmente decide o resultado. Um benchmark que os isola poderia permitir que equipes comparassem agentes em uma dimensão que atualmente têm que adivinhar. Vale observar: se outros laboratórios o adotam, ou constroem sua própria versão de um indicador de qualidade de decisão para trabalhos de longa duração.
[15:29] Resumo de pesquisa: GameHorizon submete agentes de IA a 5.000 horas de jogabilidade AAA
Uma equipe lançou o GameHorizon, um benchmark e dataset que submete agentes de IA a 5.000 horas de jogabilidade gravada em 21 jogos AAA — incluindo Valorant, Minecraft, Grand Theft Auto V, Palworld e Elden Ring. Cem jogadores humanos experientes fizeram as gravações, e cada ação é marcada com timestamp e rotulada com uma pirâmide de três níveis de instruções em linguagem: ações primitivas, operações de horizonte curto e objetivos e estratégias mais longos.
O ponto é testar se os modelos podem planejar em horizontes temporais — descobrir o próximo pressionamento de tecla, o próximo subobjetivo e uma estratégia de múltiplas etapas — sem depender de jogabilidade ao vivo instável. O benchmark vem com 5.000 perguntas offline de múltipla escolha e 20 tarefas online passo a passo divididas em 62 subtarefas, para que avaliadores possam identificar exatamente onde um modelo falha.
A equipe testou 47 modelos abrangendo famílias de visão-linguagem, GUI, codificação e agentes de jogos. O GameHorizon é o primeiro dataset em grande escala focado em AAA que combina ações gravadas por humanos, instruções densas e avaliação offline reproduzível em um só lugar.
[16:29] NVIDIA enquadrou a segurança do agente de IA como uma disciplina de engenharia
A NVIDIA publicou um blog em 21 de setembro argumentando que proteger agentes de IA não é um problema de pesquisa, é um problema de engenharia. O post argumenta que defesas só contam quando vêm com requisitos definidos, controles executáveis, um responsável nomeado e evidências documentadas de que os controles realmente funcionam.
A pilha de agentes, segundo o blog, se divide em três camadas: modelos fornecem capacidades, harnesses organizam contexto, ferramentas e fluxos de trabalho, e ambientes de runtime fornecem a infraestrutura onde as ações são executadas. Cada camada carrega suas próprias responsabilidades de segurança, e a proteção precisa se manter em todas as três à medida que dados e instruções se movem pelo sistema.
O exemplo concreto que o post percorre: um agente solicitado a atualizar um registro de cliente encontra instruções maliciosas em um documento anexado e tenta exportar os dados para um destino externo. Uma política de rede bloqueia a transferência de saída. Logs protegidos capturam a tentativa de chamada de ferramenta, a decisão de autorização e para onde ela estava indo. O agente tem permissão para atualizar o registro, mas não para exportá-lo, e não pode conceder a si mesmo esse acesso extra.
A NVIDIA aponta seu próprio runtime OpenShell de código aberto como uma fronteira executável — um ambiente de execução em sandbox que impõe limites de arquivo, rede e processo fora do raciocínio do agente. O DefenseClaw da Cisco adiciona governança por cima, e o JFrog integra para escanear e verificar habilidades do agente antes que elas sejam permitidas para executar.
Como evidência, o post pede testes que bloqueiem tentativas de escalação de credenciais e transferências não autorizadas de dados, repetidos após qualquer mudança significativa de modelo ou ferramenta, com um responsável nomeado aprovando a prontidão. Ele destaca o SafeMind da CrowdStrike para simulações de ataque repetidas, o Prisma AIRS da Palo Alto Networks para red teaming contínuo, o VulnHunter da Capital One para revisão de código assistida por IA e o Spectra Assure da ReversingLabs para detectar malware em dependências de software.
A mensagem de encerramento é compartilhada abertamente: descobertas pós-incidente devem se transformar em testes repetíveis, e a Aliança Aberta de IA Segura existe para circular o que funciona na comunidade de segurança.
[18:30] Thinking Machines Lab move inferência de modelos abertos para Crusoe Cloud sob acordo de $65 milhões
A Thinking Machines Lab assinou um acordo anual de $65 milhões para executar inferência de seus modelos abertos na Crusoe Cloud, disseram as empresas em 23 de setembro. O acordo direciona o tráfego de produção pelo Crusoe Managed Inference, uma camada de serviço que a empresa posiciona em torno de throughput, relação preço-desempenho e confiabilidade em vez de poder bruto de treinamento.
Para desenvolvedores, a questão prática é o que muda na API. Os pesos e comportamento do modelo permanecem inalterados — os modelos abertos da Thinking Machines Lab permanecem abertos. O que muda é a pilha de servir por baixo deles, que é a peça que determina latência, tempo de atividade e custo por token. A Crusoe está vendendo Managed Inference como um ambiente ajustado em vez de acesso bare-metal, então o laboratório repassa o planejamento de capacidade em troca de um acordo gerenciado.
O acordo também é um sinal sobre onde a inferência séria de modelos abertos está se consolidando. A Crusoe se posicionou como uma neocloud construída para cargas de trabalho de IA, e conseguir um compromisso anual de oito dígitos por vários anos de um laboratório de IA notável é o tipo de cliente de referência que molda a próxima rodada de avaliações de compradores. O anúncio apresenta throughput e confiabilidade como as vitórias principais, com relação preço-desempenho como a terceira perna — um eco deliberado de como hyperscalers comercializam suas próprias camadas de inferência.
Uma coisa vale observar é o que isso significa para desenvolvedores que já executam modelos da Thinking Machines Lab em outro lugar. Se você é um cliente atual, espere a mesma superfície de modelo, mas um provedor diferente atrás dos endpoints, o que vale a pena reavaliar uma vez que o tráfego mudar. A questão maior é se a Crusoe pode converter esse único cliente âncora em um padrão mais amplo de laboratórios de modelos abertos terceirizando sua inferência em vez de executá-la internamente.
[20:11] Jev retorna probabilidades em vez de texto, undercutando o GPT-5 Nano no preço
A TypeSafe AI revelou o Jev no início deste mês, e é um tipo diferente de modelo do que a maioria das pessoas está acostumada. A empresa chama esses modelos de "System One"; Simon Willison e Maggie Appleton ambos preferem o termo "modelos de decisão". O formato é incomum: o Jev ainda recebe texto como entrada, mas em vez de gerar texto de volta, retorna números de ponto flutuante — probabilidades, pontuações de confiança e distribuições sobre categorias.
Você constrói um objeto "state" descrevendo o que quer que esteja analisando — um artigo, um registro de cliente, um pedaço de dados semi-estruturados — e então anexa uma ou mais perguntas tipadas. O Jev responde cada uma com uma probabilidade estruturada em vez de uma frase. Existem três formatos de pergunta. Perguntas "Noul" são sim/não — você declara uma proposição, e o Jev retorna um número entre 0 e 1 representando o quão confiante está de que a afirmação é verdadeira; o nome, confirmado pelo CEO da empresa no Hacker News, é abreviação de Bernoulli, como na distribuição de Bernoulli. Perguntas de escolha recebem uma lista de opções rotuladas e retornam uma distribuição de probabilidade entre elas. Perguntas de pontuação pedem uma classificação ao longo de uma sequência de níveis numéricos.
O preço é o que o torna interessante para desenvolvedores. A Jev cobra apenas por tokens de entrada — saída é gratuita — e a taxa de entrada é $0,042 por milhão de tokens. Isso fica abaixo do GPT-5 Nano da OpenAI a $0,05 por milhão de tokens, que a TypeSafe posiciona como o benchmark que acabou de superar. Como a saída é essencialmente gratuita, a Jev se encaixa naturalmente em pipelines que distribuem muitas decisões paralelas por documento.
Para desenvolvedores, isso significa que a Jev vale a pena em qualquer lugar onde você já tivesse adicionado um prompt de classificação a um LLM geral. É uma boa opção para roteamento, triagem ou camadas de moderação de conteúdo onde você quer um número de confiança em vez de um parágrafo. Combine com um modelo de texto regular downstream para qualquer coisa que precise de uma resposta real.
[22:07] Um Navegador Auto-Hospedado Que Permite Agentes de IA Ignorarem Captchas
Um novo release do invisible_playwright_mcp dá aos agentes de IA uma forma auto-hospedada de navegar na web sem ativar defesas comuns contra bots. O projeto é um servidor Python que usa o Model Context Protocol, o mesmo padrão que os modelos usam para chamar ferramentas externas, e envolve o Playwright, a biblioteca popular de automação de navegador, em torno de uma build stealth não detectada e anti-detecção do Firefox. O resultado é uma sessão de navegador que imita um usuário regular em vez de um script headless, o que ajuda a passar em verificações de fingerprint e pular captchas. A versão 0.70.0 foi lançada em 23 de setembro, e o repositório no GitHub agora mostra mais de 31.600 estrelas.
Para desenvolvedores, o appeal é direto. Automação de navegador que antes exigia um serviço pago de resolução de captcha ou soluções alternativas frágeis agora pode ser tratada dentro de uma ferramenta que um agente já pode chamar. Qualquer coisa que precise de uma sessão real — fazer login em um dashboard, raspar um site atrás de paredes básicas de bots, preencher formulários multi-step, ou executar um loop de "uso de computador" — pode rodar através desse servidor no seu próprio ambiente. Isso mantém credenciais locais e remove uma dependência de terceiros do loop.
O projeto é open-source e auto-hospedado, então a ressalva usual se aplica: navegadores stealth são ferramentas de corrida armamentista, e um Firefox anti-detecção de um projeto pode ser fingerprintado amanhã. Acompanhe as mudanças upstream do Firefox, fixe a versão, e mantenha o uso dentro dos termos do site e da lei aplicável. Se seu agente está actualmente preso atrás de uma parede de captcha, esta é uma das opções open mais maduras para experimentar.
[23:38] OpenAI lança MentalHealthBench para testar respostas de IA em conversas de saúde mental
A OpenAI publicou o MentalHealthBench em 23 de setembro. É um benchmark — um conjunto de avaliação padronizado — para medir como sistemas de IA respondem em conversas de saúde mental, pontuado em duas dimensões simultaneamente: ser útil e ser seguro.
O que o distingue, segundo o anúncio da OpenAI, é que o benchmark é informado por especialistas. Especialistas em saúde mental participaram da formação dos cenários de conversa realistas nos quais o benchmark se baseia. Esse detalhe importa porque testes de segurança genéricos tendem a perder a textura de uma conversa real — como um modelo lida com alguém em sofrimento, conversa através de um momento de pânico, ou sabe quando apontar um usuário para ajuda profissional.
O público implícito são desenvolvedores e pesquisadores construindo IA conversacional para contextos sensíveis — produtos adjacentes à terapia, bots de suporte, aplicativos de bem-estar, e os modelos subjacentes a eles. Um benchmark público dá a essas equipes um ponto de referência compartilhado em vez de depender de demos selecionadas.
O framing também enfatiza uma pontuação dupla. Um modelo pode ser útil mas inseguro — engajar calorosamente enquanto direciona o usuário para algum lugar prejudicial — ou seguro mas inútil, recusando ou desviando quando o usuário genuinamente precisa de orientação. O MentalHealthBench rastreia ambos, o que significa que qualquer número de manchete único subestimará o quadro. Equipes Shipando neste espaço agora têm uma régua comum, e elas precisam ler ambas as extremidades dela.
Fique de olho: se laboratórios de terceiros adotam o benchmark, e se a OpenAI publica pontuações de baseline para seus próprios modelos junto com ele. Um benchmark sem números publicados é basicamente apenas uma rubrica.