
GPT-6 Astra decifra enigma de 2005 enquanto Mistral lança flagship de 675B sob Apache 2.0
A Mistral lança um modelo de 675B com pesos abertos sob a licença Apache 2.0 e apresenta o Devstral 2 2512, otimizado para agentes de codificação de longa... Show notes: https://tobyonfitnesstech.com/pt/podcasts/episode-117/
🎧 Listen to EpisodeEpisódio 117 — 25 de setembro de 2026
[00:00] Gancho do episódio
Hermes Agent v2026.9.24 foi lançado em 24 de setembro de 2026 como um artefato estável único, marcado como v0.21.5 e consolidando aproximadamente 460 pull requests mesclados desde v0.21.4, para imagens Docker, Hermes Cloud e implantações hospedadas. A Mistral seguiu com Devstral 2 2512, um modelo de codificação de código aberto com 123 bilhões de parâmetros destinado a agentes de engenharia de software de longa duração, e listou Mistral Large 3 2512 no OpenRouter—um design de mistura de especialistas esparsa com 675 bilhões de parâmetros e 41 bilhões de parâmetros ativos sob Apache 2.0. O GPT-6 Astra da OpenAI decifrou autonomamente uma mensagem Enigma do Exército Alemão de 1941, designada MVUEH, que havia resistido a todas as tentativas de criptoanálise desde que foi postada publicamente em 2005. O Claude Opus 5.5 da Anthropic foi aberto dentro do GitHub Copilot com uma janela de contexto de 1M de tokens, e a Ando saiu do modo furtivo com uma competidora do Slack construída para que agentes de IA obtenham suas próprias identidades e caixas de entrada.
[02:00] Leitura do Lançamento do Agent Stack: Hermes Agent v2026.9.24
Hermes Agent marcado como v0.21.5 em 24 de setembro de 2026 sob a tag de lançamento v2026.9.24. O editor o descreve como um patch que consolida aproximadamente 460 pull requests mesclados desde v0.21.4 em um único artefato estável para consumidores downstream—imagens Docker, Hermes Cloud e implantações hospedadas. Medido no commit f97608f178d1ffeca59860195ab7da295f7c8e5f, a janela contém 1.610 commits não-merge em 4.828 arquivos alterados, com aproximadamente 164.000 linhas adicionadas e 149.000 removidas. O relatório completo cobrirá os destaques e áreas de recursos desde v0.21.0 será adiado para v0.22.0.
As notas indicam várias áreas que foram incluídas na janela. No Desktop, isso inclui uma onda do SDK de plugins cobrindo uma API de rascunho de compositor, slots de lista de sessões e decoração de linhas, preferências de navegação lateral, provedores de rótulo de modelo, pontes tipadas de configurações/habilidades/ferramentas/perfis, um primitivo de embed isolado, um slot de configurações de aparência e uma ponte de eventos públicos para backends de plugins. Um modo de interface Simples/Avançado fica ao lado de uma página de Conectores que substitui a aba MCP, com um caminho "Conectar agora" para servidores MCP de plugins recém-instalados e integração que oferece plugins de catálogo ao lado de conectores. Os catálogos de Desktop em francês, alemão e espanhol são lançados completos, e uma configuração de direção de texto RTL/LTR chega. O compositor e os seletores de Configurações aceitam entradas de modelos personalizados, atalhos de voz de tecla de função e ditação são conectados, e o multiplexador de host ganha parada/início/reinício por perfil com uma opção gateway.standalone para excluir um perfil.
Na CLI e TUI, uma doca ao vivo mostra o /goal em espera e os prompts na fila; entregas de webhook agora espelham na sessão de chat alvo; imagens -desktop hospedadas incluem Bot Screen; e o quadro kanban ganha um modal de ticket de duas colunas com texto de tarefa em markdown. Os catálogos da Nous e OpenRouter ganham GPT-6 Sol/Terra/Luna e Claude Opus 5.5. Plugins oficiais chegam para Blender Lab e aplicativo NVIDIA e aplicativos Broadcast. Um longo trecho de trabalho de performance de caminho crítico tocou carregamento de configuração, registro de ferramentas, manipulação de mensagens do gateway e seletor de modelo, e dezenas de plugins da comunidade entraram no catálogo. Para caminhos de atualização, o editor aponta os usuários para hermes update para instalações git ou uma nova execução do one-liner do instalador; imagens Docker e Hermes Cloud são construídas a partir de nousresearch/hermes-agent:v2026.9.24.
[03:19] Devstral 2 2512 da Mistral Tem como Alvo Agentes de Codificação de Longa Duração
A Mistral lançou o Devstral 2 2512, e a manchete é o tamanho. É um transformer denso de código aberto com 123 bilhões de parâmetros destinado diretamente à codificação agentiva, a categoria de trabalho de software onde uma IA não apenas responde uma pergunta, mas executa uma tarefa de múltiplas etapas através de edições de arquivos, chamadas de ferramentas e rodadas de verificação.
A alavanca prática é a janela de contexto. Devstral 2 2512 aceita 262.144 tokens em uma única passagem. Isso é grande o suficiente para manter uma base de código substancial mais um longo fio de ações anteriores do agente sem forçar o fluxo de trabalho a resumir ou descartar o histórico. Para construtores, isso importa porque o modo de falha usual para agentes de codificação de longa duração é perder o fio do que estavam fazendo; uma janela maior empurra essa falha mais para longe.
A distribuição é direta. O modelo está disponível no OpenRouter sob o identificador mistralai/devstral-2512, então qualquer pessoa já roteando requisições através desse marketplace pode apontar um agente para ele sem criar nova infraestrutura. A Mistral está posicionando-o como uma opção de código aberto de última geração para agentes de engenharia de software, o tipo de trabalho que em grande parte padronizou para sistemas fechados. Para construtores, a pergunta interessante é se um transformer denso totalmente aberto nessa escala pode se manter contra modelos de codificação fechados em execuções reais de agentes, onde o trabalho envolve uso de ferramentas, recuperação de erros e longas cadeias de tarefas. Fique de olho em benchmarks independentes em repositórios reais em vez de puzzles de codificação isolados.
[04:46] Mistral Lança um Flagship de 675B de Código Aberto sob Apache 2.0
A Mistral listou o Mistral Large 3 2512 no OpenRouter, chamando-o de modelo mais capaz da empresa até hoje. O modelo usa uma arquitetura de mistura de especialistas esparsa: 41 bilhões de parâmetros ativam por token de um total de 675 bilhões, o que significa que o custo de computação e memória de executá-lo é muito mais próximo dos 41B do que dos 675B completos. A janela de contexto é de 262.144 tokens, grande o suficiente para manter um documento longo ou uma base de código considerável em um único prompt sem fragmentação agressiva.
O detalhe notável é a licença. Mistral Large 3 2512 é distribuído sob Apache 2.0, que permite uso comercial, redistribuição e modificação com atribuição. Isso é excepcionalmente permissivo para um lançamento de código aberto de última geração e remove muita da fricção legal que empurra equipes para modelos menores ou mais restritos quando querem auto-hospedar, fazer fine-tuning ou construir produtos comerciais em cima. Para construtores, a pergunta prática é se o modelo atende às expectativas assim que avaliações independentes começarem a circular. A listagem atual do OpenRouter fornece comprimento de contexto, detalhes de arquitetura e a licença, e essa é a imagem agora. Até que números de benchmark cheguem, este é o porta-bandeira de código aberto vale a pena avaliar contra o que você estava rodando antes.
[06:01] GPT-6 Astra Resolve Mensagem Enigma que Deixou Criptoanalticos Perplexos Desde 2005
Por mais de duas décadas, uma mensagem Enigma da Frente Oriental ficou sem solução em um site de pesquisa público. Em 15 de setembro de 2026, o criptógrafo Carter Leffen apontou o GPT-6 Astra da OpenAI para o arquivo Crypto Cellar Research de mensagens de guerra não decifradas e pediu para ele tentar decifrá-las. O modelo escolheu o candidato mais promissor, MVUEH, uma mensagem do Exército Alemão de 1941 que havia resistido a todas as tentativas desde 2005, e a decifrou em cerca de dois dias.
O trabalho foi quase inteiramente do modelo. GPT-6 Astra notou que MVUEH provavelmente compartilhava texto simples com outra mensagem do mesmo dia, Nr. 173 SIPVX, que Alex Shovkoplyas havia decifrado em 2017. Ele então escreveu código Python e C++ para um simulador Enigma e pesquisa estilo Bombe, ancorado no nome de lugar repetido "ROSENOW ROSENOW" como ajuda de decodificação. A chave recuperada diferiu completamente da chave diária usada por outras mensagens de 10 de julho de 1941: a ordem das rodas era 253 em vez dos habituais 512, e a roda esquerda do Enigma avançou na 72ª letra, uma complicação rara que tentativas humanas anteriores não haviam penetrado. O texto cifrado original também continha erros de transcrição que haviam atrapalhado decifrações anteriores.
O modelo também trouxe à tona referências aos volumes dos Arquivos Federais Alemães, RS 3-3/20a e RS 3-3/63b, que correspondem a holdings reais, mas não estavam listados no site do Crypto Cellar. Frode Weierud, o veterano criptoanalista que administra o arquivo, disse que encontrar essas referências levou várias semanas e chamou o comportamento do modelo de "como um criptoanalista e pesquisador de arquivo muito profissional".
A história obteve uma pontuação de 733 no Hacker News após ser publicada via OpenAI News em 23 de setembro. Para os desenvolvedores, a conclusão é menos sobre criptografia e mais sobre o que um modelo agentivo pode fazer quando recebe um alvo de pesquisa aberto e um conjunto de dados públicos: escolher um fio, construir suas próprias ferramentas e executar uma investigação de ponta a ponta.
[07:58] Claude Opus 5.5 chega ao GitHub Copilot para codificação agentiva
O Claude Opus 5.5 da Anthropic agora é selecionável dentro do GitHub Copilot, dando aos assinantes acesso direto ao principal modelo de raciocínio da empresa através de seus editores. O blog do GitHub o posiciona para codificação agentiva, tarefas agentivas de longa duração e trabalho baseado em conhecimento.
O mecanismo principal é uma configuração de "raciocínio adaptativo, esforço máximo, fallback padrão": o modelo pensa profundamente por padrão e recorre a respostas mais leves quando apropriado. Uma variante não-generativa também pode existir. As entradas aceitam texto e imagens, as saídas são texto, e a janela de contexto se estende a 1 milhão de tokens — aproximadamente 1.500 páginas de Arial 12pt — grande o suficiente para conter uma base de código inteira ou uma sessão de várias horas em um único prompt.
No Intelligence Index v4.3.2 da Artificial Analysis, que combina dez avaliações incluindo AA-Briefcase, Terminal-Bench 4.0, SciCode e Humanity's Last Exam, o Opus 5.5 pontua 58 contra uma mediana de 26. O anúncio do Hacker News do GitHub recebeu 331 votos positivos no mesmo dia. O trade-off é verbosidade e preço: o modelo emitiu 260 milhões de tokens durante a execução do índice (mediana de 88 milhões), os preços são de $4 por milhão de tokens de entrada e $20 por milhão de saída, e uma tarefa média do índice custa $5,98. Um desconto de cache de 95% ameniza essa conta para prefixos de prompt repetidos.
Para os desenvolvedores, a mudança prática é o alcance. Refatorações longas, fluxos de codificação agentiva de várias etapas e tarefas mistas de texto e imagem — pareando uma captura de tela com uma mudança de código, por exemplo — agora rodam dentro do Copilot sem trocar de ferramentas. O que observar a seguir é se a Anthropic lançará a variante não-generativa que a Artificial Analysis sinaliza como potencialmente existente, já que um irmão mais barato é o que tornaria este modelo um driver diário em vez de um especialista.
[09:39] Ando sai do modo stealth com um rival do Slack construído para humanos e agentes de IA
A Ando, uma startup fundada por Sara Du, saiu do modo stealth na quinta-feira com um aplicativo de mensagens para equipes que se anuncia como um substituto completo do Slack — mas com agentes de IA tratados como colegas de primeira classe em vez de bots adicionados.
A plataforma dá a cada agente sua própria identidade e caixa de entrada, com canais, DMs, conversas em grupo e até chamadas transcritas ao vivo. Os agentes podem navegar pelos canais, decidir quais ingressar, entrar em conversas sem serem mencionados e enviar mensagens para colegas humanos por conta própria quando acham que algo é importante. Nenhuma aprovação necessária.
Du teve a ideia após passar 2025 ajudando empresas a construir servidores MCP. As pessoas continuavam perguntando como usar agentes de dentro do Slack, e o atrito — mover mensagens para lá e para cá, alimentar os agentes com contexto, queimar tokens — apontava para um problema de design mais profundo. O Slack e o Teams foram construídos para um mundo que estava começando a ficar para trás, disse ela. O problema maior, na sua visão, são os "proxies de carne" — humanos retransmitindo a saída do agente para o resto da empresa.
A Ando levantou $20 milhões em financiamento pré-seed e seed da Accel, Index Ventures e Emergence para contratar mais pessoas e "queimar mais tokens". Clientes de software, imóveis e finanças em 15 países já estão usando, embora a maioria das equipes seja pequena.
Um exemplo concreto do que muda: Du descreveu um agente que percebeu dois canais separados debatendo o mesmo problema. Sem ser solicitado, ele reuniu todos em um chat em grupo, apresentou o contexto compartilhado e sugeriu uma decisão. Os agentes poderiam gerenciar pessoas melhor do que os humanos porque conseguem processar muito mais mensagens em um período de tempo mais curto, disse ela.
Não é um espaço incontestado. O Slack reconstruiu seu bot como agente, a Microsoft entrelaçou o Copilot no Teams, e o recently lançado Buzz de Jack Dorsey visa desenvolvedores. Mas Du vê espaço para algo construído nativo de IA em vez de retroajustado.
[11:38] Modelo de Decisão Aberto de 340M do Fastino Executa Guardrails de Agentes em CPU
O modelo é construído para as pequenas mas caras chamadas de julgamento que ficam dentro de cada agente de IA — os momentos de "qual ferramenta devo usar", "isso é seguro", "a qual categoria isso pertence". A Fastino Labs chama de GLiNER2.5-Decide, um modelo de decisão de código aberto com 340 milhões de parâmetros lançado em 24 de setembro.
Em vez de gerar texto, você entrega a ele conteúdo mais um esquema de perguntas tipadas, e ele retorna respostas estruturadas. Cada resposta vem com uma distribuição de probabilidade, uma pontuação de confiança e flags de viabilidade. Os esquemas podem expressar regras entre perguntas, então uma detecção em um lugar pode forçar um veredicto em outro.
O exemplo de guardrail mostra por que isso importa. Decodificado independentemente, o modelo sinalizou um ataque de injeção de prompt com confiança de 0,82 e simultaneamente rotulou o mesmo prompt como seguro com 0,52. A decodificação conjunta aplica uma regra de que qualquer dano detectado requer um veredicto de inseguro, colapsando a resposta para safety=unsafe e harm_type=prompt_injection juntos. O código downstream agora tem um sinal consistente para bloquear.
É um classificador não-generativo construído em um codificador DeBERTa-v3-large e ajustado fino do gliner2-large-v1. Os pesos são distribuídos sob Apache 2.0; a instalação é pip install gliner2, e funciona em CPU, GPU ou totalmente isolada. A Fastino também oferece inferência hospedada através da API GLiNER.
O conjunto interno da Fastino, Fast Decisions, cobre 5.100 exemplos em 17 conjuntos de dados. O GLiNER2.5-Decide obteve média de 60,1% de correspondência exata, liderando o conjunto em 9 dos 17 conjuntos de dados e superando uma baseline de classe Qwen 3.5 de 4 bilhões de parâmetros em cerca de 2,6 pontos. Em intenção de suporte, pontuou 75,3%.
Latência em batch um com esquema de 15 labels: 167 milissegundos p50 em um Xeon de 48 núcleos, 38 milissegundos em um V100. Dois siblings completam a família — uma variante de 1B com 59,6% e um modelo multilíngue de 287M com 56,7%.
[13:22] Black Forest Labs Lança FLUX 3 Action: Um Cérebro Robótico de 7B
A Black Forest Labs lançou o FLUX 3 Action, um modelo de pesos abertos com 7 bilhões de parâmetros que diz aos robôs o que fazer ao imaginar o que vai acontecer. Ele lê frames de câmera, o estado atual do robô e uma instrução de texto, depois gera frames de vídeo futuros e o próximo trecho de movimentos do robô em uma única previsão conjunta. No leaderboard RoboLab-120, que testa 120 tarefas de mesa em simulação, o FLUX 3 Action pontua 42,92% de sucesso nas tarefas, colocando-o à frente do NVIDIA Cosmos 3 Nano com 36,8%, apesar de rodar em um backbone muito menor. A questão prática da velocidade é o que torna isso interessante. O Cosmos 3 Nano precisa de aproximadamente 4,7 vezes mais tempo de processamento que o π0.5 por segundo de movimento do robô em um B200. O FLUX 3 Action fecha essa lacuna com uma arquitetura menor e destilação de guidance. O checkpoint base roda 1,52 a 3,95 vezes mais rápido que o Cosmos 3 Nano em FP8 em GPUs de workstation e datacenter, e a variante com destilação de passos roda até 2,28 vezes mais rápido que o π0.5 no mesmo hardware. O tradeoff é que os checkpoints base e com destilação de guidance preveem 2,13 segundos de movimento por chamada versus 1,0 segundo para o π0.5, então a vantagem de velocidade depende do seu hardware e de quanto movimento sua tarefa precisa. Os requisitos de memória são o gargalo principal para implantação. A política DROID completa precisa de aproximadamente 32 GB de memória GPU em BF16 em um H200. Com quantização FP8 e offload do codificador de texto, ela cabe em uma placa de 24 GB. A Black Forest Labs também integrou o modelo no Hugging Face LeRobot e suporta NVIDIA Jetson para cenários de edge. Em hardware real, uma avaliação às cegas com a Positronic Robotics em um braço Franka rodou 30 tentativas em 10 tarefas DROID. O FLUX 3 Action completou 28 de 30 tentativas. O Cosmos 3 Nano pontuou 27, DreamZero 20 e π0.5 apenas 13. As equipes podem fazer fine-tuning do modelo em suas próprias demonstrações. A Black Forest Labs publicou uma receita DROID e uma receita SO-101 LoRA, mostrando uma habilidade de pick-and-place aprendida com aproximadamente 200 exemplos. Os pesos, código e receitas são distribuídos sob a FLUX Kommunity License, que permite uso não comercial.
[15:29] Oracle Invoca Força Maior em Centro de Dados de IA no Novo México
A Oracle está erguendo um escudo financeiro ao redor de uma de suas maiores apostas em infraestrutura de IA. A empresa enviou um aviso de força maior ao desenvolvedor do Project Jupiter, um enorme centro de dados sendo construído no Novo México por uma unidade da Blue Owl Capital. A cláusula permite que a Oracle atrase pagamentos se o local perder o prazo de ficar online em 2028. A Oracle não está tentando se afastar como o principal inquilino — ela está protegendo suas obrigações enquanto o projeto enfrenta oposição pública e obstáculos regulatórios.
O enquadramento é importante para quem acompanha a expansão de IA. Cláusulas de força maior geralmente ficam em segundo plano para desastres naturais ou choques de supply, então ver um inquilino de nuvem invocar uma em um site ativo sinaliza o quanto de exposição financeira está em jogo em cada megawatt de capacidade. Se a Oracle está se preparando para o Project Jupiter atrasar além de 2028, a empresa quer opcionalidade em seus gastos de capital em vez de um resultado binário de cumprir ou cancelar.
O projeto já enfrentou oposição e fricção de licenciamento, e um prazo de 2028 começa a parecer aspiracional quando energia, regulamentação e cadeias de suprimentos todas pressionam um construtor ao mesmo tempo. A proteção da Oracle também envia um sinal silencioso para a Blue Owl: o inquilino âncora quer flexibilidade, não necessariamente uma renegociação da locação em si.
A leitura prática é direta. Roteiros de capacidade são contratos antes de serem concreto, e este aviso é um dos primeiros sinais públicos de que um hyperscaler está tratando seus próprios compromissos dessa forma. Fique de olho se outros inquilinos em projetos similares buscam a mesma proteção quando seus cronogramas oscilam.
[17:06] O grog da Monkey Island realmente poderia dissolver uma caneca em 35 segundos? Um químico modela isso.
Um químico da Universidade de Groningen realmente fez as contas sobre um dos puzzles mais famosos dos games: se o grog em The Secret of Monkey Island realmente poderia corroer uma caneca de estanho em 35 segundos. O artigo, publicado no Journal of Geek Studies, trata o comportamento do jogo como um problema inverso, partindo da taxa de corrosão observada e trabalhando de trás para frente para estimar o que o líquido precisaria conter.
O autor, afiliado ao Instituto ENTEG na Faculdade de Ciência e Engenharia, usou a Special Edition de 2009 distribuída pela Steam e cronometrou o tempo de vida da caneca com um cronômetro em aproximadamente 35 segundos. Ele assumiu que a caneca era de estanho, modelada como estanho puro, com 2mm de espessura de parede escolhido como estimativa aproximada porque o jogo não oferece medição. A partir disso, ele estimou a oferta de prótons necessária para perfurar essa parede dentro do tempo observado.
Ele então comparou essa necessidade com os ingredientes do grog listados no diálogo do jogo: ácido sulfúrico, ácido de bateria, querosene, propilenoglicol, adoçantes artificiais, rum, acetona, corante vermelho nº 2, graxa de eixo, pepperoni e o misterioso SCUMM. O artigo conclui que ácido sulfúrico e ácido de bateria poderiam plausivelmente causar a corrosão, enquanto a maioria dos outros ingredientes ou não ataca estanho diretamente ou na verdade retardaria as coisas cobrindo a superfície do metal. O autor descreve o modelo como semi-quantitativo e nota que nenhum dos componentes listados explica a brilhante cor verde que o grog adquire no jogo.
O post recebeu um score de 137 no Hacker News, evidência de que até uma aventura point-and-click de 1990 pode hospedar um problema real de química se alguém se botherar em levá-lo a sério.
[18:50] IA Que Pensa em DNA Expande a Fronteira de Bio-Segurança
A Radical Numerics, uma nova empresa fundada por pesquisadores que anteriormente construíram os modelos de linguagem genômicos Evo e Evo-2 no Arc Institute, está escalando essas capacidades para uma gama mais ampla de problemas biológicos. Aqueles modelos anteriores geravam genomas inteiros de bacteriófagos do zero, e os vírus sintetizados se provaram funcionais em laboratório. Agora a equipe, liderada pelo CEO Eric Nguyen, está empurrando modelos de linguagem genômicos além do DNA para RNA e proteína, aproveitando o fato de que sequências de DNA contêm marcadores naturais para genes e as sequências que codificam proteínas. Essa estrutura embutida permite que o mesmo modelo lide com múltiplas linguagens biológicas antes mesmo de treinar em estrutura 3D de proteínas, epigenética ou linguagem natural. Em um experimento revelado, a Radical Numerics mostrou um modelo melhorando progressivamente RNA aptâmeros pareados com pontuações de desempenho, depois pediu que ele continuasse a trajetória por conta própria. O modelo recapitulou sequências de maior pontuação que não lhe foram mostradas, sugerindo que ele aprendeu não apenas correspondência de padrões, mas otimização ativa na linguagem do DNA. A equipe argumenta que as mesmas capacidades que impulsionam designs mais rápidos de vacinas e terapêuticos também importam para defesa. À medida que laboratórios de IA de fronteira sinalizam bio-segurança junto com cyber-segurança como uma preocupação principal, a questão é se os defensores podem se mover rápido o suficiente. A Radical Numerics está apostando em impulsionar a fronteira com mais força em vez de segurar. A empresa inclui Michael Poli, anteriormente cientista fundador na Liquid AI, como cientista-chefe de IA; Stefano Massaroli, ex-pós-doutorando com Yoshua Bengio e membro da equipe fundadora na Liquid AI, como presidente; e Armin Thomas, ex-pós-doutorando da Stanford que trabalhou com Chris Ré, como CTO. Uma coisa para acompanhar: como a generalização cross-modal em modelos de linguagem genômicos se comporta em toolchains de detecção de patógenos e desenvolvimento de vacinas como ativos defensivos e potenciais preocupações de superfície de ataque.
[20:38] Resumo de pesquisa: Pesquisadores Treinam Modelos de Vídeo para Rastrear Objetos Ocultos Como Humanos Fazem
Um artigo em alta no feed diário de pesquisa do HuggingFace faz uma pergunta surpreendentemente infantil: os modelos de geração de vídeo de hoje — os sistemas de IA que sintetizam cenas em movimento — realmente entendem permanência de objetos, o senso comum de que as coisas continuam existindo quando você não pode vê-las? Os autores argumentam que modelos de vídeo são candidatos naturais para estudar inteligência física do tipo humano, já que versões recentes começaram a mostrar habilidades de raciocínio emergentes. Mas quando eles sondam esses modelos, as priors centrais se revelam em grande parte ausentes. Sua solução proposta é o WROP, um novo dataset de treinamento construído em torno dos mesmos tipos de intuições físicas que um bebê desenvolve em seus primeiros meses de vida. O dataset é feito para ensinar world models a manter objetos consistentes através de oclusões e reentradas, para que um vídeo gerado se lembre da bola que rolou atrás da cadeira. O objetivo mais amplo são world models que raciocinam sobre cenas físicas mais como pessoas fazem, com benefícios para robótica, simulação e qualquer sistema que precise prever o que acontece com coisas que brevemente saem de vista.
[21:42] Resumo de pesquisa: Agentes de Codificação de IA Superam Planejadores de Robôs Feitos à Mão
Planejamento de robô é difícil porque escolher o que fazer, onde agarrar e como se mover estão entrelaçados. Engenheiros geralmente escrevem esses planejadores à mão, o que leva meses. Um novo estudo perguntou se agentes de codificação de IA poderiam fazer o trabalho em vez disso.
Os agentes, incluindo Claude Code e Codex, receberam uma descrição da tarefa e acesso ao simulador. Eles escreveram programas, não respostas de uma só vez, mas algoritmos reutilizáveis, dentro de um orçamento fixo. Os programas congelados foram então testados em instâncias não vistas.
Em ambientes simulados de dois benchmarks de robótica, os agentes(superaram) todas as alternativas. O sucesso médio variou de 56% a 95%, enquanto planejadores projetados manualmente conseguiram 47% no subconjunto onde estavam disponíveis. Os agentes também se mantiveram à medida que a contagem de objetos aumentava, o regime onde planejadores clássicos geralmente colapsam.
A conclusão: equipes de robótica presas mantendo código de planejamento personalizado agora têm um atalho funcional. Aponte um agente para um simulador, deixe-o iterar, congele o programa, envie. O gargalo muda de horas de engenharia para orçamento de computação.
[22:43] OpenAI Lança MentalHealthBench para Avaliação de Respostas de IA em Saúde Mental
A OpenAI publicou o MentalHealthBench em 23 de setembro, um benchmark construído com input de especialistas em saúde mental para avaliar quão úteis e seguros são os sistemas de IA em conversas realistas sobre saúde mental. O objetivo é fornecer aos desenvolvedores, pesquisadores e provedores de modelos uma referência compartilhada para classificar o comportamento de assistentes em um domínio onde métricas genéricas de precisão não capturam a essência.
Benchmarks padrão tendem a medir se um modelo respondeu uma questão factual corretamente. Conversas sobre saúde mental são diferentes: uma resposta pode ser factualmente precisa e ainda assim ser prejudicial, dismissiva, ou encorajadora de comportamentos perigosos. O posicionamento da OpenAI posiciona o benchmark como preenchendo essa lacuna, focando em se um modelo responde de forma útil enquanto se mantém dentro de limites seguros, incluindo saber quando escalar ou recomendar ajuda profissional em vez de improvisar.
Os cenários dentro do MentalHealthBench são situações de conversação realistas que usuários realmente trazem para assistentes de IA, moldadas por profissionais da área em vez de redatores de testes puramente sintéticos. Essa participação de especialistas é o mecanismo central: as pessoas que trabalham com saúde mental profissionalmente decidem como uma boa resposta parece em cada troca, então o benchmark classifica o comportamento da forma que um clínico faria, não da forma que um teste de múltipla escolha faria.
Para construtores, o efeito prático é uma pontuação comparável para qualidade de resposta em saúde mental. Uma equipe lançando um coach de bem-estar com IA, um aplicativo de diárioadjacente à terapia, ou um chatbot de triagem agora pode apontar para um resultado de benchmark documentado em vez de depender de impressões ou demonstrações selecionadas. O lançamento também sinaliza que avaliação de segurança específica de domínio está se tornando uma expectativa padrão em áreas sensíveis, não uma reflexão adicionada após o lançamento.
Uma coisa a observar é se outros laboratórios e avaliadores independentes adotam o benchmark, fazem um fork dele, ou constroem versões concorrentes, já que o padrão de classificação de um único fornecedor só é tão útil quanto a comunidade mais ampla o trata.