TobyOnFitnessTech
AgentStack Daily: Resumo de Lançamento do Agent Stack: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220 — Episode 97 cover art
Episode 97·6 de agosto de 2026·36:56

AgentStack Daily: Resumo de Lançamento do Agent Stack: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220

Resumo de Lançamento do Agent Stack: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220. Show notes: https://tobyonfitnesstech.com/pt/podcasts/episode-97/

🎧 Listen to Episode

Episódio 097 — 05 de agosto de 2026

[00:00] Gancho do episódio

Leitura de Lançamentos do Agent Stack: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220 lidera o dia: v2026.8.3 traz mudanças concretas nas superfícies que os builders executam todos os dias, com os detalhes abaixo. Também na programação de hoje: Qwen3.8-Max Define Novo Patamar para Codificação e Trabalho Colaborativo, AirLLM Afirma Inferência de 70B em Uma Única GPU de 4GB, Circles Aumenta ARPU de Telecom em 22% com Personalização Alimentada por OpenAI, além do restante de um ciclo de notícias denso entre modelos, ferramentas e infraestrutura. Cada história recebe o mesmo tratamento — o que foi lançado, o mecanismo por baixo, e o que muda para os builders que trabalham.

[02:00] Leitura de Lançamentos do Agent Stack: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220

Novos lançamentos estáveis neste ciclo: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220. A fonte primária em github.com suporta apenas estes fatos declarados; especificações não suportadas são deliberadamente omitidas. A fonte primária suporta a mudança específica de produto ou fluxo de trabalho acima; não suporta alegações mais amplas sobre desempenho, compatibilidade ou implantação. Teste a mudança mencionada contra um fluxo de trabalho real antes de depender dela. OpenClaw v2026.7.1-2: Correções - atualizações de plugins npm: aceita metadados de array-singleton de clientes npm mais novos para que plugins oficiais rastreados possam instalar e atualizar para releases de correção. OpenClaw v2026.7.1-1: Correções - respostas de progresso do Codex: mantém as turns do servidor de aplicativo rodando após mensagens de progresso entregues para que GPT/Codex alcance sua resposta terminal autoritativa em vez de parar no meio da turn. (106961, 108487) Agradecimentos a @joshavant. - Reparo de inicialização do Memory Core: recupera conflitos de índice legado derivado e sidecar de cache sem prender o Gateway em um loop fatal de reinicialização, mantendo a corrupção do vector-store estrutural como retentável. (107220, 108652) Agradecimentos a @goutam-adwant. - Permissões de estado WSL: tolera EROFS de operações chmod protegidas apenas quando o caminho de estado existente já é privado, preservando o tratamento fail-closed para permissões amplas. Hermes Agent v2026.8.3: Hermes Agent v0.20.0 (v2026.8.3) Data de Lançamento: 3 de agosto de 2026 Desde v0.19.0: ~3.650 commits · ~1.400 PRs mesclados · ~5.200 arquivos alterados · ~559.000 inserções · ~405.000 exclusões · ~1.200 issues fechadas · 650+ colaboradores > O Lançamento Herald. Hermes é o arauto dos deuses, e este lançamento o torna um de fato: ele fala (voz conversacional em tempo real com TTS em streaming, barge-in, wake words no dispositivo e controle hands-free através da CLI, desktop e todas as plataformas de gateway com capacidade de áudio), ele leva palavras a outros agentes (A2A v1.

[02:37] Qwen3.8-Max Define Novo Patamar para Codificação e Trabalho Colaborativo

A Qwen lançou o Qwen3.8-Max em 4 de agosto de 2026 e o apresentou como um novo patamar para codificação e trabalho colaborativo — trabalho agentivo multi-step ao lado de um humano em vez de chat de turn única. O post de lançamento em qwen.ai fez a argumentação de que o novo modelo de primeira linha ultrapassa o que versões anteriores do Qwen podiam fazer em tarefas de codificação. A thread do Hacker News em torno do lançamento subiu para uma pontuação de 1102, atenção de desenvolvedores incomumente forte para um lançamento de modelo, o que sugere que o posicionamento acertou com a comunidade.

O que isso significa na prática: qualquer pessoa executando agentes de codificação, assistentes com consciência de repositório ou configurações de trabalho colaborativo de longo prazo agora tem um novo flagship Qwen para avaliar. O lançamento veio à tona através da cobertura do Latent Space em 4 de agosto, que foi quando a maioria dos desenvolvedores o viu pela primeira vez. O próprio post do blog da Qwen é a fonte primária para as alegações de posicionamento da equipe, e o material de origem aqui não incluiu um dump de benchmarks separado, lista de recursos ou tabela de preços — então o posicionamento de "novo patamar" deve ser lido como o próprio posicionamento da Qwen até que avaliações independentes o confirmem.

Uma coisa para observar a seguir: como as avaliações independentes tratam o Qwen3.8-Max nos dias após o lançamento, e quão rapidamente o modelo aparece dentro de produtos agentivos importantes.

[03:51] AirLLM Afirma Inferência de 70B em Uma Única GPU de 4GB

AirLLM, um projeto open-source no GitHub, anuncia a capacidade de executar um modelo de linguagem de 70 bilhões de parâmetros em uma única GPU com apenas 4GB de memória. O repositório, lyogavin/airllm, surgiu no Hacker News em 4 de agosto com uma pontuação de discussão de 230, atraindo atenção para a ideia de que hardware de grau consumidor pode hospedar modelos de tamanho frontier.

Uma GPU de 4GB é o tipo de placa que fica em laptops mais antigos ou desktops de baixo custo. Se um modelo de 70B realmente roda utilmente em uma, a narrativa de custos para IA local muda da noite para o dia — sem datacenter, sem rig de múltiplas GPUs, apenas uma placa gráfica comercial.

O material de origem disponível não inclui changelog ou notas de lançamento detalhadas, então a técnica específica que o AirLLM usa não pode ser confirmada aqui. Qualquer pessoa que avaliar o projeto deve ler o repositório diretamente e testá-lo contra seu próprio hardware e workload antes de assumir que o número do título se traduz em uso prático.

Para builders executando em hardware limitado — dispositivos edge, estações de trabalho mais antigas, implantações sensíveis a custos — a pergunta real é se os números reais de latência e throughput se mantêm na máquina alvo. O repositório GitHub é onde encontrar a implementação atual e quaisquer detalhes de benchmark que os mantenedores tenham publicado.

[05:04] Circles Aumenta ARPU de Telecom em 22% com Personalização Alimentada por OpenAI

Circles, uma plataforma que constrói personalização para operadoras de telecomunicações, acabou de publicar resultados de seu trabalho com a OpenAI. Os números principais, publicados esta semana no newsroom da OpenAI: receita média por usuário aumentou 22%, churn caiu 9%, e a eficiência de desenvolvimento melhorou. A Circles fica entre as operadoras e seus assinantes, então ganhos como esses são o tipo de métricas que operadoras geralmente passam anos e muitas campanhas de marketing tentando conquistar.

A construção é direta no papel. A Circles usa a API da OpenAI e o Codex juntos para alimentar o que a fonte chama de experiências de telecom nativas de IA. O relato publicado trata os dois produtos da OpenAI como uma única pilha e credita essa configuração combinada para todos os três resultados reportados, o aumento de ARPU, a queda de churn e o loop de desenvolvimento mais rápido. A mudança aqui é que a Circles está se apoiando na OpenAI em ambos os lados: no processo de engenharia que entrega features, e nas experiências do cliente que essas features produzem.

Para um vertical onde personalização historicamente significou um segmento estático de clientes e uma oferta configurada manualmente, uma pilha nativa de IA é uma mudança significativa. Uma coisa para observar a seguir: se a Circles nomeia as operadoras e mercados específicos por trás dos números de 22% e 9%, porque o proof point fica mais forte quanto mais concreta a pegada de implantação se torna.

[06:23] Mistral Lança Shieldstral, um Classificador de Segurança Multimodal Open-Weights de 3B

A Mistral lançou o Shieldstral em 4 de agosto, um modelo open-weights de 3 bilhões de parâmetros construído para classificação de segurança multimodal. A empresa afirma que o modelo pequeno supera classificadores de até sete vezes seu tamanho.

O lançamento apareceu no blog da Mistral e rapidamente ganhou força no Hacker News, onde a thread subiu para uma pontuação de 421. Essa atenção é um sinal — a moderação multimodal é uma carga de trabalho que a maioria das equipes tem enviado para APIs fechadas grandes ou para pipelines montados de modelos menores.

O que muda para os desenvolvedores é a combinação de tamanho e abertura. Como os pesos são públicos, as equipes podem fazer fine-tuning do Shieldstral em sua própria taxonomia de conteúdo prejudicial em vez de reverter a engenharia dos rótulos de um classificador de caixa preta. O ângulo multimodal — considerando tanto imagens quanto texto em um único classificador — também colapsa um pipeline comum de duas etapas em uma única chamada de inferência.

O ângulo de pesos abertos é o desbloqueio mais prático para produtos sensíveis à privacidade. Equipes que precisam manter a inferência de moderação dentro de seu próprio ambiente agora têm um artefato da Mistral para apontar em vez de construir um do zero. Vale acompanhar a seguir: reproduções independentes de benchmarks da alegação de sete vezes e receitas de fine-tuning da comunidade assim que as pessoas começarem a adaptar o Shieldstral a categorias de abuso específicas de domínio.

[07:38] NVIDIA's Alpamayo 2 Super Abre Espaço para Robotáxis

A NVIDIA abriu o Alpamayo 2 Super para uso comercial em 4 de agosto, chamando-o de um modelo aberto de ponta voltado para robotáxis e outros veículos autônomos. O enquadramento é importante: a NVIDIA está posicionando o lançamento em torno dos problemas de direção mais difíceis, não dos fáceis. A detecção de objetos cotidianos e a previsão de movimento, na narrativa deles, não são mais o gargalo. Os casos difíceis são as situações raras de long-tail que são difíceis de antecipar e treinar, onde um veículo precisa entender a situação, raciocinar sobre causa e efeito e escolher a ação certa. Mover essa capacidade para um modelo aberto e comercialmente utilizável é a mudança prática aqui, dando às equipes de AV uma base para construir em vez de um artefato de pesquisa para estudar. O que o anúncio ainda não deixa claro é como o modelo se encaixa nas pilhas de AV existentes, quais termos de licenciamento governam o uso comercial, ou como ele se compara aos concorrentes fechados em benchmarks críticos de segurança. Esses são os detalhes que valem a pena acompanhar enquanto o ecossistema se aprofunda nas próximas semanas.

[08:41] Apple amplia investigação de segredos comerciais da OpenAI em novo arquivamento judicial

A Apple disse a um tribunal esta semana que mais de seus ex-funcionários podem ter levado ou acessado informações confidenciais a caminho da OpenAI. Em uma petição suplementar, a Apple diz que sua investigação existente sobre segredos comerciais foi expandida para incluir funcionários adicionais. A petição, relatada primeiro pelo TechCrunch em 4 de agosto, amplia o escopo do assunto existente em vez de iniciar um novo. A Apple alega que esses funcionários adicionais podem ter retido ou acessado informações confidenciais. Nem a petição nem a matéria nomeiam os funcionários adicionais, e as categorias específicas de informações que a Apple alega terem sido levadas não estão no registro público. O que está claro é que a investigação não está mais limitada a um pequeno grupo de indivíduos anteriormente nomeados, e a disputa agora está entrando em uma fase mais ampla. Para os desenvolvedores, a conclusão prática é que o pipeline de talentos de IA entre incumbentes e OpenAI ainda está gerando atrito legal. O caso pode moldar quão agressivamente cada lado aplica o que é tratado como proprietário quando engenheiros mudam de empresa, e como os tribunais tratam informações confidenciais que cruzam essas linhas. Continuaremos acompanhando se o tribunal aceita o escopo expandido e se algum dos funcionários recém-nomeados contesta as alegações.

[09:57] Resumo de pesquisa: Agentes de vídeo de IA que realmente assistem ao conteúdo, não apenas pesquisam no Google

A maioria dos 'agentes de vídeo' de IA são secretamente motores de busca de texto disfarçados — eles pulam o vídeo e apenas pesquisam o título no Google, confiando na memória em vez do que realmente está na tela. Um novo artigo aponta isso e corrige. O Video-DeepResearch força o modelo a escanear exaustivamente cada quadro relevante primeiro, e então fazer pesquisa na web fundamentada no que realmente viu. O sistema é treinado em dois estágios: fine-tuning supervisionado seguido de uma passagem de aprendizado por reforço que recompensa encontrar genuinamente a resposta em vez de adivinhar a partir dos dados de treinamento. Em um novo benchmark de raciocínio em vídeo de 200 perguntas, o modelo de 35 bilhões de parâmetros alcança uma precisão de última geração de 64 por cento, superando o Claude 4.5 Sonnet, GPT-5 e Gemini 2.5 Pro. A consequência prática: um assistente que pode assistir a um longo tutorial ou clipe de vigilância e responder perguntas fundamentadas sobre o que realmente está acontecendo na tela, em vez de fazer correspondência de padrões de um título contra o que memorizou.

[10:52] OpenAI Responde à Apple Sobre 'Processo Sem Fundamento'

A OpenAI publicou uma resposta pública contundente à Apple esta semana, intitulada "Apple está errada nisso," abordando o que chama de processo sem fundamento e contrapondo-se às alegações da Apple sobre seus próprios funcionários. A postagem, datada de 3 de agosto de 2026, centra-se em mensagens e registros que a OpenAI diz documentar o que realmente aconteceu, posicionando o lado da empresa diretamente contra a narrativa da Apple. A resposta surge enquanto a disputa se transformou em uma das lutas públicas mais observadas na indústria de IA, com uma thread do Hacker News sobre a postagem conquistando 277 pontos e uma seção de comentários em rápido movimento.

A OpenAI enquadrou o movimento como uma correção factual em vez de um contra-ataque legal, compartilhando o que descreve como evidências concretas para contradizer a caracterização da Apple dos eventos. Esse enquadramento é importante porque o enquadramento público da conduta dos funcionários e das alegações corporativas frequentemente molda a atenção regulatória e dos investidores muito antes de qualquer resultado em tribunal. A postagem é curta em mecânicas legais e longa na própria versão da empresa dos fatos.

Por agora, a leitura prática é simples: a OpenAI está escolhendo litigar isso parcialmente em público, e a postagem dá a repórteres, clientes e concorrentes um novo conjunto de documentos para ponderar contra as alegações da Apple. Fique de olho se a Apple responde na mesma moeda ou deixa a postagem permanecer sem uma resposta escrita — e se alguma das mensagens compartilhadas aparece em petições.

[12:15] Resumo de pesquisa: EcoFrame Acelera IA de Vídeo Longo

Assistir a um vídeo de duas horas e responder perguntas sobre ele é difícil para a IA. Os modelos de hoje ou escolhem um punhado fixo de quadros antecipadamente e perdem coisas, ou executam um raciocínio caro de vaivém para decidir onde olhar. Um novo framework sem treinamento chamado EcoFrame pega um caminho intermediário: ele observa quão confiante o modelo está enquanto trabalha, e só pega mais quadros quando a incerteza é alta. Quando a atenção se espalha por todo o vídeo, ele continua olhando globalmente; quando a atenção se foca em uma região específica, ele dá zoom lá. O resultado prático é até 13,5× mais rápido que a abordagem estilo-agente enquanto corresponde à sua precisão, demonstrado em três benchmarks de vídeo longo. Para os desenvolvedores, isso significa que recursos de compreensão de vídeo longo podem rodar mais barato e responder mais rápido, sem retreinar o modelo subjacente. O código está disponível publicamente.

[13:05] OpenAI Esboça Novas Salvaguardas Após Incidentes de Avaliação Cibernética de Terceiros

Em 4 de agosto, a OpenAI publicou uma postagem abordando incidentes recentes ligados a avaliações de cibersegurança de terceiros envolvendo seus modelos. O objetivo declarado é duplo: explicar o que aconteceu durante essas avaliações externas e apresentar novas salvaguardas que a empresa diz que fortalecerão como os testes e avaliações de modelos de IA são conduzidos daqui em diante.

O enquadramento é importante. Ao nomear publicamente esses como incidentes de avaliação cibernética de terceiros em vez de deixá-los passar sem comentário, a OpenAI está tratando a exploração de segurança externa como uma categoria que merece seu próprio manual. A introdução de novas salvaguardas reflete um movimento em direção a regras mais estruturadas sobre como pesquisadores externos se engajam com modelos da OpenAI para fins cibernéticos e de segurança.

Para desenvolvedores que usam modelos da OpenAI em produção, esta é uma mudança de processo no laboratório em vez de uma atualização de modelo. Prompts, APIs e produtos para usuários finais não são descritos como mudando. O efeito prático fica uma camada acima, em como a OpenAI governa seu relacionamento com os pesquisadores externos e empresas que auditam seus sistemas.

Uma coisa para acompanhar a seguir é o detalhe operacional por trás dessas salvaguardas. A postagem anuncia novas regras, mas como a OpenAI distingue trabalho cibernético de terceiros sancionado de exploração não sancionada, e quão abertamente a empresa divulgará incidentes futuros, determinará quanto isso remodela a cultura de avaliação de modelos em toda a indústria.

[14:25] OpenAI revela os bastidores da construção de seis meses do GPT-Live

A OpenAI publicou um post de engenharia nos bastidores em 3 de agosto descrevendo como construiu o GPT-Live, o sistema por trás da interação de voz contínua com seu assistente. A principal afirmação: um modelo de fala sem turnos paired com uma arquitetura de baixa latência, concluído em seis meses de construção, com o objetivo de tornar as conversas faladas mais rápidas e naturais.

O post é apresentado como uma construção de engenharia de seis meses em vez de um lançamento de produto. Esse posicionamento é útil por si só. Ele diz aos desenvolvedores que a OpenAI está tratando a voz em tempo real e fluida como um sistema dedicado com seu próprio modelo e arquitetura, não uma camada fina sobre um modelo de texto.

Os detalhes concretos que o post menciona são limitados. Existe um modelo de fala sem turnos, o que significa que o pipeline de áudio é construído em torno de entrada contínua em vez de turnos discretos do usuário. Existe uma arquitetura de baixa latência projetada para reduzir a lacuna entre as palavras de um locutor e a resposta do assistente. Essas duas peças nomeadas são a espinha dorsal da história. O post não publica números de benchmark, figuras de latência ou uma lista de recursos.

Para desenvolvedores, o resumo de curto prazo é modesto. Este é um post de como construímos, não uma nova API ou um novo modo, então não há nada para integrar hoje que não existisse ontem. O sinal de longo prazo é que a OpenAI está investindo em voz como uma superfície de primeira classe com sua própria classe de modelo. Se você está projetando para UX falado, a direção da viagem é claramente em direção a sistemas que ouvem e respondem fluidamente em vez de negociar turnos limpos, e a OpenAI agora está apostando publicamente nesse modelo.

[16:01] Microsoft Research releases Orchard, um framework aberto para treinar e avaliar agentes de IA

O Microsoft Research publicou o Orchard em 3 de agosto de 2026, um framework de código aberto construído para a comunidade de pesquisa treinar e avaliar agentes de IA em diferentes tipos de tarefas. A proposta é direta: parar de reinventar a estrutura de apoio para cada experimento de agente. O Orchard é projetado para reduzir essa complexidade enquanto ainda permite que modelos menores ofereçam alto desempenho, porque a mesma infraestrutura subjacente pode ser reutilizada em tarefas e execuções. Essa reutilização é o gancho prático. Pesquisadores que treinam agentes frequentemente passam tanto tempo conectando ambientes, harnesses e harnesses de avaliação quanto executando os experimentos reais. Um framework compartilhado dá a todos uma superfície comum para comparar resultados, o que é especialmente útil quando o modelo em teste é pequeno o suficiente para que condições de comparação direta sejam importantes. O Microsoft Research está posicionando o Orchard como um ponto de partida para a comunidade em vez de um produto acabado, o que é o tom certo para um framework de pesquisa. A pergunta interessante é se outros laboratórios e grupos acadêmicos o adotarão como uma camada de avaliação padrão, já que a adoção é o que transforma uma base de código em um benchmark. Para desenvolvedores, o resumo direto é modesto: o Orchard é voltado para pesquisadores, não equipes de produção, mas é o tipo de ferramenta que silenciosamente molda quais resultados de agentes serão levados a sério no próximo ano.

[17:20] Qwen 3.8 Max

A Alibaba lançou o Qwen3.8-Max, um modelo open-weight de 2.4T parâmetros com foco em codificação autônoma, execução de longo prazo e feedback multimodal, com precificação agressiva. Benchmarks iniciais classificam-no altamente em tarefas de preferência humana e visão, mostrando paridade com o Claude Opus 4.7 e fortes capacidades de detecção de objetos. No entanto, as demandas operacionais continuam altas, especialmente para grandes modelos MoE como o Qwen3.8-Max e o Kimi K3, destacando a importância estratégica de modelos open menores como a próxima variante de 27B. A fronteira open-weight é cada vez mais liderada por laboratórios chineses incluindo Kimi, DeepSeek, GLM e MiniMax, diminuindo a lacuna com laboratórios dos EUA. O DeepSeek V4 Flash é reconhecido como um disruptor de custo/desempenho em modelos de agentes. Esta é a posição de política publicada pela empresa, não uma lei promulgada ou uma capacidade de modelo recém-enviada. O mecanismo é o controle dos pesos do modelo: pesos open suportam inspeção independente e implantação local, enquanto pesos de fronteira restritos permanecem sob controle do provedor devido a preocupações de segurança. Desenvolvedores que escolhem modelos open devem separar esta posição declarada da lei atual e esperar por mudanças concretas de licença ou acesso antes de alterar uma stack.

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily