
AgentStack Diario: Resumen de lanzamiento del Agent Stack: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220
Resumen del lanzamiento del Agent Stack: OpenClaw v2026.7.1-2 y v2026.7.1-1, Hermes Agent v2026.8.3 y Claude Code CLI 2.1.220. Show notes: https://tobyonfitnesstech.com/es/podcasts/episode-97/
🎧 Listen to EpisodeEpisodio 097 — 5 de agosto de 2026
[00:00] Gancho del episodio
Lectura de Lanzamientos del Stack de Agentes: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220 lidera el día: v2026.8.3 trae cambios concretos a las superficies donde los constructores ejecutan todos los días, con los detalles a continuación. También en la programación de hoy: Qwen3.8-Max Establece un Nuevo Estándar para Codificación y Trabajo Colaborativo, AirLLM Afirma Inferencia de 70B en una Sola GPU de 4GB, Circles Aumenta el ARPU de Telecom en 22% con Personalización Impulsada por OpenAI, además del resto de un ciclo de noticias denso en modelos, herramientas e infraestructura. Cada historia recibe el mismo tratamiento — qué se publicó, el mecanismo debajo y qué cambia para los constructores que trabajan.
[02:00] Lectura de Lanzamientos del Stack de Agentes: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220
Nuevos lanzamientos estables en este ciclo: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220. La fuente principal en github.com solo respalda estos hechos declarados; las especificaciones no soportadas se omiten deliberadamente. La fuente principal respalda el cambio específico de producto o flujo de trabajo anterior; no respalda afirmaciones más amplias sobre rendimiento, compatibilidad o despliegue. Prueba el cambio sourcing contra un flujo de trabajo real antes de depender de él. OpenClaw v2026.7.1-2: Correcciones - Actualizaciones del plugin de npm: acepta metadatos de array singleton de clientes npm más nuevos para que los plugins oficiales rastreados puedan instalar y actualizar a versiones correctivas. OpenClaw v2026.7.1-1: Correcciones - Respuestas de progreso de Codex: mantiene los turnos del servidor de aplicación ejecutándose después de los mensajes de progreso entregados para que GPT/Codex llegue a su respuesta terminal autorizada en lugar de detenerse a mitad del turno. (106961, 108487) Gracias @joshavant. - Reparación de inicio de Memory Core: recupera conflictos de índice heredado derivado y sidecar de caché sin atrapar al Gateway en un bucle de reinicio fatal, manteniendo la corrupción del vector-store estructural como reintentable. (107220, 108652) Gracias @goutam-adwant. - Permisos de estado WSL: tolera EROFS de operaciones chmod guardadas solo cuando la ruta de estado existente ya es privada, preservando el manejo fail-closed para permisos amplios. Hermes Agent v2026.8.3: Hermes Agent v0.20.0 (v2026.8.3) Fecha de Lanzamiento: 3 de agosto de 2026 Desde v0.19.0: ~3,650 commits · ~1,400 PRs fusionados · ~5,200 archivos cambiados · ~559,000 inserciones · ~405,000 eliminaciones · ~1,200 issues cerrados · 650+ contribuidores > El Lanzamiento Herald. Hermes es el heraldo de los dioses, y este lanzamiento lo hace uno en serio: habla (voz conversacional en tiempo real con TTS streaming, barge-in, palabras de activación en dispositivo y control manos libres a través de CLI, escritorio y cada plataforma gateway con capacidad de audio), lleva palabras a otros agentes (A2A v1.
[02:37] Qwen3.8-Max Establece un Nuevo Estándar para Codificación y Trabajo Colaborativo
Qwen lanzó Qwen3.8-Max el 4 de agosto de 2026, y lo presentó como un nuevo estándar para codificación y trabajo colaborativo — trabajo agentivo de múltiples pasos junto a un humano en lugar de chat de un solo turno. La publicación del lanzamiento en qwen.ai argumentó que el nuevo modelo de primera línea supera lo que las versiones anteriores de Qwen podían hacer en tareas de codificación. El hilo de Hacker News alrededor del lanzamiento alcanzó una puntuación de 1102, una atención de desarrolladores inusualmente fuerte para un lanzamiento de modelo, lo que sugiere que el mensaje conectó con la comunidad.
Lo que esto significa en la práctica: cualquier persona que ejecute agentes de codificación, asistentes conscientes del repositorio o configuraciones de trabajo colaborativo de largo horizonte ahora tiene un nuevo modelo insignia de Qwen para evaluar. El lanzamiento se conoció a través de la cobertura de Latent Space el 4 de agosto, que es cuando la mayoría de los desarrolladores lo vieron por primera vez. El blog propio de Qwen es la fuente principal para las afirmaciones de posicionamiento del equipo, y el material fuente aquí no incluía un volcado de benchmarks separado, lista de características o hoja de precios — por lo que el marco de "nuevo estándar" debe leerse como el propio posicionamiento de Qwen hasta que las evaluaciones independientes lo confirmen.
Una cosa a observar a continuación: cómo las evaluaciones independientes tratan a Qwen3.8-Max en los días después del lanzamiento, y qué tan rápido el modelo aparece dentro de productos de agentes importantes.
[03:51] AirLLM Afirma Inferencia de 70B en una Sola GPU de 4GB
AirLLM, un proyecto de código abierto en GitHub, anuncia la capacidad de ejecutar un modelo de lenguaje de 70 mil millones de parámetros en una sola GPU con solo 4GB de memoria. El repositorio, lyogavin/airllm, apareció en Hacker News el 4 de agosto con una puntuación de discusión de 230, llamando la atención sobre la idea de que el hardware de grado de consumidor podría albergar modelos de tamaño frontier.
Una GPU de 4GB es el tipo de tarjeta que está en laptops más antiguas o escritorios económicos. Si un modelo de 70B realmente se ejecuta útilmente en una, la historia de costos para IA local cambia de la noche a la mañana — sin centro de datos, sin rig de múltiples GPU, solo una tarjeta gráfica disponible en el mercado.
El material fuente disponible no incluye un changelog o notas de lanzamiento detalladas, por lo que la técnica específica que usa AirLLM no puede confirmarse aquí. Cualquier persona que evalúe el proyecto debe leer el repositorio directamente y probarlo contra su propio hardware y carga de trabajo antes de asumir que el número del titular se traduce en uso práctico.
Para constructores que ejecutan en hardware limitado — dispositivos edge, estaciones de trabajo más antiguas, despliegues sensibles a costos — la pregunta real es si los números reales de latencia y rendimiento se mantienen en la máquina objetivo. El repositorio de GitHub es donde encontrar la implementación actual y cualquier detalle de benchmark que los mantenedores hayan publicado.
[05:04] Circles Aumenta el ARPU de Telecom en 22% con Personalización Impulsada por OpenAI
Circles, una plataforma que construye personalización para operadores de telecomunicación, acaba de publicar resultados de su trabajo con OpenAI. Los números principales, publicados esta semana en el newsroom de OpenAI: el ingreso promedio por usuario aumentó 22%, la rotación bajó 9%, y la eficiencia de desarrollo ha mejorado. Circles se sitúa entre los operadores y sus suscriptores, por lo que ganancias como estas son el tipo de métricas que los operadores generalmente pasan años y muchas campañas de marketing intentando lograr.
La construcción es directa en papel. Circles usa la API de OpenAI y Codex juntas para impulsar lo que la fuente llama experiencias de telecom nativas de IA. El artículo publicado trata los dos productos de OpenAI como un solo stack y acredita esa configuración combinada para los tres resultados reportados, el aumento de ARPU, la caída de rotación y el ciclo de desarrollo más rápido. El cambio aquí es que Circles se apoya en OpenAI en ambos lados: en el proceso de ingeniería que envía características, y en las experiencias de cliente que esas características producen.
Para un vertical donde la personalización históricamente ha significado un segmento de cliente estático y una oferta configurada manualmente, un stack nativo de IA es un cambio significativo. Una cosa a observar a continuación: si Circles nombra los operadores y mercados específicos detrás de las cifras de 22% y 9%, porque el punto de prueba se afina cuanto más concreto se vuelve la huella de despliegue.
[06:23] Mistral Lanza Shieldstral, un Clasificador de Seguridad Multimodal de 3B con Pesos Abiertos
Mistral lanzó Shieldstral el 4 de agosto, un modelo de 3 mil millones de parámetros con pesos abiertos construido para clasificación de seguridad multimodal. La compañía dice que el modelo pequeño supera a clasificadores hasta siete veces su tamaño.
El lanzamiento llegó al blog de Mistral y rápidamente ganó tracción en Hacker News, donde el hilo alcanzó una puntuación de 421. Esa atención es una señal: la moderación multimodal es una carga de trabajo que la mayoría de los equipos han estado dirigiendo ya sea a APIs cerradas de gran tamaño o a tuberías ensambladas de modelos más pequeños.
Lo que cambia para los constructores es la combinación de tamaño y apertura. Como los pesos son públicos, los equipos pueden ajustar finamente Shieldstral en su propia taxonomía de contenido dañino en lugar de reverse-engineering las etiquetas de un clasificador de caja negra. El enfoque multimodal — tomar tanto imágenes como texto en un solo clasificador — también colapsa una tubería común de dos pasos en una única llamada de inferencia.
El enfoque de pesos abiertos es el desbloqueo más práctico para productos sensibles a la privacidad. Los equipos que necesitan mantener la inferencia de moderación dentro de su propio entorno ahora tienen un artefacto de Mistral a donde señalar en lugar de construir uno desde cero. Vale la pena estar atento a continuación: reproducciones de benchmarks independientes de la afirmación de siete veces y recetas de ajuste fino de la comunidad una vez que la gente comience a adaptar Shieldstral a categorías de abuso específicas del dominio.
[07:38] NVIDIA's Alpamayo 2 Super Abre sus Puertas para Robotaxis
NVIDIA abrió Alpamayo 2 Super para uso comercial el 4 de agosto, denominándolo un modelo abierto de frontera dirigido a robotaxis y otros vehículos autónomos. El encuadre importa: NVIDIA está posicionando el lanzamiento en torno a los problemas de conducción más difíciles, no a los fáciles. La detección de objetos cotidianos y la predicción de movimiento, según su narrativa, ya no son el cuello de botella. Los casos difíciles son las situaciones raras, de cola larga, que son difíciles de anticipar y entrenar, donde un vehículo necesita entender la situación, razonar sobre causa y efecto, y elegir la acción correcta. Mover esa capacidad a un modelo abierto y comercialmente utilizable es el cambio práctico aquí, dando a los equipos de AV una base sobre la cual construir en lugar de un artefacto de investigación para estudiar. Lo que el anuncio aún no detalla es cómo el modelo se integra en los stacks de AV existentes, qué términos de licencia rigen el uso comercial, o cómo se compara con competidores cerrados en benchmarks críticos para la seguridad. Esos son los detalles que vale la pena vigilar mientras el ecosistema se adentra en las próximas semanas.
[08:41] Apple Amplía la Investigación de Secretos Comerciales de OpenAI en Nuevo Documento Judicial
Apple informó a un tribunal esta semana que más de sus exempleados podrían haber tomado o accedido a información confidencial camino a OpenAI. En un documento complementario, Apple dice que su investigación existente de secretos comerciales se ha expandido para incluir a empleados adicionales. El documento, reportado primero por TechCrunch el 4 de agosto, amplía el alcance del asunto existente en lugar de iniciar uno nuevo. Apple afirma que estos empleados adicionales podrían haber retenido o accedido a información confidencial. Ni el documento ni la cobertura nombran a los empleados adicionales, y las categorías específicas de información que Apple afirma que fueron tomadas no están en el registro público. Lo que está claro es que la investigación ya no se limita a un pequeño grupo de individuos nombrados anteriormente, y la disputa ahora está llegando a una fase más amplia. Para los constructores, la conclusión práctica es que el pipeline de talento de IA entre los incumbent es y OpenAI sigue generando fricción legal. El caso podría moldear qué tan agresivamente cada lado hace valer lo que se trata como propiedad cuando los ingenieros se mueven entre empresas, y cómo los tribunales tratan la información confidencial que cruza esas líneas. Mantendremos un ojo en si el tribunal acepta el alcance ampliado y si cualquiera de los empleados recién nombrados se defiende de las acusaciones.
[09:57] Resumen de Investigación: Agentes de Video IA que Realmente Miran el Material, no Solo lo Buscan en Google
La mayoría de los 'agentes de video' de IA son secretamente motores de búsqueda de texto disfrazados — se saltan el video y simplemente buscan el título en Google, apoyándose en la memoria en lugar de lo que realmente está en pantalla. Un nuevo documento lo señala y lo corrige. Video-DeepResearch obliga al modelo a escanear exhaustivamente cada fotograma relevante primero, luego hacer investigación web fundamentada en lo que realmente vio. El sistema se entrena en dos etapas: ajuste fino supervisado seguido de un paso de aprendizaje por refuerzo que recompensa encontrar genuinamente la respuesta en lugar de adivinar a partir de los datos de entrenamiento. En un nuevo benchmark de 200 preguntas de razonamiento sobre video, el modelo de 35 mil millones de parámetros obtiene una precisión de última generación del 64%, superando a Claude 4.5 Sonnet, GPT-5 y Gemini 2.5 Pro. La consecuencia práctica: un asistente que puede ver un largo tutorial o clip de vigilancia y responder preguntas fundamentadas sobre lo que realmente está sucediendo en pantalla, en lugar de hacer pattern-matching de un título contra lo que ha memorizado.
[10:52] OpenAI Responde a Apple por la 'Demanda Sin Fundamento'
OpenAI publicó esta semana una réplica contundente a Apple, titulada "Apple lo está entendiendo mal", abordando lo que denomina una demanda sin fundamento y rechazando las afirmaciones de Apple sobre sus propios empleados. La publicación, fechada el 3 de agosto de 2026, se centra en mensajes y registros que OpenAI dice documentan lo que realmente sucedió, posicionando el lado de la empresa directamente contra la narrativa de Apple. La respuesta llega en un momento en que la disputa se ha convertido en una de las peleas públicas más observadas en la industria de la IA, con un hilo de Hacker News sobre la publicación que obtuvo 277 puntos y una sección de comentarios en rápido movimiento.
OpenAI enmarcó el movimiento como una corrección factual en lugar de un contraataque legal, compartiendo lo que describe como evidencia concreta para contradecir la caracterización de Apple de los eventos. Ese encuadre importa porque la presentación pública de la conducta de los empleados y las afirmaciones corporativas a menudo moldea la atención regulatoria e inversora mucho antes de cualquier resultado en la sala judicial. La publicación es escasa en mecánica legal y abundante en la propia versión de los hechos de la empresa.
Por ahora, la lectura práctica es simple: OpenAI está eligiendo litigar esto en parte en público, y la publicación les da a reporteros, clientes y rivales un nuevo conjunto de documentos para sopesar contra las afirmaciones de Apple. Estaremos atentos a si Apple responde de la misma manera o deja que la publicación se mantenga sin una respuesta escrita — y si alguno de los mensajes compartidos aparece en los documentos judiciales.
[12:15] Resumen de Investigación: EcoFrame Acelera la IA de Videos Largos
Ver un video de dos horas y responder preguntas sobre él es difícil para la IA. Los modelos de hoy o bien seleccionan un puñado fijo de fotogramas al inicio y se pierden cosas, o bien ejecutan un costoso razonamiento de ida y vuelta para decidir dónde mirar. Un nuevo framework sin entrenamiento llamado EcoFrame toma un camino intermedio: observa qué tan seguro está el modelo mientras trabaja, y solo captura más fotogramas cuando la incertidumbre es alta. Cuando la atención se extiende por todo el video, sigue mirando globalmente; cuando la atención se enfoca en una región específica, hace zoom allí. El resultado práctico es hasta 13.5× más rápido que el enfoque estilo agente mientras iguala su precisión, demostrado en tres benchmarks de videos largos. Para los constructores, esto significa que las funcionalidades de comprensión de videos largos pueden ejecutarse más económico y responder más rápido, sin reentrenar el modelo subyacente. El código está disponible públicamente.
[13:05] OpenAI Describe Nuevas Salvaguardas Tras Incidentes de Evaluación Cibernética de Terceros
El 4 de agosto, OpenAI publicó una publicación abordando incidentes recientes relacionados con evaluaciones de ciberseguridad de terceros que involucran sus modelos. El propósito declarado es twofold: explicar qué sucedió durante esas evaluaciones externas, y establecer nuevas salvaguardas que la empresa dice fortalecerán cómo se conducen las pruebas y evaluaciones de modelos de IA de ahora en adelante.
El encuadre importa. Al nombrar públicamente estos como incidentes de evaluación cibernética de terceros en lugar de dejarlos pasar sin comentario, OpenAI está tratando el escrutinio de seguridad externo como una categoría que merece su propio manual. La introducción de nuevas salvaguardas refleja un movimiento hacia reglas más estructuradas sobre cómo los investigadores externos se relacionan con los modelos de OpenAI para propósitos cibernéticos y de seguridad.
Para los constructores que usan modelos de OpenAI en producción, esto es un cambio de proceso en el laboratorio en lugar de una actualización del modelo. No se describe que los prompts, las APIs y los productos de usuario final estén cambiando. El efecto práctico se sitúa una capa más arriba, en cómo OpenAI gobierna su relación con los investigadores externos y las firmas que auditan sus sistemas.
Una cosa a vigilar a continuación es el detalle operacional detrás de esas salvaguardas. La publicación anuncia nuevas reglas, pero cómo OpenAI distingue el trabajo cibernético de terceros sancionado del escrutinio no sancionado, y qué tan abiertamente la empresa divulgará incidentes futuros, determinará cuánto esto remodela la cultura de evaluación de modelos en toda la industria.
[14:25] OpenAI revela los detalles de la construcción de seis meses de GPT-Live
OpenAI publicó el 3 de agosto una publicación de ingeniería tras bambalinas que describe cómo construyeron GPT-Live, el sistema detrás de la interacción de voz continua con su asistente. La afirmación principal: un modelo de habla sin turnos combinado con una arquitectura de baja latencia, completado en una construcción de seis meses, aimed at making spoken conversations feel faster and more natural.
La publicación se presenta como una construcción de ingeniería de seis meses en lugar de un lanzamiento de producto. Ese posicionamiento es útil por sí solo. Les dice a los constructores que OpenAI está tratando la voz en tiempo real y fluida como un sistema dedicado con su propio modelo y arquitectura, no como una capa delgada sobre un modelo de texto.
Los detalles concretos que nombra la publicación son limitados. Existe un modelo de habla sin turnos, lo que significa que la tubería de audio está construida alrededor de entrada continua en lugar de turnos discretos del usuario. Existe una arquitectura de baja latencia diseñada para reducir la brecha entre las palabras de un hablante y la respuesta del asistente. Esas dos piezas nombradas son la columna vertebral de la historia. La publicación no publica números de referencia, cifras de latencia ni una lista de características.
Para los constructores, la conclusión a corto plazo es modesta. Esta es una publicación de cómo lo construimos, no una nueva API ni un nuevo modo, por lo que no hay nada que integrar hoy que no estuviera ayer. La señal a más largo plazo es que OpenAI está invirtiendo en voz como una superficie de primera clase con su propia clase de modelo. Si estás diseñando para UX hablado, la dirección del viaje es claramente hacia sistemas que escuchan y responden con fluidez en lugar de intercambiar turnos limpios, y OpenAI ahora está apostando públicamente por ese modelo.
[16:01] Microsoft Research publica Orchard, un marco abierto para entrenar y evaluar agentes de IA
Microsoft Research publicó Orchard el 3 de agosto de 2026, un marco de código abierto construido para que la comunidad de investigación entrene y evalúe agentes de IA en diferentes tipos de tareas. El argumento es directo: dejar de reinventar la estructura de andamiaje para cada experimento de agente. Orchard está diseñado para reducir esa complejidad mientras permite que modelos más pequeños ofrezcan un rendimiento sólido, porque la misma infraestructura subyacente puede reutilizarse en tareas y ejecuciones. Esa reutilización es el gancho práctico. Los investigadores que entrenan agentes a menudo pasan tanto tiempo conectando entornos, arneses y arneses de evaluación como ejecutando los experimentos reales. Un marco compartido le da a todos una superficie común para comparar resultados, lo cual es especialmente útil cuando el modelo bajo prueba es lo suficientemente pequeño como para que importen las condiciones de comparación directa. Microsoft Research está posicionando a Orchard como un punto de partida para la comunidad en lugar de un producto terminado, que es el registro correcto para un marco de investigación. La pregunta interesante es si otros laboratorios y grupos académicos lo adoptan como una capa de evaluación predeterminada, ya que la adopción es lo que convierte una base de código en un punto de referencia. Para los constructores, la conclusión directa es modesta: Orchard está dirigido a investigadores, no a equipos de producción, pero es el tipo de herramienta que silenciosamente moldea qué resultados de agentes se toman en serio durante el próximo año.
[17:20] Qwen 3.8 Max
Alibaba lanzó Qwen3.8-Max, un modelo de权重abierta con 2.4T parámetros que enfatiza la codificación autónoma, la ejecución a largo plazo y la retroalimentación multimodal, con precios agresivos. Los primeros puntos de referencia lo clasifican altamente en tareas de preferencia humana y visión, mostrando paridad con Claude Opus 4.7 y fuertes capacidades de detección de objetos. Sin embargo, las demandas operativas siguen siendo altas, especialmente para grandes modelos MoE como Qwen3.8-Max y Kimi K3, lo que destaca la importancia estratégica de modelos abiertos más pequeños como la próxima variante de 27B. La frontera de权重abierta está cada vez más liderada por laboratorios chinos incluyendo Kimi, DeepSeek, GLM y MiniMax, cerrando la brecha con los laboratorios estadounidenses. DeepSeek V4 Flash se nota como un disruptor de costo/rendimiento en modelos de agentes. Esta es la posición de política publicada de la empresa, no una ley promulgada ni una capacidad de modelo recién enviada. El mecanismo es el control de los pesos del modelo: los pesos de权重abierta apoyan la inspección independiente y el despliegue local, mientras que los pesos de frontera restringidos permanecen bajo control del proveedor debido a preocupaciones de seguridad. Los constructores que eligen modelos abiertos deben separar esta posición declarada de la ley actual y esperar cambios concretos de licencia o acceso antes de alterar una pila.