TobyOnFitnessTech
GPT-5.6 Sol, Bonsai 27B, Gemini 3.5 Flash y AMD 128GB PCs — Episode 87 cover art
Episode 87·16 de julio de 2026·37:05

GPT-5.6 Sol, Bonsai 27B, Gemini 3.5 Flash y AMD 128GB PCs

GPT-5.6 Sol busca resultados de agentes más completos, ChatGPT consolida trabajo y codificación, y Gemini 3.5 Flash opera pantallas y crea software. También examinamos Bonsai 27B, IA Pixel sin conexión, desktops AMD de 128GB, soporte de backend de JetBrains Copilot, acceso a modelos basados en riesgo de Anthropic, resultados de pequeñas empresas, límite de robótica de Claude, acción gubernamental en Nueva York, Australia y GOLD EAGLE, además de la reconstrucción con IA de Google del gol perdido de Pelé en 1959. Show notes: https://tobyonfitnesstech.com/es/podcasts/episode-87/

🎧 Listen to Episode

Episodio 087 — 15 de julio de 2026

[00:00] Gancho del episodio

El GPT-5.6 Sol de OpenAI está orientado a agentes que pueden navegar por software, llamar herramientas y devolver entregables terminados, con una ventana de contexto lo suficientemente grande para proyectos extensos. Una aplicación de escritorio rediseñada de ChatGPT refuerza ese cambio al combinar conversación, creación de conocimiento y codificación en un solo lugar. Más allá de los modelos de frontera, pequeños empresarios dijeron al Congreso cómo la IA está ahorrando horas, aumentando las ventas y produciendo sistemas funcionales como un agente de cuentas por pagar—mientras los legisladores sopesaban los costos y riesgos. La IA local también dio un paso importante: PrismML comprimió sus modelos multimodales Bonsai 27B a tamaños tan pequeños como aproximadamente 3.9 gigabytes, y Google mostró a Gemma 4 E2B funcionando nativamente en Pixel TPUs para planificación y transcripción sin conexión. Un hallazgo en robótica añade un límite útil: Claude tuvo dificultades con el control motor directo, de fracciones de segundo, sugiriendo que los modelos de lenguaje están mejor adaptados para planificación y supervisión que para reemplazar los bucles de control rápido de los robots.

[02:00] GPT-5.6 Sol impulsa a los agentes hacia trabajo terminado

Un agente de IA ahora puede asumir un cambio en todo un repositorio, inspeccionar el resultado en un navegador y avanzar más hacia un artefacto terminado en lugar de detenerse con consejos. Esa es la propuesta práctica para GPT-5.6 Sol, el nuevo modelo de OpenAI enfocado en capacidades para codificación compleja, uso de computadora, investigación y seguridad.

El alias de API gpt-5.6 enruta a Sol. Su página de modelo lista una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida, y entrada de texto e imagen. Las herramientas disponibles incluyen búsqueda web y de archivos, generación de imágenes, un intérprete de código, shell alojado, aplicación de parches, uso de computadora, habilidades, búsqueda de herramientas y MCP, un estándar para conectar modelos con herramientas y datos externos.

Un cambio especialmente útil es la llamada de herramientas programática. Sol puede escribir JavaScript que reúna y reduzca resultados de herramientas dentro de un flujo de trabajo delimitado. Eso puede hacer que un trabajo largo se parezca menos a una sesión de chat llena de transferencias intermedias y más a un programa que recopila evidencia, la procesa y devuelve el resultado útil. El razonamiento persistido lleva el trabajo a través de turnos, mientras un modo multiagente en beta puede dividir tareas independientes entre subagentes paralelos. Sol también puede inspeccionar imágenes en sus dimensiones originales, y hay un modo pro disponible para trabajos donde la calidad es prioritaria.

OpenAI reporta que el rendimiento de uso de computadora subió del 47.5 por ciento en GPT-5.5 al 62.6 por ciento en GPT-5.6. Su puntaje reportado en BrowseComp aumentó de 84.4 a 90.4, mientras que BenchCAD subió de 44.4 a 70.6. El socio de lanzamiento Lovable reporta menos pasos, menos llamadas a herramientas y menos ejecuciones atascadas; Qodo reporta aproximadamente tres veces menos tokens por solicitud de extracción revisada y aproximadamente la mitad de la latencia. Estas son cifras publicadas por OpenAI y sus socios, no resultados independientes universales.

Para los constructores, la oportunidad está en el control de calidad en navegadores, investigación de documentos extensos y flujos de trabajo intensivos en herramientas diseñados alrededor de la finalización. Hay que observar si esas mejoras sobreviven a las restricciones reales de producción. OpenAI posiciona a Terra como el nivel equilibrado para uso diario y a Luna para trabajo rápido y de alto volumen.

[03:10] ChatGPT unifica conversación, entregables y codificación

Ahora puedes pedirle más que una respuesta a ChatGPT: OpenAI quiere que los equipos asignen una pieza completa de trabajo y reciban un entregable revisable. El 9 de julio, OpenAI introdujo una nueva aplicación de escritorio que coloca Chat, Work y Codex bajo un mismo techo, mientras mantiene cada carril distinto. Chat es para conversación. Work maneja investigación y artefactos terminados de trabajo de conocimiento. Codex permanece como la experiencia dedicada para construir y reparar software; no fue simplemente renombrado o eliminado.

Para los usuarios existentes de Codex, los proyectos y configuraciones se transfieren. Las personas pueden mantener Codex como la vista predeterminada, conservar el ícono de Codex y acceder a los proyectos de Codex desde ChatGPT móvil. Esa continuidad importa porque la consolidación de interfaces es menos interesante que los flujos de trabajo que está meant to support.

Work puede producir documentos, hojas de cálculo, presentaciones y Sites en lugar de detenerse en una respuesta de chat. OpenAI describe el cambio como pasar de pedir una respuesta a asignar un entregable que puede involucrar fuentes, herramientas, revisión y una salida que alguien pueda revisar. Los equipos de finanzas, por ejemplo, pueden transformar datos sin procesar en modelos, gráficos, memorandos y presentaciones dentro de ese proceso más amplio.

La evidencia más concreta viene de las cuentas de clientes publicadas por OpenAI. OpenAI dice que Zapier construyó un sistema de revisión de prospectos que encontró siete cifras en pipeline perdido. RingCentral transformó verificaciones manuales de lanzamiento en un flujo de trabajo usado por aproximadamente 50 gerentes de producto. Virgin Atlantic redujo la investigación competitiva de semanas a horas. NVIDIA automatizó la preparación de conferencias que había consumido aproximadamente el 40 por ciento de su tiempo previo al evento.

Para los constructores, la oportunidad es apuntar a procesos con una entrada clara, uso repetido de herramientas y un artefacto final concreto: una revisión de lanzamiento, paquete de investigación, modelo financiero, presentación o reparación de software. Lo siguiente a observar es si los equipos pueden revisar y reutilizar confiablemente estos resultados en trabajo recurrente, en lugar de tratar cada resultado como una respuesta única.

[05:03] Pequeñas empresas convierten la IA en horas, ventas y partes funcionales

Un problema de empaquetado de café, una máquina vieja sin una pieza fácilmente disponible y horas perdidas en facturas: esos fueron algunos de los objetivos concretos de IA descritos en una audiencia del Comité de Pequeños Negocios de la Cámara de Representantes de EE..UU. el 14 de julio. Los ejemplos importan porque muestran negocios cotidianos aplicando IA a trabajos específicos donde el éxito puede medirse en tiempo, dinero o una pieza de equipo que funciona.

Una farmacia histórica de Chicago de 151 años está construyendo un agente de cuentas por pagar destinado a devolver a los empleados más de 20 horas cada semana. Su propietario también dijo que el empleo ha aumentado aproximadamente un 20 por ciento desde que la empresa adoptó IA. Henry's House of Coffee usó ChatGPT para ayudar a diseñar y codificar un rociador controlado por sensores que abordó un problema físico de empaquetado de café. En Detroit, los contratistas combinan planos con notas dictadas para completar estimaciones en sus camionetas antes de salir del acceso del cliente.

La audiencia también incluyó resultados comerciales directos. GT Coffee reportó que su tasa de conversión aumentó del 1.5 por ciento al 2.3 por ciento, mientras que el valor promedio del pedido subió de 38 dólares a 47 dólares. Un carpintero de Oklahoma dijo que las piezas de reemplazo para equipos que envejecen ahora pueden diseñarse e imprimirse en 3D en horas en lugar de requerir esperas de semanas. En otro caso, la IA reveló una opción de permiso para cocina doméstica para un restaurante tailandés, reduciendo aparentemente los costos de inicio en más del 90 por ciento.

Esos números deben leerse cuidadosamente: son afirmaciones de testigos bajo juramento, no hallazgos gubernamentales auditados independientemente. Aun así, el patrón es útil para los constructores. Ninguno de estos ejemplos depende de resolver cada parte de las operaciones de una empresa. Cada uno comienza con un obstáculo delimitado—facturas, estimaciones, empaquetado, marketing, permisos o un componente no disponible—y aplica IA directamente a él.

Lo que sigue es evidencia de que estas ganancias persisten más allá de anécdotas individuales. Los productos más sólidos harán que la línea base y el resultado sean fáciles de comparar, mientras se adaptan a las herramientas desordenadas y los procesos físicos que las pequeñas empresas ya utilizan.

[06:59] Bonsai 27B Comprime IA Multimodal en Memoria del Tamaño de un Teléfono

Un teléfono podría inspeccionar una foto de equipo, leer una captura de pantalla o ayudar con un documento sin enviar ese material a un servicio en la nube. Esa es la promesa práctica detrás de Bonsai 27B, un nuevo lanzamiento de PrismML que comprime Qwen 3.6 27B en paquetes lo suficientemente pequeños como para caber en la memoria de dispositivos de consumo.

Este no es un modelo recién preentrenado. PrismML creó versiones comprimidas del modelo multimodal existente, incluyendo variantes ternarias de 1 bit y 1.58 bits. Ternario significa que los pesos almacenados del modelo usan un conjunto muy pequeño de valores posibles, reduciendo drásticamente la memoria que ocupan. PrismML reporta una huella tan baja como aproximadamente 3.9 gigabytes y demuestra operación en hardware de clase iPhone.

El lanzamiento incluye archivos GGUF para entornos de ejecución compatibles con llama.cpp, además de construcciones MLX para silicio de Apple. Eso les da a los constructores de IA local formatos prácticos para probar el modelo en computadoras portátiles y teléfonos en lugar de tratar el resultado de la compresión como una demostración de laboratorio.

La capacidad multimodal es lo que hace que la reducción de tamaño sea especialmente útil. Esto no se limita al chat de texto sin conexión. Un constructor podría prototipar un asistente de inspección que examine fotos de equipo, un ayudante de viaje que interprete señales o capturas de pantalla sin conexión a la red, o un agente de documentos que mantenga archivos sensibles en la computadora portátil del usuario. La operación local también puede importar en lugares de trabajo donde cargar imágenes o registros es inaceptable.

Hay advertencias importantes. La compresión extrema puede cambiar la calidad de la salida, y hacer que un modelo quepa en la memoria no garantiza una experiencia fluida. El calor del dispositivo y el ancho de banda de memoria aún afectan el rendimiento práctico. Los números de velocidad y referencia de PrismML también son reportados por el proveedor, por lo que necesitan reproducción independiente en teléfonos y computadoras portátiles reales.

Lo que importa a continuación no es simplemente si Bonsai funciona, sino si sus respuestas siguen siendo útiles en imágenes reales, capturas de pantalla y documentos. Si esa calidad se mantiene, un tamaño de modelo que una vez sugirió una estación de trabajo podría convertirse en un bloque de construcción práctico para aplicaciones multimodales privadas y sin conexión.

[08:56] Google Convierte los Teléfonos Pixel 10 en Plataformas de IA Sin Conexión

Un teléfono de la familia Pixel 10 compatible ahora puede convertirse en una plataforma de aplicaciones de IA sin conexión, no simplemente una pantalla para un modelo en la nube. Google introdujo Gemma 4 E2B junto con una versión beta del Tensor SDK diseñada para ejecutar el modelo de forma nativa en el TPU del Pixel, el procesador dedicado usado para cargas de trabajo de aprendizaje automático. El resultado es un camino hacia aplicaciones que pueden entender fotos, grabaciones e instrucciones sin enviar cada entrada a un servicio remoto.

Los ejemplos de Google hacen concreto ese cambio. Mostró aplicaciones de código abierto para planificación de viajes sin conexión, automatización del hogar, transcripción, reconocimiento de plantas, asistencia de compras y diagnóstico de equipos. Imagina apuntar un teléfono a una planta o a un equipo y obtener ayuda de inmediato, incluso donde la conectividad es débil. O transcribir una grabación sensible manteniéndola en el dispositivo. Esas son ventajas prácticas, no solo otra puntuación de un modelo pequeño: menor latencia, mejor operación lejos de redes confiables y más control sobre entradas privadas.

La experiencia del desarrollador también importa. Los constructores pueden solicitar acceso a la versión beta del Tensor SDK y adaptar los ejemplos de Google en lugar de comenzar con controladores de dispositivos e integración de aceleradores. Google está diseñando conjuntamente un modelo pequeño, su ruta de software y su propio silicio móvil, lo que podría hacer que la IA local sea considerablemente más accesible para aplicaciones Pixel.

Todavía hay límites importantes alrededor del anuncio. El soporte actual está limitado al Pixel 10, 10 Pro, 10 Pro XL y 10 Pro Fold. Google ha establecido Gemma 4 E2B, la dirección del SDK, la ejecución nativa del TPU del Pixel y varias demostraciones, pero aún no ha respondido cómo estas aplicaciones afectan la vida de la batería o qué tan rápido permanecen durante el uso sostenido. La disponibilidad del producto y los resultados de las demostraciones también son reportados por Google.

Para los constructores, la oportunidad inmediata es repensar flujos de trabajo que actualmente asumen una conexión a la nube: diagnóstico en campo, captura de notas privadas, asistencia con cámara y controles domésticos. Lo siguiente a observar son las pruebas prácticas, especialmente si el rendimiento útil dura más allá de una demostración corta sin calor inaceptable, agotamiento de la batería o lentitud.

[10:51] Resumen de investigación: La Prueba de Robótica de Claude Traza un Límite de Control Claro

Un trabajador de almacén podría indicarle a un robot qué necesita moverse en lenguaje ordinario, pero Claude no debería decidir el momento de cada giro de rueda o movimiento de articulación. Ese es el límite práctico que Anthropic encontró después de probar Claude en tareas de movimiento cuadrúpedo y manipulación robótica. El control directo de bajo nivel mayormente falló porque un modelo de lenguaje no puede reemplazar de manera confiable los bucles de control rápido y los sistemas de seguridad que mantienen estable una máquina física. Los resultados mejoraron cuando Claude trabajó un nivel más alto: escribiendo pequeñas herramientas, inspeccionando retroalimentación visual simple y supervisando un controlador preentrenado. En un almacén, eso podría significar traducir la solicitud de un trabajador en una ruta y secuencia de acciones, y luego entregar cada movimiento a controladores de navegación y movimiento certificados. Esta división les da a los constructores la flexibilidad de la planificación en lenguaje natural sin hacer que el modelo sea responsable del tiempo del motor o la seguridad física. El hallazgo importa más allá de una prueba de robot: ofrece una arquitectura concreta para IA incorporada útil hoy. Observen si los productos de robótica adoptan este enfoque estratificado, con modelos de lenguaje planificando y recuperándose de errores ordinarios mientras el software probado mantiene firmemente el control del movimiento.

[11:58] AMD Trae Escritorios de IA Local de 128 Gigabytes al Mercado Minorista

Un desarrollador ahora puede entrar a Micro Center y comprar una computadora de escritorio con suficiente memoria compartida para experimentar con modelos de IA sustancialmente más grandes sin tener que rentar primero un servidor gráfico remoto. El escritorio AMD Ryzen AI Halo ha llegado al comercio minorista en configuraciones que ofrecen hasta 128 gigabytes de memoria unificada, posicionando la IA local menos como un proyecto de hardware especializado y más como un producto disponible directamente en la tienda.

El número importante no es solo la capacidad de memoria, sino cómo esa memoria está organizada. La memoria unificada significa que el procesador central y los gráficos integrados usan un gran grupo. Eso evita el techo de memoria dedicada relativamente pequeño que impide que muchas tarjetas gráficas de consumo carguen modelos más grandes en absoluto. AMD dice que la máquina puede soportar modelos de hasta 200 mil millones de parámetros, los valores ajustables que un modelo aprende durante el entrenamiento.

Eso es una afirmación de capacidad, no una garantía de velocidad. Que un modelo quepa en la memoria no significa que responderá rápidamente, manejará indicaciones largas sin problemas o funcionará bien en cada carga de trabajo. Los resultados prácticos dependerán de la cuantización, que comprime un modelo para reducir sus necesidades de memoria, junto con la longitud del contexto, el ancho de banda de memoria, el soporte del entorno de ejecución y la tarea específica.

Sin embargo, la nueva opción de venta minorista cambia lo que los constructores pueden probar en un escritorio. Puede servir como una máquina de desarrollo privada para asistentes, sistemas de recuperación que responden desde los propios documentos de una empresa, agentes de codificación y flujos de trabajo que combinan texto con otros medios. Los archivos sensibles pueden permanecer en la computadora, y un equipo puede evaluar si el rendimiento local es suficiente antes de pagar por escala en la nube.

La comparación útil es con la IA local de clase telefónica. Modelos como Bonsai y Gemma se dirigen a tareas que viajan en un bolsillo. Halo apunta al escenario junto al escritorio, donde los desarrolladores exploran sistemas privados más grandes. Lo que hay que observar a continuación es el rendimiento utilizable: qué modelos y entornos de ejecución convierten esa capacidad de 128 gigabytes en herramientas cotidianas responsivas, en lugar de experimentos que simplemente caben.

[13:54] JetBrains Copilot Ahora Puede Usar el Backend de IA de Tu Equipo

Un desarrollador ahora puede seguir usando Copilot dentro de un editor de JetBrains mientras envía el trabajo real de IA a un modelo que su organización elige. GitHub expandió el soporte de traiga-su-propia-clave para Copilot en herramientas basadas en IntelliJ, agregando la capacidad de conectar un endpoint personalizado compatible con OpenAI, incluyendo un servicio privado o un modelo servido localmente.

Esa separación es el cambio importante. Copilot permanece como la interfaz que los desarrolladores ven en su editor, pero el backend de inferencia—el servicio que recibe una solicitud y genera la respuesta del modelo—puede ser controlado por el equipo. Una organización podría servir Bonsai, otro modelo abierto, o un ajuste fino interno detrás de un endpoint compatible, y luego hacerlo disponible sin pedir a los desarrolladores que reemplacen su entorno de desarrollo normal.

Esto crea un puente práctico entre el suministro creciente de modelos locales y los editores donde ya sucede el trabajo de software. Un equipo que construye un modelo de codificación interno ya no necesariamente necesita construir una integración de editor completa alrededor de él. Puede exponer el modelo a través del formato de endpoint compatible y dejar que Copilot proporcione el frente familiar.

El cambio también importa para organizaciones con reglas sobre dónde pueden procesarse las indicaciones y el código fuente. Un backend privado les da más elección sobre el servicio de modelo. Pero conectar un endpoint privado no hace automáticamente que todo el flujo de trabajo sea privado. El resultado aún depende de dónde se ejecuta ese endpoint, cómo llega el tráfico a él, qué se registra y cómo está configurado Copilot en sí. Esos detalles determinan el límite real de datos.

Para los constructores, esto hace que la evaluación lado a lado sea más realista: mantener constante el flujo de trabajo del editor y probar si un modelo local o interno aprobado puede manejar la asistencia de codificación cotidiana. La pregunta clave ahora es el rendimiento. Si los modelos locales pueden proporcionar suficiente calidad de codificación con latencia aceptable, esto podría convertirse en una opción flexible de modelo para el desarrollo ordinario. Si no, su atractivo más fuerte puede seguir siendo el cumplimiento normativo y el control.

[15:48] Nueva York Pausa Algunos Permisos de Centros de Datos Hiperscale

Construir un centro de datos de IA gigante en Nueva York ahora puede tomar más tiempo—no porque el estado haya prohibido cada proyecto, sino porque quiere contar los costos antes de otorgar ciertos permisos ambientales. La Gobernadora Kathy Hochul lanzó lo que su oficina llama la primera moratoria estatal sobre nuevos centros de datos hiperscale a través de la Orden Ejecutiva 62, anunciada el 14 de julio de 2026.

La pausa se aplica a proyectos calificados que necesitan permisos ambientales discrecionales, es decir, aprobaciones donde los reguladores deben evaluar un proyecto en lugar de simplemente procesar un derecho automático. Puede permanecer vigente hasta un año mientras Nueva York estudia los efectos en la red eléctrica, el uso del agua, la calidad del aire, las tarifas de servicios públicos para clientes y las comunidades circundantes.

Ese alcance importa. Los centros de datos existentes no están siendo cerrados, y los nuevos proyectos que no requieren los permisos afectados no están automáticamente bloqueados. Entonces la conclusión precisa es una pausa temporal en una ruta de aprobación definida, no un fin a toda la construcción de centros de datos en Nueva York.

Para las empresas de IA, esto convierte la política de infraestructura en una restricción de producto. Asegurar aceleradores es solo una parte de implementar instalaciones de computación grandes. Una región también debe poder proporcionar electricidad y agua, absorber efectos ambientales y decidir si los hogares podrían terminar cargando parte del costo a través de tarifas más altas. La revisión local puede por lo tanto afectar dónde se ejecuta un servicio, cuánta capacidad está disponible y cuándo esa capacidad entra en línea.

Los constructores y negocios que planifican implementaciones ahora tienen otra categoría de dependencia que modelar. La región de la nube, la disponibilidad de energía y los permisos pueden crear riesgo de calendario y precios tan seguramente como la escasez de hardware. Un proyecto diseñado alrededor de una ubicación puede enfrentar un cronograma diferente si cae dentro del proceso pausado.

Lo siguiente a observar es lo que produce el estudio de Nueva York: evidencia sobre infraestructura y costos comunitarios, seguida de las reglas que reemplazan o siguen a la pausa. Esas decisiones podrían dar forma a qué proyectos hiperscale proceden y qué obligaciones deben cumplir los desarrolladores.

[17:50] GOLD EAGLE Trae IA de Frontera a la Coordinación de Vulnerabilidad Nacional

Una falla de software recién divulgada puede desencadenar un escrutinio familiar: múltiples grupos escanean el mismo problema, los hallazgos urgentes compiten por atención, y las organizaciones que realmente necesitan parchear pueden recibir información fragmentada. La Casa Blanca quiere que la IA de frontera ayude a desenredar esa transferencia a escala nacional.

Anunciado el 14 de julio, GOLD EAGLE es una cámara de compensación de ciberseguridad gobierno-industria para coordinar la recepción de vulnerabilidades, verificación de escaneo, priorización y remediación. Su objetivo declarado es reducir los escaneos duplicados y proporcionar a los operadores gubernamentales, financieros y de infraestructura crítica información priorizada y procesable sobre amenazas y reparaciones.

Eso hace de esto una historia de implementación, no un benchmark de modelos. GOLD EAGLE ya ha comenzado a recibir y priorizar vulnerabilidades identificadas y coordinar escaneos de verificación. La prueba útil será si reduce el trabajo repetido y lleva información clara y procesable a los defensores más rápidamente.

El anuncio no identifica el modelo ni nombra ningún proveedor de IA. Tampoco dice que la IA parcheará autonomously la infraestructura nacional. GOLD EAGLE se describe como apoyo de coordinación y priorización entre gobierno e industria; las organizaciones humanas participantes siguen siendo responsables de la remediación.

Para los equipos de seguridad, la presión práctica podría llegar en una etapa posterior. Una coordinación más rápida solo ayuda si una organización sabe qué software ejecuta, quién toma cada decisión sobre parches y qué tan rápido puede moverse la evidencia desde un informe de vulnerabilidad hasta el equipo responsable. Los inventarios precisos, la propiedad clara de los parches, la divulgación coordinada y las decisiones de severidad defendibles pueden todos necesitar operar más rápido.

Para los creadores, la oportunidad está en esas transiciones: la recepción estructurada de vulnerabilidades, la presentación de evidencia detrás de las decisiones de prioridad, el mantenimiento de inventarios de software y el enrutamiento de información de remediación a los operadores afectados. Lo siguiente a observar es cómo GOLD EAGLE transforma su misión de coordinación amplia en procedimientos operativos, y qué evidencia necesitarán proporcionar y consumir las organizaciones participantes.

[19:48] Anthropic Divide Su Producto Principal Por Riesgo, Acceso Y Precio

La oferta más capaz de Anthropic ya no es una simple cuestión de elegir el modelo más fuerte. Ahora es una decisión tripartita que involucra qué es el trabajo, quién lo realiza, cuánto riesgo conlleva y qué está dispuesto a pagar el cliente.

Fable 5 y Mythos 5 comparten un modelo subyacente, pero Anthropic los empaqueta de manera diferente. Fable añade salvaguardas amplias destinadas al uso convencional. Mythos está restringido a socios verificados que trabajan en ciberseguridad y ciencia, donde Anthropic permite el acceso bajo reglas de elegibilidad más estrictas. Sonnet 5 es el valor predeterminado general más económico, diseñado para manejar flujos de trabajo de navegador, terminal, depuración y negocios con lo que Anthropic describe como comportamiento de agente casi Opus.

El argumento práctico es una automatización sustancial en trabajo difícil y de larga duración. Anthropic dice que Stripe usó Fable para una migración que involucraba una base de código Ruby de 50 millones de líneas, completando en un día de trabajo lo que de otra manera habría tomado a un equipo más de dos meses. Esta es una afirmación de cliente publicada por Anthropic, no un benchmark verificado de forma independiente, pero da una imagen concreta de la carga de trabajo que la empresa quiere que Fable aborde.

La escrutinio gubernamental también ha cambiado directamente la disponibilidad. El gobierno de los Estados Unidos aplicó controles de exportación en junio, y Anthropic suspendió el acceso porque no podía verificar la nacionalidad en tiempo real. El acceso regresó después de que se levantaron esos controles. Separadamente, Anthropic dice que fortaleció sus clasificadores de seguridad y expandió las pruebas gubernamentales después del incidente.

Para los creadores, esto convierte la selección de modelos en una elección de diseño operativo. Un agente de depuración rutinario o un flujo de trabajo de navegador puede ajustarse a Sonnet en costo y latencia. El trabajo sensible de ciberseguridad o científico puede requerir Mythos, verificación del cliente y la aceptación de que la elegibilidad puede cambiar. Fable se encuentra entre esos casos, ofreciendo capacidad de vanguardia con restricciones más amplias.

La pregunta clave es la predictibilidad: ¿pueden las organizaciones saber de antemano cuándo las salvaguardas, los clasificadores o los requisitos de acceso interrumpirán un flujo de trabajo de producción? La capacidad importa, pero el acceso confiable se está convirtiendo en parte de la especificación del producto.

[21:40] Gemini 3.5 Flash Puede Operar Pantallas Y Construir Software

Un agente de IA ahora puede mirar una pantalla, usar los controles que encuentra allí, cambiar software y devolver un resultado terminado. Google ha lanzado Gemini 3.5 Flash con uso de computadora nativo para agentes de navegador, móvil y escritorio, llevando su modelo rápido más allá de responder preguntas hacia la operación de interfaces ordinarias.

La evidencia más útil es lo que Google mostró a las personas que construyen. En una demostración, el modelo generó varias variantes de una interfaz de pago. En otra, construyó un juego a partir del documento de AlphaGo. Google también demostró agentes paralelos organizando grandes colecciones de archivos y un agente automatizando pruebas continuas de software. Esos ejemplos abarcan diseño, implementación, trabajo de escritorio y aseguramiento de calidad en lugar de una única tarea estrecha de clics.

El uso de computadora nativo importa porque muchos flujos de trabajo reales están dispersos entre pantallas y software que carecen de integraciones limpias. Un agente que puede observar la interfaz y actuar a través de ella puede potencialmente conectar esos pasos sin que cada aplicación exponga una herramienta dedicada. También puede escribir o cambiar software como parte del trabajo, por lo que el resultado no es meramente una secuencia de clics sino un artefacto completado.

Los propios resultados de benchmark de Google argumentan en contra de declarar un ganador universal. La empresa informa que Gemini 3.5 Flash supera a GPT-5.5 en MCP Atlas mientras queda rezagado en Terminal-Bench. La conclusión práctica es que la elección del modelo depende de si el trabajo se centra en herramientas de software, tareas de terminal o interacción con pantalla, no en un número general.

La precaución es igual de tangible. Un agente que controla pantallas puede hacer clic en el objetivo equivocado, malinterpretar una interfaz cambiante u obedecer instrucciones maliciosas incrustadas en una página. Los entornos restringidos, las aprobaciones visibles y los cambios que pueden revertirse siguen siendo salvaguardas importantes.

Lo que observar a continuación es qué tan confiablemente estos agentes manejan flujos de trabajo largos y desordenados fuera de las demostraciones. Gemini 3.5 Pro se describe solo como próximo, por lo que el producto disponible aquí es Flash, y su oportunidad inmediata es trabajo computacional limitado donde se puede verificar la finalización.

[23:39] Australia Vincula La Expansión De La IA A La Energía, El Agua Y El Control De Los Creadores

Australia está proponiendo un trato práctico para el crecimiento de la IA: si los grandes centros de datos quieren más electricidad y agua, sus operadores deben asumir más del costo, y los creadores australianos deben mantener el control sobre si su trabajo entrena sistemas de IA.

El gobierno estableció inmediatamente una Oficina de IA y anunció los estándares nacionales propuestos el 15 de julio. Bajo esas propuestas, los grandes centros de datos financiarían el nuevo suministro de energía, pagarían los costos de conexión a la red eléctrica, reducirían su demanda cuando se requiera y minimizarían el uso de agua. El gobierno también dice que las obras creativas australianas no deben usarse para el entrenamiento de IA sin que los creadores retengan el control.

Ninguno de esos estándares es ley todavía. Se planea la consideración del Gabinete Nacional para agosto, y la legislación está dirigida para principios de 2027. Ese momento importa porque las empresas deben leer esto como una dirección de viaje, no como una lista de obligaciones actualmente en vigor.

Para losconstructores, el cambio útil está en cómo se mide la capacidad de IA. Los chips siguen siendo importantes, pero un almacén lleno de aceleradores no puede operar sin generación, una conexión a la red, recursos de enfriamiento y aceptación local. Si los operadores deben financiar nueva oferta y reducir el consumo cuando la red está saturada, la flexibilidad se convierte en parte del diseño de infraestructura en lugar de un proyecto de eficiencia opcional. La obtención de datos de entrenamiento también puede convertirse en una decisión de producto y licencias más explícita cuando está involucrada la protección del trabajo creativo.

El enfoque de Australia puede compararse con la pausa temporal de permisos de Nueva York. Los dos gobiernos están usando diferentes palancas, pero ambos responden a la misma presión: la rápida expansión de centros de datos crea costos más allá del hardware de computación.

Lo que sucederá después dependerá de la consideración de agosto y la legislación proyectada para 2027. Los detalles a observar son cómo Australia define los grandes centros de datos, qué requiere la protección del trabajo creativo en la práctica, y cómo se evaluarían los compromisos de energía, conexión, reducción de demanda y agua.

[25:32] Google Recrea el Gol Perdido de Pelé en 1959 con IA

Un famoso gol de Pelé que efectivamente se había desvanecido de la historia visual ahora puede verse nuevamente—pero lo que Google creó es una reconstrucción, no imágenes recuperadas. El gol fue marcado en 1959, y no se conocía ninguna película sobreviviente. Para reconstruir el momento, Google y Google DeepMind combinaron documentos de archivo, planos del estadio, testimonios de testigos, historiadores, filmmaking práctico e IA generativa.

Esa distinción importa porque esto no fue un simple prompt pidiendo a un modelo de video que hiciera marcar gol a Pelé. El equipo tuvo que conciliar lo que los registros establecían, lo que los testigos recordaban, dónde una cámara podría haber sido posicionada de manera creíble, y cómo la acción debería permanecer visualmente continua. Varios sistemas de IA, incluyendo Veo, Gemini Omni y Nano Banana Pro, contribuyeron al proyecto, pero lo convincente es el proceso estratificado a su alrededor: fuentes, evidencia espacial, memoria humana, juicio de expertos, filmmaking y generación trabajando juntos.

Esto les da a museos, archivos deportivos, equipos de documentales y educadores un modelo útil para escenas que nunca fueron filmadas o cuyas grabaciones se perdieron. En lugar de presentar una aproximación genérica, pueden crear una interpretación vinculada a evidencia. Una exposición histórica podría visualizar un evento público faltante mientras muestra qué detalles vinieron de documentos, cuáles vinieron de testimonios, y cuáles requirieron inferencia. Un documental podría de manera similar hacer que un momento ausente sea comprensible sin pretender que una cámara estaba ahí.

El riesgo es obvio: imágenes generadas convincentes pueden ser confundidas con film histórico auténtico, especialmente después de ser recortadas y compartidas sin contexto. Así que la presentación es parte del producto. Al público se le debe decir claramente que están viendo una reconstrucción, con registros, memorias, incertidumbre y decisiones artísticas mantenidas visibles.

Lo que viene después tiene menos que ver con imágenes más nítidas que con mejor procedencia: si las reconstrucciones futuras permiten a los espectadores rastrear detalles importantes de vuelta a su evidencia de apoyo. Hecho cuidadosamente, el video generativo puede ayudar a las personas a encontrar historia faltante sin reescribirla silenciosamente.

[27:26] Cola práctica

De las historias de hoy: Para losconstructores, Sol hace que las ediciones de todo el repositorio, el aseguramiento de calidad del navegador, la investigación de documentos grandes y otros flujos de trabajo multitarea sean más plausibles como tareas de agente de extremo a extremo. Para losconstructores y equipos, esto significa que un espacio de trabajo puede llevar una asignación desde la exploración hasta un artefacto terminado o software funcional. Para losconstructores, esto sugiere que las oportunidades más fuertes para pequeñas empresas pueden estar dentro del trabajo administrativo repetitivo, los cuellos de botella físicos y las preguntas regulatorias oscuras. Para losconstructores, esto hace que los prototipos multimodales privados en teléfonos y computadoras portátiles sean más plausibles, particularmente donde la conectividad o la sensibilidad de datos descartan el procesamiento en la nube. Para losconstructores, esto crea un camino más directo hacia asistentes móviles fuera de línea que funcionan con cámaras, grabaciones e instrucciones mientras mantienen los datos sensibles en el teléfono. Para losconstructores de robótica, esto sugiere una división limpia del trabajo: los modelos de lenguaje pueden convertir solicitudes humanas en planes, mientras que los controladores probados ejecutan movimientos físicos. Para losconstructores, esto hace que una computadora de escritorio comercial sea un entorno de creación de prototipos plausible para asistentes privados, sistemas de recuperación, agentes de codificación y flujos de trabajo multimodales. Para losconstructores, esto significa que los modelos de codificación locales e internos pueden encontrarse con los desarrolladores dentro de un editor establecido en lugar de requerir una interfaz separada. Para losconstructores, la región de la nube y la ubicación de implementación física ahora conlleva riesgos de cronograma y costo junto con la disponibilidad de computación. Para los equipos de seguridad, esto eleva el valor de inventarios de software precisos, propiedad explícita de parches y evidencia que respalda las decisiones de gravedad. Para losconstructores, la elección del modelo ahora incluye si un flujo de trabajo puede tolerar salvaguardas o reglas de acceso cambiantes, no solo si el modelo puede completar la tarea. Para losconstructores, esto significa que un agente puede potencialmente tender un puente entre la interacción con la pantalla y la creación de software en flujos de trabajo donde las integraciones directas faltan o están incompletas. Para losconstructores de infraestructura de IA, la selección del sitio puede depender cada vez más de la capacidad de financiar la generación de electricidad, asegurar el acceso a la red, gestionar la demanda y limitar el consumo de agua. Para losconstructores, esto muestra cómo el video generativo puede convertirse en parte de un flujo de trabajo de archivo en lugar de un espectáculo independiente.

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily