
Gemini 3.7 Flash y Codex Bedrock
Análisis profundo del razonamiento híbrido de Gemini 3.7 Flash. También cubrimos el enrutamiento Bedrock de OpenAI Codex rust-v0.148.0, el modelo de... Show notes: https://tobyonfitnesstech.com/es/podcasts/episode-104/
🎧 Listen to EpisodeEpisodio 104 — 19 de agosto de 2026
[00:00] Apertura del episodio
OpenAI Codex rust-v0.148.0 trae integración con Bedrock y ramificación de sesiones, mientras que el Gemini 3.7 Flash de Google introduce razonamiento híbrido a la latencia y costo de Flash. Z.ai lanza GLM 5.3 con un contexto de 1M de tokens, Qwen 3.8 27B llega para implementación local, y una hoja de ruta de agentes trilingües completa la primera parte del episodio, seguida de análisis más profundos sobre flujos de trabajo empresariales, cuellos de botella de decodificación y modelos del mundo. Cada historia recibe el mismo tratamiento: qué se lanzó, el mecanismo subyacente y qué cambia para los desarrolladores que trabajan en esto.
[02:00] Lectura del lanzamiento de Agent Stack: OpenAI Codex rust-v0.148.0
OpenAI lanzó Codex rust-v0.148.0 el 18 de agosto, y la adición principal es Amazon Bedrock como proveedor integrado. Ahora puedes apuntar Codex a modelos hospedados en AWS a través de tu perfil y región de AWS, con enrutamiento de GPT-5.6 soportado de fábrica. Para equipos que ya están estandarizados en AWS, esto elimina una razón de larga data para mantener Codex separado del resto de su stack.
El lado de flujo de trabajo del lanzamiento es igual de práctico. Un nuevo comando codex exec fork ramifica una sesión existente en una que puedes ejecutar de forma independiente, y el selector de reanudación de TUI ahora te permite archivar o restaurar sesiones pasadas. Combinado con /export, que vuelca una conversación completa de TUI a Markdown en tu portapapeles o un nuevo archivo, finalmente puedes tratar una sesión de Codex como un verdadero artefacto: ramifícala, guárdala, compártela y retómala después.
La visibilidad de costos también es nueva. /status, las líneas de estado y la barra de título del terminal ahora pueden mostrar créditos de hilo estimados o costos para espacios de trabajo elegibles. Para cualquiera que ejecute Codex contra un backend medido, este es un cambio significativo: puedes ver cómo se mueve la factura sin salir del terminal.
Los hooks también se volvieron más poderosos. Los scripts externos ahora pueden ejecutarse de forma asíncrona e invocar herramientas MCP directamente, por lo que un hook no tiene que bloquear el turno principal mientras hace su trabajo. Eso desbloquea patrones de automatización de mayor duración, como un hook que inicia una compilación o una consulta de base de datos sin congelar el agente.
En esencia, el lanzamiento corrige muchos bordes ásperos silenciosamente. Los cambios de modelo ya no dejan instrucciones obsoletas ni cambian un turno activo a mitad de camino. Las sesiones reanudadas restauran su directorio de trabajo persistido y política de aprobación. Los turnos se reconectan a través de interrupciones temporales del proveedor, y los servidores MCP se recuperan automáticamente después de la reautenticación de OAuth en lugar de requerir un reinicio de Codex. La TUI ya no activa prompts desde entrada de terminal en búfer, la renderización del compositor y la transcripción manejan correctamente pegados CRLF, espacios en blanco ajustados y URLs largas, y las restricciones del sandbox ahora fallan de forma segura para rutas denegadas o ilegibles tanto en Linux como en Windows.
[02:58] Análisis profundo: Gemini 3.7 Flash y la llegada del razonamiento híbrido
El Gemini 3.7 Flash de Google representa un cambio arquitectónico significativo al introducir razonamiento híbrido en la infraestructura de IA en producción. En lugar de obligar a los desarrolladores a elegir entre un modelo de lenguaje estándar instantáneo o un modelo de razonamiento costoso de alta latencia, Gemini 3.7 Flash unifica ambos regímenes en una única arquitectura de modelo. Los desarrolladores controlan este comportamiento directamente a través de un parámetro de presupuesto de pensamiento configurable, que puede variar desde cero para inferencia estándar sub-segundo hasta 64,000 tokens de pensamiento para resolución profunda de problemas de múltiples pasos.
Lo que hace esto particularmente impactante para los constructores de agentes es la combinación de profundidad de razonamiento, multimodalidad nativa y alto rendimiento. Gemini 3.7 Flash preserva capacidades multimodales completas a través de texto, código, imágenes de alta resolución, video y audio dentro de su ventana de contexto de 1M de tokens. En evaluaciones de referencia como SWE-bench Verified, Gemini 3.7 Flash ofrece capacidades de codificación y refactorización a nivel de frontera que rivalizan con modelos mucho más grandes, mientras mantiene el costo y la latencia de la API en el nivel Flash.
Cuando se compara con la competencia, las ventajas y desventajas quedan claras. En comparación con Claude 3.7 Sonnet, que también adopta razonamiento híbrido, Gemini 3.7 Flash apunta a bucles de ejecución de agentes ultra-rápidos a una fracción del costo, lo que lo hace ideal para flujos de trabajo iterativos continuos y coordinación multi-agente. En comparación con el o3-mini o o1 de OpenAI, que utilizan niveles de razonamiento fijos y carecen de razonamiento nativo de audio/video, Gemini 3.7 Flash proporciona control granular continuo sobre los tokens de pensamiento junto con un contexto multimodal de 1M de tokens. Y contra modelos de contexto largo solo de texto como GLM 5.3 o modelos locales cuantizados como Qwen 3.8 27B, Gemini 3.7 Flash proporciona confiabilidad de producción y tiempo de primer token sub-segundo inmediato.
Para los desarrolladores que construyen bucles de agentes, el patrón recomendado es la asignación dinámica de pensamiento: ejecuta clasificación rutinaria,分发 de herramientas y verificaciones de lint con tokens de pensamiento establecidos en cero, y escala dinámicamente los tokens de pensamiento entre 2,048 y 16,384 cuando ejecutes exploración compleja de codebase, planificación arquitectónica o localización profunda de errores.
[04:25] Z.ai lanza modelo de razonamiento GLM 5.3 con contexto de 1M de tokens
Z.ai ha puesto GLM 5.3 en OpenRouter, y el número destacado es la ventana de contexto: un millón de tokens en el lado de entrada, con un techo de 4,096 tokens en las salidas. El modelo se describe como un modelo de razonamiento a gran escala construido para ingeniería de software compleja y tareas de agentes de largo horizonte: en términos simples, está optimizado para trabajo que abarca muchos pasos a través de un codebase en lugar de respuestas de un solo turno.
Ese es un espacio significativo por llenar. La mayoría de los modelos de razonamiento en el router hoy ofrecen ventanas de contexto más pequeñas, por lo que cualquier flujo de trabajo que necesite ingestar un repositorio grande, una larga secuencia de llamadas de herramientas o un plan extendido ahora tiene otro candidato para enrutar. Texto entrada, texto salida es la única modalidad listada, por lo que los constructores que enruten trabajo multimodal no recibirán ayuda de esta entrada.
El movimiento práctico es pasar GLM 5.3 por un pequeño conjunto de evaluaciones reales de agentes de codificación antes de tratarlo como predeterminado. El contexto largo por sí solo no es una ventaja defensiva: lo que importa es si el modelo se mantiene coherente a través de toda esa ventana y realmente planifica bien a través de muchos turnos de trabajo de agente. Estate atento a los primeros resultados de referencia de equipos que ejecuten evaluaciones de agentes, y a cualquier señal de precios o límites de tasa que cambiarían la decisión de enrutamiento a escala.
[05:45] Qwen 3.8 27B es excelente, pero piensa demasiado por defecto
El laboratorio de investigación Qwen de Alibaba lanzó Qwen 3.8 27B el viernes: un modelo de lenguaje de 27 mil millones de parámetros con capacidad de visión, licenciado bajo Apache 2, lo suficientemente pequeño para ejecutar en una laptop razonablemente equipada. Los puntos de referencia auto-reportados de Qwen claiman que mejora tanto sobre el anterior Qwen 3.6 27B como sobre el Qwen 3.7-Plus de peso cerrado, que era uno de los modelos más fuertes de Qwen de cualquier tamaño hasta mayo.
Simon Willison lo puso a prueba en una MacBook Pro M5 Max de 128GB y una NVIDIA DGX Spark, ejecutando la versión cuantizada Q4_K_M de 17GB de LM Studio, y también probó llama-server directamente en la Spark. La peculiaridad principal: Qwen viene con reasoning_effort configurado por defecto en xhigh — la documentación describe xhigh como "para tareas complejas que requieren análisis exhaustivo" — y la versión GGUF de LM Studio conserva ese valor por defecto. En hardware de consumo, el resultado es que el modelo consume todos los tokens disponibles pensando en indicaciones mundanas. La ventana de contexto predeterminada de 8,192 tokens de LM Studio hizo evidente el problema; cargar el modelo con su contexto completo de 262,144 tokens ayudó, pero la solución real es bajar reasoning_effort a medio o bajo.
El tamaño de 27B, la licencia Apache 2 y el contexto de 262K lo convierten en un objetivo atractivo para los desarrolladores que priorizan lo local y buscan entrada de visión y una licencia permisiva. Algo a observar: los benchmarks independientes — Willison señala que los números reportados por Qwen son sorprendentes pero aún no han sido probados por terceros.
[07:07] Una hoja de ruta trilingüe para aprender IA agentiva, con más de 240 recursos seleccionados
Una hoja de ruta trilingüe para aprender IA agentiva recibió una actualización fresca en GitHub esta semana. El repositorio, awesome-agentic-ai-zh de WenyuChiou, presenta una ruta estructurada desde los fundamentos de LLM hasta sistemas multi-agente, escrita en tres idiomas: chino tradicional, inglés y chino simplificado. El título en chino del proyecto dice 中文 AI agent 學習地圖.
La hoja de ruta viene con más de 240 recursos seleccionados y ejemplos prácticos — suficientes para funcionar como un currículo autodirigido en lugar de una lista dispersa de publicaciones de blog. GitHub muestra 5754 estrellas en el repositorio, y el mantenedor publicó actualizaciones el 18 de agosto de 2026, siguiendo una versión fechada el 14 de agosto.
Lo que hace que el proyecto se destaque es su diseño trilingüe. La mayor parte del material de aprendizaje de IA agentiva existe solo en inglés, lo que deja una verdadera brecha de entrada para los desarrolladores chinos que quieren seguir el campo. Al mostrar el mismo contenido en 繁中, inglés y 简中 lado a lado, el repositorio permite a un aprendiz elegir un idioma inicial y cambiar cuando la terminología se vuelve confusa — algo pequeño que importa cuando te encuentras con jerga como llamadas a herramientas o el bucle del agente.
Para los desarrolladores, la lectura práctica es directa. Si eres nuevo en IA agentiva y quieres una ruta secuencial en lugar de tutoriales aleatorios, la hoja de ruta ofrece un punto de inicio gratuito y organizado. Lo siguiente a observar es si el mantenedor mantiene la lista de recursos actualizada a medida que el stack agentivo sigue evolucionando — la actualización de agosto sugiere que sí.
[08:34] OpenAI lanza iniciativa para llevar supervisión democrática a la IA en seguridad nacional
OpenAI anunció una nueva iniciativa el 18 de agosto orientada a fortalecer la supervisión democrática de la IA en seguridad nacional. El programa se construye alrededor de tres pilares: proporcionar a las instituciones gubernamentales herramientas, capacitación y experiencia para examinar el despliegue de IA en contextos de defensa e inteligencia. OpenAI publicó el anuncio en su sitio de noticias, enmarcando el movimiento como respuesta a las crecientes preguntas sobre cómo se integra la IA en el trabajo de seguridad estatal y cuánto control reciben esos despliegues de organismos elegidos e independientes.
El anuncio es ligero en detalles específicos. OpenAI no listó agencias socias nombradas, cohortes de capacitación concretos ni compromisos medibles en la página misma, por lo que el impacto a corto plazo para los desarrolladores es mayormente indirecto. Para cualquiera que esté construyendo productos que toquen compradores gubernamentales, de defensa o inteligencia, la señal es que OpenAI está activamente moldeando el lenguaje y las expectativas sobre cómo los proveedores de IA deben relacionarse con las instituciones de supervisión, lo que puede cambiar las conversaciones de adquisición y los requisitos base de confianza con el tiempo. Una cosa a observar: si los anuncios de seguimiento nombran instituciones específicas, cohortes de capacitación o pilotos de supervisión que den bordes más nítidos a la iniciativa.
[09:40] NVIDIA convierte ChatGPT Work en una capa de flujo de trabajo global
OpenAI publicó una historia de cliente el 18 de agosto titulada "Cómo NVIDIA escala experiencia con ChatGPT Work," enmarcándola como una mirada al interior de cómo un importante fabricante de chips usa el producto día a día.
El resumen en la página de noticias de OpenAI describe tres resultados: los equipos de NVIDIA usan ChatGPT Work para reducir tareas manuales, conectar señales de rápido movimiento y escalar flujos de trabajo exitosos globalmente.
Ese enmarque posiciona ChatGPT Work como infraestructura compartida — un lugar donde el patrón de trabajo de un equipo puede ser empaquetado y redistribuido a través de la organización en lugar de quedar atrapado en una sola sesión.
El caso de estudio no desglosa qué divisiones de NVIDIA lo adoptaron primero ni cuantifica horas ahorradas, por lo que la lectura más útil es estructural: una empresa cuyo negocio es construir aceleradores de IA está usando el producto de chat de OpenAI como una capa de coordinación interna.
Para los desarrolladores que observan el mercado empresarial, la señal práctica es que los grandes clientes están comenzando a tratar las herramientas de IA conversacional como infraestructura de flujo de trabajo, no solo como máquinas de respuestas.
Una cosa a observar: si los futuros casos de estudio de OpenAI revelan números concretos o plantillas de flujo de trabajo específicas que otros equipos puedan copiar, en lugar de mantenerse en la altitud general de "los equipos lo usan para escalar experiencia."
[10:53] Resumen de investigación: el cuello de botella del razonamiento de la IA está en la decodificación, no en el tamaño del modelo
Los problemas de la Olimpiada de Lingüística piden a los participantes descifrar un idioma desconocido desde cero — sin manual de reglas, solo oraciones de ejemplo. El Desafío IOL-AI entregó esos rompecabezas exactos a equipos de IA bajo restricciones estrictas (una sola GPU T4 y treinta minutos por problema). Los sistemas limitados en recursos que los organizadores presentaron quedaron en el cinco por ciento inferior de los participantes humanos, mientras que un modelo de frontera, Claude Opus 4.8, igualó un desempeño de medallista de oro. El hallazgo clave fue que el tamaño no decidió al ganador: envíos más pequeños y ajustados superaron a modelos varias veces más grandes, y las ganancias vinieron de una decodificación más inteligente — cómo el modelo maneja su propia salida — en lugar de capacidad bruta. La puntuación automática rastreó las clasificaciones del jurado pero favoreció a los sistemas débiles. La conclusión para cualquiera que construya sistemas de razonamiento: los rompecabezas lingüísticos son una prueba limpia de si un modelo realmente puede resolver cosas, y el cuello de botella ahora es el manejo de salida, no el tamaño del modelo.
[11:50] OpenAI describe su enfoque para el ritmo de los modelos a medida que aumentan las capacidades cibernéticas
OpenAI publicó un blog el 18 de agosto titled "Pacing model development in an era of cyber-critical capabilities." El artículo presenta el enfoque de la empresa para lanzar modelos de vanguardia en una época en que los sistemas de IA están adquiriendo capacidades cibernéticas cada vez más significativas. Según el resumen publicado, OpenAI está fortaleciendo las prácticas de monitoreo, alineación y seguridad en torno al desarrollo de modelos de vanguardia, y posicionando esas salvaguardas como el mecanismo que guía el ritmo con el que se lanzan los nuevos modelos.
El artículo no anuncia un producto, modelo o herramienta específica. Se lee como una pieza de política y postura: una explicación de cómo OpenAI está pensando sobre la relación entre el avance de las capacidades del modelo, particularmente en dominios relevantes para la ciberseguridad, y los controles que la empresa aplica antes y durante el lanzamiento. El resumen disponible describe las salvaguardas en términos generales en lugar de nombrar nuevas suites de evaluación, programas de red team o puertas de implementación.
Para constructores y operadores, el mensaje práctico es modesto pero vale la pena señalar. El momento del lanzamiento de modelos de vanguardia se está moldeando cada vez más por consideraciones de riesgo cibernético en lugar de únicamente por indicadores de capacidad. Cualquiera que esté planificando alrededor de futuros lanzamientos de modelos de OpenAI, ya sea para herramientas de seguridad, flujos de trabajo de agentes que tocan sistemas sensibles o aplicaciones críticas para la seguridad, debe esperar que la documentación de evaluación cibernética se convierta en una parte más visible de las publicaciones futuras de lanzamiento. Hay que estar atento a si los próximos anuncios de modelos vienen con resúmenes de evaluación cibernética explícitos junto con los habituales resultados de capacidad.
[13:13] Resumen de investigación: Los modelos del mundo de IA pueden cambiar de objetivos sin reentrenamiento
La mayoría de los agentes de aprendizaje por refuerzo que aprenden un "modelo del mundo" — una simulación interna de cómo se comporta su entorno — quedan bloqueados en un objetivo. Entrena a un agente para navegar por un laberinto buscando la llave azul, y por lo general no se puede redirigir para buscar la llave roja sin más interacción con el entorno, porque la lógica de recompensa está entrelazada con la percepción dentro de una misma red neuronal. Un equipo de investigadores propone un pequeño cambio con un gran efecto práctico: separar el modelo del mundo para que la reconstrucción de observaciones y la predicción de recompensas ya no compartan la misma representación. La recompensa se convierte en una función sobre algunas variables de estado simbólicas legibles por humanos, mientras que el resto de la red sigue prediciendo lo que el mundo hará a continuación. Esa separación es lo que hace posible la transferencia de tareas sin ejemplos — la misma simulación aprendida puede ser redirigida hacia un nuevo objetivo reescribiendo solo la regla de recompensa. En la práctica significa que un robot entrenado en simulación podría ser redirigido para recoger un objeto diferente, o un agente de juego cambiado a un nuevo objetivo de puntuación, sin una nueva ejecución de recolección de datos.
[14:21] Asana intercambia una migración de cinco años por dos semanas con Codex
Asana, la empresa de gestión de trabajo, reemplazó un sistema de pruebas obsoleto en aproximadamente dos semanas usando el agente de codificación Codex de OpenAI — un trabajo que su equipo de ingeniería había estimado que tomaría cerca de cinco años. El costo total quedó en alrededor de doce mil dólares.
Esa brecha es el titular. Dos semanas en lugar de cinco años, doce mil dólares en lugar de un proyecto de personal multianual. OpenAI publicó el caso el 18 de agosto como evidencia de que los agentes de codificación de vanguardia pueden comenzar a comprimir migraciones de sistemas legacy que han estado envejeciendo silenciosamente en los respaldos de ingeniería porque nadie quería financiarlas.
La historia carece de specifics técnicos. OpenAI no publicó qué configuración de Codex usó Asana, el tamaño del conjunto de pruebas, o cuánto revisión humana estuvo involucrada en la ejecución de dos semanas. Los números de dos semanas y cinco años provienen de la propia estimación de Asana.
Lo que el caso sí establece es que una migración que alguna vez se estimó que requeriría un pequeño equipo durante años puede pasar a dos ingenieros, dos semanas y un presupuesto modesto con un agente de codificación de la generación actual, al menos para una empresa en una carga de trabajo. Si tienes un subsistema deprecado sentado en la hoja de ruta, esto ahora es una partida realista en lugar de una fantasía.
El siguiente punto de datos que sharpenaría la imagen sería que Asana publicara su propio write-up de ingeniería con el alcance del conjunto de pruebas y la proporción de revisión humana, ya que el resumen de OpenAI no incluye un changelog detallado.
[15:50] OpenAI presenta la ventana del defensor sobre las amenazas cibernéticas de la IA
El 17 de agosto, OpenAI publicó una pieza de perspectiva llamada 'The Defender's Window' que presenta la IA como algo que está reconfigurando ambos lados de la ciberseguridad. La publicación states que OpenAI está fortaleciendo sus propias defensas y apunta a los equipos de seguridad hacia orientación sobre qué hacer a continuación. Más allá de esa amplia presentación, el material fuente no especifica qué productos, modelos o sistemas de detección cambiaron, qué controles se agregaron, o qué mitigaciones concretas está recomendando la empresa. Se lee como una pieza de opinión y hoja de ruta en lugar de un changelog, por lo que el mensaje práctico ahora es mayormente direccional: OpenAI quiere que los defensores estén pendientes y traten el modelo de amenaza como algo que está cambiando, ya que las herramientas de IA pueden reducir el costo de ciertos ataques en ambos lados. Los equipos de seguridad que buscan cambios específicos en productos de OpenAI, reglas de detección nombradas o mitigaciones frescas necesitarán leer la publicación directamente para la lista completa, porque los materiales de resumen no los enumeran. Lo interesante a observar a continuación es si esta presentación se convierte en características shipped o detecciones medibles en las próximas semanas, o se mantiene como una declaración de postura.
[16:56] ChatGPT Ads llega a 31 mercados europeos
OpenAI ha expandido ChatGPT Ads a 31 mercados europeos, llevando el programa de un piloto limitado a un lanzamiento regional más amplio. La empresa publicó la noticia el 18 de agosto, presentando la expansión como una forma para que los anunciantes lleguen a las personas mientras están activamente explorando, comparando opciones y tomando decisiones dentro del chatbot.
El cambio importa porque la IA conversacional ha pasado los últimos años siendo mayormente un centro de costos para los laboratorios detrás de ella. Los anuncios cambian esa ecuación, y una expansión europea a 31 países cambia la pregunta sobre escala. ChatGPT es uno de los productos de IA para consumidores más utilizados en la región, por lo que los espacios patrocinados dentro de él ahora llegan a una audiencia por la que los anunciantes solían pagar a Google o Meta. La presentación de OpenAI de los "momentos de decisión" también hints hacia dónde están ubicados los espacios: no solo al final de una respuesta, sino en los lugares donde alguien está comparando productos, evaluando opciones o a punto de actuar.
Para constructores y vendedores en Europa, el efecto práctico es que ChatGPT ya no es una curiosidad para mencionar en una presentación. Es un lugar para realmente ejecutar campañas, con su propia audiencia y señales de intención. Para cualquiera que esté lanzando un producto de consumo, la pregunta a largo plazo es si los espacios de recomendación dentro de los asistentes comienzan a desplazar a los anuncios de búsqueda tradicionales, y si tu categoría es una que ChatGPT mostrará en esos momentos.
[18:21] OpenAI respalda 14 proyectos de política independientes para la economía de la IA
OpenAI anunció el 17 de agosto que está financiando 14 proyectos independientes para desarrollar nuevas ideas de políticas para lo que llama la Era de la Inteligencia. Las becas apuntan a dos objetivos amplios: expandir la oportunidad económica a medida que la IA se extiende por el trabajo, y fortalecer la resiliencia societal ante la disrupción que viene con ella. OpenAI está actuando como patrocinador en lugar de como laboratorio de ideas, seleccionando equipos externos para generar ideas para que la conversación de políticas drawing on más puntos de vista que la hoja de ruta de una sola empresa.
Eso importa ahora porque los gobiernos todavía están redactando legislación de IA y los mercados laborales ya están cambiando bajo el peso de las nuevas herramientas. Los proyectos financiados podrían alimentar recomendaciones concretas en debates activos en lugar de producir principios vagos. Con OpenAI misma como beneficiaria principal de la construcción de IA, canalizar dinero a través de investigadores independientes también es un intento de ampliar quién tiene la oportunidad de definir las reglas del camino.
Qué ver a continuación: los temas que abordan los 14 equipos. La forma de sus portafolios revelará dónde los investigadores independientes ven las brechas más marcadas, ya sea que se trate de desplazamiento laboral, educación, regulación de seguridad o algo completamente diferente, y esa señal llegará antes de que cualquier documento de política terminado lo haga.