
GPT-6 Astra descifra un enigma de 2005 mientras Mistral lanza un modelo insignia de 675B bajo Apache 2.0
Mistral ha lanzado un modelo de 675B de peso abierto bajo licencia Apache 2.0. Además, ha presentado Devstral 2 2512, diseñado para agentes de codificación... Show notes: https://tobyonfitnesstech.com/es/podcasts/episode-117/
🎧 Listen to EpisodeEpisodio 117 — 25 de septiembre de 2026
[00:00] Gancho del episodio
Hermes Agent v2026.9.24 se lanzó el 24 de septiembre de 2026 como un artefacto estable único, etiquetado en v0.21.5 y consolidando aproximadamente 460 solicitudes de extracción fusionadas desde v0.21.4, para imágenes Docker, Hermes Cloud y despliegues alojados. Mistral siguió con Devstral 2 2512, un modelo de codificación de código abierto con 123 mil millones de parámetros dirigido a agentes de ingeniería de software de larga duración, y listó Mistral Large 3 2512 en OpenRouter—un diseño disperso de mezcla de expertos con 675 mil millones de parámetros y 41 mil millones de parámetros activos bajo Apache 2.0. GPT-6 Astra de OpenAI descifró de forma autónoma un mensaje Enigma del Ejército alemán de 1941, designado MVUEH, que había resistido cada intento criptanalítico desde que se publicó públicamente en 2005. Claude Opus 5.5 de Anthropic se abrió dentro de GitHub Copilot con una ventana de contexto de 1M de tokens, y Ando salió del modo sigiloso con un competidor de Slack construido para que los agentes de IA obtengan sus propias identidades y bandejas de entrada.
[02:00] Lectura del lanzamiento de Agent Stack: Hermes Agent v2026.9.24
Hermes Agent etiquetado en v0.21.5 el 24 de septiembre de 2026 bajo la etiqueta de lanzamiento v2026.9.24. El editor lo describe como un parche que agrupa aproximadamente 460 solicitudes de extracción fusionadas desde v0.21.4 en un artefacto estable único para consumidores posteriores—imágenes Docker, Hermes Cloud y despliegues alojados. Medido en el commit f97608f178d1ffeca59860195ab7da295f7c8e5f, la ventana contiene 1,610 commits no de fusión en 4,828 archivos modificados, con aproximadamente 164,000 líneas añadidas y 149,000 eliminadas. El reporte completo seleccionado que cubre los aspectos destacados y áreas de características desde v0.21.0 se difiere a v0.22.0.
Las notas señalan varias áreas que aterrizaron en la ventana. En Desktop, eso incluye una ola del plugin SDK que cubre una API de borrador de compositor, ranuras de lista de sesiones y decoración de filas, preferencias de navegación lateral, proveedores de etiquetas de modelo-píldora, puentes de configuración/habilidades/herramientas/perfiles tipados, una primitiva de incrustación en zona de pruebas, una ranura de configuración de apariencia, y un puente de eventos públicos para backends de plugins. Un modo de interfaz Simple/Avanzado coexiste junto a una página de Conectores que reemplaza la pestaña MCP, con una ruta de "Conectar ahora" para los servidores MCP de un plugin recién instalado y una incorporación que ofrece plugins del catálogo junto a conectores. Los catálogos completos de Desktop en francés, alemán y español se envían, y llega una configuración de dirección de texto RTL/LTR. Los selectores de compositor y Configuración aceptan entradas de modelos personalizados, los atajos de voz de tecla de función y Dictado están conectados, y el multiplexor de host obtiene stop/start/restart por perfil con una opción gateway.standalone para excluir un perfil.
En CLI y TUI, un dock en vivo muestra el /goal actual y los prompts en cola; las entregas de webhook ahora se reflejan en la sesión de chat objetivo; las imágenes -desktop alojadas incluyen Bot Screen; y el tablero kanban obtiene un modal de ticket de dos columnas con texto de tarea en markdown. Los catálogos de Nous y OpenRouter incorporan GPT-6 Sol/Terra/Luna y Claude Opus 5.5. Llegan plugins oficiales para Blender Lab y las aplicaciones NVIDIA y Broadcast. Un largo tramo de trabajo de rendimiento en ruta crítica tocó la carga de configuración, el registro de herramientas, el manejo de mensajes de puerta de enlace, y el selector de modelos, y decenas de plugins comunitarios se unieron al catálogo.
Para las rutas de actualización, el editor apunta a los usuarios a hermes update para instalaciones git o una re-ejecución del one-liner del instalador; Docker y las imágenes de Hermes Cloud se construyen desde nousresearch/hermes-agent:v2026.9.24.
[03:19] Devstral 2 2512 de Mistral apunta a agentes de codificación de larga duración
Mistral ha lanzado Devstral 2 2512, y el titular es el tamaño. Es un transformador denso de código abierto con 123 mil millones de parámetros dirigido directamente a la codificación agentiva, la categoría de trabajo de software donde una IA no solo responde una pregunta sino que lleva una tarea de múltiples pasos a través de ediciones de archivos, llamadas de herramientas y rondas de verificación.
La palanca práctica es la ventana de contexto. Devstral 2 2512 acepta 262,144 tokens en una sola pasada. Eso es lo suficientemente grande como para contener una base de código sustancial más un hilo largo de acciones previas del agente sin forzar al flujo de trabajo a resumir o soltar el historial. Para los constructores, eso importa porque el modo de fallo habitual para los agentes de codificación de larga duración es perder el hilo de lo que estaban haciendo; una ventana más grande empuja ese fallo más lejos.
La distribución es directa. El modelo está en vivo en OpenRouter bajo el identificador mistralai/devstral-2512, así que cualquiera que ya esté enrutando solicitudes a través de ese mercado puede apuntar un agente a él sin levantar nueva infraestructura. Mistral lo está posicionando como una opción de peso abierto de última generación para agentes de ingeniería de software, el tipo de trabajo que en gran medida ha usado sistemas cerrados por defecto.
Para los constructores, la pregunta interesante es si un transformador denso completamente abierto a esta escala puede mantenerse por sí mismo contra modelos de codificación cerrados en ejecuciones reales de agentes, donde el trabajo involucra uso de herramientas, recuperación de errores y cadenas de tareas largas. Esté atento a los benchmarks independientes en repositorios reales en lugar de rompecabezas de codificación aislados.
[04:46] Mistral lanza unflagship de 675B de peso abierto bajo Apache 2.0
Mistral ha listado Mistral Large 3 2512 en OpenRouter, llamándolo el modelo más capaz de la compañía hasta la fecha. El modelo usa una arquitectura dispersa de mezcla de expertos: 41 mil millones de parámetros se activan por token de 675 mil millones totales, lo que significa que el costo de computación y memoria de ejecutarlo está mucho más cerca de la cifra de 41B que del 675B completo. La ventana de contexto es de 262,144 tokens, lo suficientemente grande como para contener un documento largo o una base de código de tamaño considerable en un solo prompt sin fragmentación agresiva.
El detalle notable es la licencia. Mistral Large 3 2512 se envía bajo Apache 2.0, que permite uso comercial, redistribución y modificación con atribución. Eso es inusualmente permisivo para un lanzamiento de peso abierto de nivel frontier y elimina mucho de la fricción legal que empuja a los equipos hacia modelos más pequeños o más restringidos cuando quieren autoalojar, ajustar o construir productos comerciales encima.
Para los constructores, la pregunta práctica es si el modelo cumple con su facturación una vez que empiecen a circular las evaluaciones independientes. El listado actual de OpenRouter proporciona longitud de contexto, detalles de arquitectura y la licencia, y esa es la imagen ahora mismo. Hasta que lleguen los números de benchmark, este es el portador de bandera de pesos abiertos que vale la pena evaluar contra lo que sea que estaba ejecutando antes.
[06:01] GPT-6 Astra resuelve mensaje Enigma que desconcertó a los criptoanálisis desde 2005
Durante más de dos décadas, un mensaje Enigma del Frente Oriental permaneció sin resolver en un sitio de investigación público. El 15 de septiembre de 2026, el criptógrafo Carter Leffen apontou GPT-6 Astra de OpenAI al archivo de Crypto Cellar Research de mensajes de guerra sin descifrar y le pidió que intentara descifrarlos. El modelo eligió el candidato más prometedor, MVUEH, un mensaje del Ejército alemán de 1941 que había resistido cada intento desde 2005, y lo descifró en aproximadamente dos días.
El trabajo fue casi entièrement del modelo. GPT-6 Astra notó que MVUEH probablemente compartía texto plano con otro mensaje del mismo día, Nr. 173 SIPVX, que Alex Shovkoplyas había descifrado en 2017. Luego escribió código Python y C++ para un simulador Enigma y búsqueda estilo Bomba, anclado en el nombre de lugar repetido "ROSENOW ROSENOW" como indicador. La clave recuperada difería completamente de la clave diaria usada por otros mensajes del 10 de julio de 1941: el orden de las ruedas era 253 en lugar del habitual 512, y la rueda izquierda del Enigma giraba en la letra 72, una complicación rara que los intentos humanos anteriores no habían penetrado. El texto cifrado original también contenía errores de transcripción que habían descarrilado los desciframientos previos.
El modelo también descubrió referencias a los volúmenes de los Archivos Federales Alemanes, RS 3-3/20a y RS 3-3/63b, que coinciden con holdings reales pero no estaban listados en el sitio de Crypto Cellar. Frode Weierud, el veterano criptógrafo que dirige el archivo, dijo que encontrar esas referencias le tomó varias semanas y calificó el comportamiento del modelo como "el de un criptógrafo profesional y un investigador de archivos muy competente".
La historia obtuvo una puntuación de 733 en Hacker News después de publicarse a través de OpenAI News el 23 de septiembre. Para los desarrolladores, la conclusión tiene menos que ver con la criptografía y más con lo que un modelo agéntico puede hacer cuando se le da un objetivo de investigación abierto y un conjunto de datos público: elegir un hilo, construir sus propias herramientas y ejecutar una investigación de principio a fin.
[07:58] Claude Opus 5.5 llega a GitHub Copilot para codificación agéntica
El Claude Opus 5.5 de Anthropic ahora es seleccionable dentro de GitHub Copilot, lo que les da a los suscriptores acceso directo al modelo de razonamiento más avanzado de la empresa a través de su editor. El blog de GitHub lo posiciona para codificación agéntica, tareas agénticas de larga duración y trabajo de conocimiento.
El mecanismo principal es una configuración de "razonamiento adaptativo, esfuerzo máximo, respaldo predeterminado": el modelo piensa intensamente de manera predeterminada y recurre a respuestas más ligeras cuando es apropiado. También podría existir una variante sin razonamiento. Las entradas aceptan texto e imágenes, las salidas son texto, y la ventana de contexto se extiende hasta 1 millón de tokens — aproximadamente 1,500 páginas de Arial de 12 puntos — lo suficientemente grande como para contener una base de código completa o una sesión de varias horas en un solo prompt.
En el Intelligence Index v4.3.2 de Artificial Analysis, que combina diez evaluaciones incluyendo AA-Briefcase, Terminal-Bench 4.0, SciCode y Humanity's Last Exam, Opus 5.5 obtiene una puntuación de 58 contra una mediana de 26. El anuncio de Hacker News de GitHub recibió 331 votos positivos el mismo día. La compensación es la verbosidad y el precio: el modelo emitió 260 millones de tokens durante la ejecución del índice (mediana de 88 millones), los precios son de $4 por millón de tokens de entrada y $20 por millón de salida, y una tarea promedio del índice cuesta $5.98. Un descuento de caché del 95% suaviza esa factura para prefijos de prompts repetidos.
Para los desarrolladores, el cambio práctico es el alcance. Refactorizaciones largas, flujos de codificación agéntica de múltiples pasos y tareas mixtas de texto e imágenes — combinar una captura de pantalla con un cambio de código, por ejemplo — ahora se ejecutan dentro de Copilot sin cambiar de herramientas. Lo que hay que observar a continuación es si Anthropic lanza la variante sin razonamiento que Artificial Analysis señala como posiblemente existente, ya que un hermano más barato es lo que haría de este modelo un conductor diario en lugar de un especialista.
[09:39] Ando sale del sigilo con un rival de Slack construido para humanos y agentes de IA
Ando, una startup fundada por Sara Du, salió del sigilo el jueves con una aplicación de mensajería para equipos que se presenta como un reemplazo completo de Slack — pero con agentes de IA tratados como compañeros de equipo de primera clase en lugar de bots agregados.
La plataforma le da a cada agente su propia identidad y bandeja de entrada, con canales, mensajes directos, conversaciones grupales e incluso llamadas transcritas en vivo. Los agentes pueden navegar por canales, decidir a cuáles unirse, entrar en conversaciones sin ser etiquetados y enviar mensajes a compañeros humanos por su cuenta cuando creen que algo es importante. No se requieren aprobaciones.
Du llegó a la idea después de pasar 2025 ayudando a empresas a construir servidores MCP. La gente seguía preguntando cómo usar agentes desde dentro de Slack, y la fricción — mover mensajes de un lado a otro, dar contexto a los agentes, quemar tokens — señalaba un problema de diseño más profundo. Slack y Teams fueron construidos para un mundo que estaba empezando a dejarnos atrás, dijo. El problema más grande, en su visión, son los "proxies de carne" — humanos que retransmiten la salida de su agente al resto de la empresa.
Ando levantó $20 millones en financiamiento pre-seed y seed de Accel, Index Ventures y Emergence para contratar más personas y "quemar más tokens". Clientes en software, bienes raíces y finanzas en 15 países ya están usándolo, aunque la mayoría de los equipos son pequeños.
Un ejemplo concreto de lo que cambia: Du describió un agente que notó dos canales separados debatiendo el mismo problema. Sin que se lo pidieran, reunió a todos en un chat grupal, presentó el contexto compartido y sugirió una decisión. Los agentes podrían gestionar mejor a las personas que los humanos porque pueden procesar muchos más mensajes en un período de tiempo más corto, dijo.
No es un espacio sin disputas. Slack ha reconstruido su bot como un agente, Microsoft ha tejido Copilot en Teams, y el recientemente lanzado Buzz de Jack Dorsey apunta a desarrolladores. Pero Du ve espacio para algo construido nativo de IA en lugar de adaptado.
[11:38] El modelo de decisión abierto de 340M de Fastino ejecuta guardrails de agentes en CPU
El modelo está construido para las llamadas de juicio pequeñas pero costosas que se encuentran dentro de cada agente de IA — los momentos de "qué herramienta debo usar", "es esto seguro", "a qué categoría pertenece esto". Fastino Labs lo llama GLiNER2.5-Decide, un modelo de decisión de权重 abierto de 340 millones de parámetros lanzado el 24 de septiembre.
En lugar de generar texto, le pasas contenido más un esquema de preguntas tipadas, y devuelve respuestas estructuradas. Cada respuesta se envía con una distribución de probabilidad, una puntuación de confianza y banderas de viabilidad. Los esquemas pueden expresar reglas entre preguntas, por lo que una detección en un lugar puede forzar un veredicto en otro.
El ejemplo del guardrail muestra por qué eso importa. Decodificado independientemente, el modelo marcó un ataque de inyección de prompt con una confianza de 0.82 y simultáneamente etiquetó el mismo prompt como seguro con 0.52. La decodificación conjunta aplica una regla que requiere que cualquier daño detectado resulte en un veredicto de inseguro, colapsando la respuesta a safety=unsafe y harm_type=prompt_injection juntos. El código posterior ahora tiene una señal consistente para bloquear.
Es un clasificador no generativo construido sobre un codificador DeBERTa-v3-large y ajustado fino desde gliner2-large-v1. Los pesos se distribuyen bajo Apache 2.0; la instalación es pip install gliner2, y funciona en CPU, GPU o completamente desconectado. Fastino también ofrece inferencia alojada a través de su API GLiNER.
El conjunto interno de Fastino, Fast Decisions, cubre 5,100 ejemplos en 17 conjuntos de datos. GLiNER2.5-Decide promedió 60.1% de coincidencia exacta, liderando el conjunto en 9 de 17 conjuntos de datos y superando una baseline de clase Qwen 3.5 de 4 mil millones de parámetros en aproximadamente 2.6 puntos. En intención de soporte obtuvo 75.3%.
Latencia en batch uno con un esquema de 15 etiquetas: 167 milisegundos p50 en un Xeon de 48 núcleos, 38 milisegundos en una V100. Dos hermanos completan la familia — una variante de 1B al 59.6% y un modelo multilingüe de 287M al 56.7%.
[13:22] Black Forest Labs envía FLUX 3 Action: Un cerebro robótico de 7B
Black Forest Labs ha lanzado FLUX 3 Action, un modelo de pesos abiertos con 7 mil millones de parámetros que les dice a los robots qué hacer mediante la imaginación de lo que sucederá. Lee los frames de la cámara, el estado actual del robot y una instrucción de texto, luego genera frames de video futuros y el siguiente fragmento de movimientos del robot en una única predicción conjunta. En la tabla de clasificación de RoboLab-120, que evalúa 120 tareas de mesa en simulación, FLUX 3 Action obtiene un 42.92% de éxito en tareas, ubicándolo por delante del Cosmos 3 Nano de NVIDIA con un 36.8% a pesar de funcionar con un backbone mucho más pequeño. La imagen práctica de velocidad es lo que hace esto interesante. Cosmos 3 Nano necesita aproximadamente 4.7 veces más tiempo de procesamiento que π0.5 por segundo de movimiento del robot en una B200. FLUX 3 Action cierra esa brecha con una arquitectura más pequeña y destilación de guía. El checkpoint base se ejecuta de 1.52 a 3.95 veces más rápido que Cosmos 3 Nano en FP8 en GPUs de estación de trabajo y centro de datos, y la variante con destilación de pasos se ejecuta hasta 2.28 veces más rápido que π0.5 en el mismo hardware. La desventaja es que los checkpoints base y con destilación de guía predicen 2.13 segundos de movimiento por llamada versus 1.0 segundo para π0.5, por lo que la ventaja de velocidad depende de tu hardware y de cuánto movimiento necesita tu tarea. Los requisitos de memoria son la puerta de entrada clave para el despliegue. La política completa de DROID necesita aproximadamente 32 GB de memoria GPU en BF16 en una H200. Con cuantificación FP8 y descarga del codificador de texto, cabe en una tarjeta de 24 GB. Black Forest Labs también integró el modelo en Hugging Face LeRobot y soporta NVIDIA Jetson para escenarios de borde. En hardware real, una evaluación a ciegas con Positronic Robotics en un brazo Franka realizó 30 intentos en 10 tareas de DROID. FLUX 3 Action completó 28 de 30 intentos. Cosmos 3 Nano obtuvo 27, DreamZero 20 y π0.5 apenas 13. Los equipos pueden hacer ajuste fino del modelo con sus propias demostraciones. Black Forest Labs publicó una receta de DROID y una receta de LoRA SO-101, mostrando una habilidad de agarrar y colocar aprendida de aproximadamente 200 ejemplos. Los pesos, código y recetas se distribuyen bajo la Licencia FLUX Kommunity, que permite el uso no comercial.
[15:29] Oracle invoca fuerza mayor en el centro de datos de IA en Nuevo México
Oracle está poniendo un escudo financiero alrededor de una de sus apuestas más grandes en infraestructura de IA. La empresa envió un aviso de fuerza mayor al desarrollador de Project Jupiter, un centro de datos masivo que se construye en Nuevo México por una unidad de Blue Owl Capital. La cláusula permite a Oracle retrasar pagos si el sitio no cumple su objetivo de estar operativo en 2028. Oracle no está tratando de alejarse como el principal inquilino — está cubriendo sus obligaciones mientras el proyecto enfrenta oposición pública y retrasos regulatorios.
El marco importa para cualquiera que observe la construcción de IA. Las cláusulas de fuerza mayor generalmente permanecen en segundo plano para desastres naturales o shocks de suministro, por lo que ver a un inquilino de la nube invocar una en un sitio activo señala cuánta exposición financiera depende de cada megavatio de capacidad. Si Oracle se está preparando para que Project Jupiter se retrase más allá de 2028, la empresa quiere opcionalidad en su gasto de capital en lugar de un resultado binario de enviar o cancelar.
El proyecto ya ha atraído oposición y fricción en permisos, y un plazo de 2028 empieza a verse aspiracional cuando la energía, la regulación y las cadenas de suministro todas presionan contra un constructor a la vez. La cobertura de Oracle también le da a Blue Owl una señal tranquila: el inquilino ancla quiere flexibilidad, no necesariamente una renegociación del arrendamiento en sí.
La lectura práctica es directa. Los mapas de ruta de capacidad son contratos antes de ser concreto, y este aviso es una de las primeras señales públicas de que una hiperescala está tratando sus propios compromisos de esa manera. Observa si otros inquilinos en proyectos similares recurren a la misma protección cuando suscronogramas se tambalean.
[17:06] ¿Podría el grog de Monkey Island realmente disolver una taza en 35 segundos? Un químico lo modela.
Un químico de la Universidad de Groningen realmente ha hecho los cálculos sobre uno de los rompecabezas más famosos de los videojuegos: si el grog en The Secret of Monkey Island realmente podría comer a través de una taza de peltre en 35 segundos. El artículo, publicado en el Journal of Geek Studies, trata el comportamiento del juego como un problema inverso, comenzando desde la tasa de corrosión observada y trabajando hacia atrás para estimar qué necesitaría contener el líquido.
El autor, afiliado al Instituto ENTEG en la Facultad de Ciencia e Ingeniería, usó la Edición Especial de 2009 distribuida a través de Steam y cronometró la vida útil de la taza con un cronómetro en aproximadamente 35 segundos. Asumió que la taza era de peltre, modelada como estaño puro, con un grosor de pared de 2mm elegido como aproximación porque el juego no ofrece medición. De ahí, estimó el suministro de protones requerido para perforar esa pared dentro del tiempo observado.
Luego relacionó ese requerimiento con los ingredientes del grog listados en el diálogo del juego: ácido sulfúrico, ácido de batería, queroseno, propilenglicol, edulcorantes artificiales, ron, acetona, colorante rojo No. 2, grasa de eje, pepperoni y el misterioso SCUMM. El artículo concluye que el ácido sulfúrico y el ácido de batería podrían plausiblemente impulsar la corrosión, mientras que la mayoría de los otros ingredientes son improbables de atacar el estaño directamente o de hecho ralentizarían las cosas al recubrir la superficie del metal. El autor describe el modelo como semicuantitativo y señala que ninguno de los componentes listados explica el color verde brillante que adquiere el grog en el juego.
La publicación obtuvo una puntuación de 137 en Hacker News, evidencia apropiada de que incluso una aventura de apuntar y hacer clic de 1990 puede albergar un problema real de química si alguien se molesta en tomarlo en serio.
[18:50] IA que piensa en ADN empuja la frontera de bioseguridad
Radical Numerics, una nueva empresa fundada por investigadores que anteriormente construyeron los modelos de lenguaje genómico Evo y Evo-2 en Arc Institute, está escalando esas capacidades a un rango más amplio de problemas biológicos. Esos modelos anteriores generaron genomas completos de bacteriófagos desde cero, y los virus sintetizados resultaron funcionales en el laboratorio. Ahora el equipo, liderado por el CEO Eric Nguyen, está empujando los modelos de lenguaje genómico más allá del ADN hacia ARN y proteína, aprovechando el hecho de que las secuencias de ADN contienen marcadores naturales para genes y las secuencias que codifican proteínas. Esa estructura incorporada permite que el mismo modelo maneje múltiples lenguajes biológicos antes de entrenar nunca en estructura 3D de proteínas, epigenética o lenguaje natural. En un experimento revelado, Radical Numerics mostró un modelo mejorando progresivamente aptámeros de ARN emparejados con puntuaciones de rendimiento, luego le pidió que continuara la trayectoria por su cuenta. El modelo recapituló secuencias de mayor puntuación que no se le habían mostrado, sugiriendo que aprendió no solo coincidencia de patrones sino optimización activa en el lenguaje del ADN. El equipo argumenta que las mismas capacidades que impulsan un diseño más rápido de vacunas y terapéuticos también importan para la defensa. A medida que los laboratorios de IA de frontera marcan la bioseguridad junto a la ciberseguridad como una preocupación principal, la pregunta es si los defensores pueden moverse lo suficientemente rápido. Radical Numerics está apuesta por empujar la frontera más fuerte en lugar de retroceder. La empresa incluye a Michael Poli, anteriormente científico fundador en Liquid AI, como científico jefe de IA; Stefano Massaroli, anteriormente postdoc con Yoshua Bengio y miembro del equipo fundador en Liquid AI, como presidente; y Armin Thomas, anteriormente postdoc en Stanford que trabajó con Chris Ré, como CTO. Una cosa a observar: cómo la generalización entre modalidades en modelos de lenguaje genómico se desarrolla en cadenas de herramientas de detección de patógenos y desarrollo de vacunas como activos defensivos y preocupaciones potenciales de superficie de ataque.
[20:38] Resumen de investigación: Investigadores entrenan modelos de video para rastrear objetos ocultos como lo hacen los humanos
Un artículo en tendencia en el feed de investigación diario de HuggingFace plantea una pregunta sorprendentemente a nivel de niño pequeño: ¿entienden los modelos actuales de generación de video — los sistemas de IA que sintetizan escenas en movimiento — la permanencia del objeto, ese sentido cotidiano de que las cosas siguen existiendo cuando no puedes verlas? Los autores argumentan que los modelos de video son un candidato natural para estudiar inteligencia física similar a la humana, ya que las versiones recientes han comenzado a mostrar habilidades de razonamiento emergidas. Pero cuando sondjean esos modelos, los supuestos centrales resultan estar en gran medida faltantes. Su solución propuesta es WROP, un nuevo conjunto de datos de entrenamiento construido en torno a los mismos tipos de intuiciones físicas que un bebé desarrolla en sus primeros meses de vida. El conjunto de datos está destinado a enseñar a los modelos del mundo a mantener los objetos consistentes a través de oclusiones y reentradas, para que un video generado recuerde la pelota que rodó detrás de la silla. El objetivo más amplio son modelos del mundo que razonen sobre escenas físicas más como lo hacen las personas, con beneficios para la robótica, la simulación y cualquier sistema que tenga que predecir qué sucede con las cosas que brevemente salen de la vista.
[21:42] Resumen de investigación: Agentes de codificación de IA superan a planificadores robóticos construidos a mano
La planificación robótica es difícil porque elegir qué hacer, dónde agarrar y cómo moverse están entrelazados juntos. Los ingenieros generalmente escriben estos planificadores a mano, lo que toma meses. Un nuevo estudio preguntó si los agentes de codificación de IA podrían hacer el trabajo en su lugar.
Los agentes, incluyendo Claude Code y Codex, recibieron una descripción de la tarea y acceso al simulador. Escribieron programas, no respuestas de una sola vez sino algoritmos reutilizables, dentro de un presupuesto fijo. Los programas congelados fueron luego probados en instancias no vistas.
En entornos simulados de dos benchmarks de robótica, los agentes superaron a todas las alternativas. El éxito promedio alcanzó entre el 56% y el 95%, mientras que los planificadores diseñados manualmente lograron un 47% en el subconjunto donde estaban disponibles. Los agentes también se mantuvieron a medida que aumentaba la cantidad de objetos, el régimen donde los planificadores clásicos generalmente colapsan.
La conclusión: los equipos de robótica que se encuentran atrapados manteniendo código de planificación personalizado ahora tienen un atajo funcional. Apuntar un agente a un simulador, dejarlo iterar, congelar el programa y enviarlo. El cuello de botella cambia de horas de ingeniería a presupuesto de cómputo.
[22:43] OpenAI lanza MentalHealthBench para evaluar respuestas de IA en salud mental
OpenAI publicó MentalHealthBench el 23 de septiembre, un benchmark construido con la participación de expertos en salud mental para evaluar qué tan útiles y seguros son los sistemas de IA en conversaciones realistas de salud mental. El objetivo es proporcionar a los desarrolladores, investigadores y proveedores de modelos una regla común para evaluar el comportamiento de los asistentes en un dominio donde las puntuaciones de precisión genéricas no capturan lo esencial.
Los benchmarks estándar tienden a medir si un modelo respondió correctamente una pregunta factual. Las conversaciones de salud mental son diferentes: una respuesta puede ser factualmente precisa y aun así ser dañina, despectiva o alentar conductas peligrosas. El planteamiento de OpenAI posiciona al benchmark como un relleno de ese vacío, enfocándose en si un modelo responde de manera útil mientras se mantiene dentro de límites seguros, incluyendo saber cuándo escalar o recomendar ayuda profesional en lugar de improvisar.
Los escenarios dentro de MentalHealthBench son situaciones conversacionales realistas que los usuarios realmente llevan a los asistentes de IA, moldeadas por profesionales en lugar de escritores de pruebas puramente sintéticos. Esa participación de expertos es el mecanismo central: las personas que trabajan en salud mental por oficio deciden cómo se ve una buena respuesta en cada intercambio, por lo que el benchmark califica el comportamiento de la manera en que lo haría un clínico, no de la manera en que lo haría una prueba de opción múltiple.
Para los constructores, el efecto práctico es una puntuación comparable para la calidad de respuesta en salud mental. Un equipo que lanza un coach de bienestar de IA, una aplicación de diario adjunta a terapia o un chatbot de triaje ahora puede señalar un resultado de benchmark documentado en lugar de depender de impresiones o demostraciones selectas. El lanzamiento también señala que la evaluación de seguridad específica del dominio se está convirtiendo en una expectativa predeterminada en áreas sensibles, no en una ocurrencia tardía añadida después del lanzamiento.
Una cosa a observar es si otros laboratorios y evaluadores independientes adoptan el benchmark, lo bifurcan o construyen versiones competidoras, ya que el estándar de calificación de un solo proveedor solo es tan útil como la forma en que la comunidad más amplia lo trate.