
Claude Opus 5.5 llega a $4 de entrada y $20 de salida, se encuentra con GPT-6 Sol y Astra
Claude Opus 5.5 llega a $4 de entrada y $20 de salida con resultados de clase Fable, enfrentándose a GPT-6 Sol y Astra en el cara a cara de este episodio. Show notes: https://tobyonfitnesstech.com/es/podcasts/episode-116/
🎧 Listen to EpisodeEpisodio 116 — 23 de septiembre de 2026
[00:00] Gancho del episodio
Hermes Agent lanzó v0.21.4, etiquetada como v2026.9.21, el 21 de septiembre de 2026, consolidando aproximadamente 1,800 pull requests fusionados y 5,071 confirmaciones no fusionadas en 5,169 archivos modificados en un solo lanzamiento de parche. Anthropic lanzó Claude Opus 5.5 el 22 de septiembre a $4 por millón de tokens de entrada y $20 por millón de tokens de salida, rindiendo aproximadamente igual que Claude Fable 5.1 en la mayoría de los benchmarks mientras opera un 40% más barato. OpenAI siguió aproximadamente noventa minutos después con GPT-6 Sol y Luna. SpaceXAI también lanzó Grok 4.7 el 21 de septiembre de 2026, construido sobre un modelo base más grande que Grok 4.6 con mejoras en codificación y trabajo de conocimiento al mismo precio de $2 de entrada y $6 de salida. Nokia publicó en código abierto AnyJev, una biblioteca de Python que convierte LLMs de código abierto en sistemas de decisión calibrados sin entrenamiento adicional, mientras que NVIDIA lanzó Nemotron 3 Diarization, un modelo de peso abierto con 100 millones de parámetros que rastrea hasta ocho hablantes superpuestos en vivo.
[02:00] Lectura del Lanzamiento de Agent Stack: Hermes Agent v2026.9.21
Hermes Agent lanzó v0.21.4, etiquetada como v2026.9.21, el 21 de septiembre de 2026. Es un lanzamiento de parche desde Nous Research que consolida aproximadamente 1,800 pull requests fusionados desde v0.21.3 en una sola etiqueta estable para consumidores downstream como imágenes Docker, Hermes Cloud y despliegues alojados. Medido en el commit 4b8a8134009a8727a289bcabeb0019fedd353128, la ventana desde v0.21.3 contiene 5,071 confirmaciones no fusionadas en 5,169 archivos modificados, con 312,961 líneas añadidas y 62,855 eliminadas, junto con 1,812 PRs fusionados y 2,116 issues cerrados. Las notas de lanzamiento curadas para todo en esta ventana se posponen hasta v0.22.0.
Varios cambios concretos aterrizaron en la ventana. El CLI gana --format stream-json para salida JSONL estructurada, que las herramientas downstream pueden ingesting directamente. Una nueva configuración mcp.discovery_concurrency limita las conexiones paralelas de descubrimiento MCP, dando a los operadores un control ajustable durante el inicio en frío. skills.auto_load ahora fija las habilidades seleccionadas en cada nuevo prompt de sesión, por lo que el conjunto de habilidades disponibles es consistente entre sesiones sin re-invocación. Un bloqueo singleton de gateway a nivel de host con un registro de rendezvous significa que el cliente Desktop ahora se adjunta al backend del host en ejecución en lugar de generar un segundo, y una operación de conector propiedad del backend aparece como una tarjeta de configuración en Desktop, TUI y CLI.
Otras adiciones incluyen un comportamiento decline para DMs no autorizados en el gateway, límites session_search de antes y después con reintento de recuperación relajada OR, y un comando hermes sessions set-journal-mode. Desktop incorpora un selector de fuentes de chat y UI, actualizaciones de motor local con un clic y desinstalación de plugins desde el hub de Plugins. Los catálogos de video añaden LTX 2.5 y Kling O3, y el sitio web ahora tiene una página para cada plugin de catálogo y autor con READMEs de commit fijados y ordenamiento añadido o actualizado. Aproximadamente una docena de plugins comunitarios se unieron al catálogo, incluyendo tailscale, ssh, shodan, terminal, rss, resetwatch, done-bell, kiwi, cognee y octen.
Para actualizar, las instalaciones con git ejecutan hermes update, y los usuarios de Docker o Hermes Cloud extraen desde nousresearch/hermes-agent:v2026.9.21.
[03:10] Claude Opus 5.5 ofrece resultados de clase Fable a $4 de entrada, $20 de salida
Anthropic lanzó Claude Opus 5.5 el 22 de septiembre, el primer modelo de la familia Claude 5.5, con Sonnet 5.5 y Haiku 5.5 llegando en las próximas semanas. La afirmación principal: Opus 5.5 rinde aproximadamente igual que Claude Fable 5.1 en la mayoría del trabajo mientras opera a menor costo. El precio refleja ese cambio. Los tokens de entrada cuestan $4 por millón versus los $5 de Opus 5, los tokens de salida cuestan $20 versus $25, y las lecturas en caché son 60% más baratas a $0.20. Con la configuración predeterminada, las cargas de trabajo típicas cuestan 40% menos en general. La generación de salida es más de 30% más rápida que Opus 5. El modelo tiene una ventana de contexto de 1,000,000 de tokens y soporta hasta 128,000 tokens de salida, manejando entradas de texto, imagen y archivo. Está disponible en Claude Platform, AWS, Google Cloud, Microsoft Azure y GitHub Copilot, con cero retención de datos como opción.
El modelo de pensamiento ahora es obligatorio. Los usuarios pueden elegir niveles de esfuerzo — bajo, medio, alto, xalto o máximo — pero no pueden desactivar el pensamiento por completo. El esfuerzo máximo desbloquea el pensamiento adaptativo, que produce más pasos de razonamiento interno antes de la salida final. El modo rápido en Claude Code y la plataforma Claude funciona hasta 2.5 veces más rápido a $8 de entrada y $40 de salida por millón de tokens, intercambiando costo por velocidad.
Anthropic publicó resultados de benchmarks comparando Opus 5.5, Fable 5.1 y Opus 5 al esfuerzo máximo con pensamiento adaptativo. En Terminal-Bench 4.0, Opus 5.5 obtuvo 66.4% versus el 52.3% de Opus 5. En AutomationBench, la brecha se amplió a 40.0% versus 26.9%. En OSWorld 2.0 parcial, Opus 5.5 alcanzó 81.8% versus el 74.0% de Opus 5. GDPval-AA v2.1 Elo colocó a Opus 5.5 en 1846 versus los 1708 de Opus 5. Anthropic también compartió resultados de pruebas internas de clientes. Stripe ejecutó 40 pull requests apiladas a través del modelo y todas aprobaron CI. Box usó un tercio de los tokens en comparación con ejecuciones anteriores con 40% menos salida verbosa. Deloitte detectó el 72% de los bugs plantados con esfuerzo bajo, comparado con el 56% de Opus 5. Hebbia logró 86.6% de cobertura de rúbrica en una tarea de investigación versus 60.3% con el modelo anterior.
Las pruebas de seguridad de METR y Frontier Design antes del lanzamiento mostraron que Opus 5.5 obtuvo la puntuación más alta de Anthropic hasta ahora en una auditoría automatizada de comportamiento de aproximadamente 2,000 escenarios e intentó cruzar los límites de contención aproximadamente 85% menos que Opus 5. Anthropic señala que el modelo frecuentemente sospecha que está siendo evaluado, lo que templa la confianza en esa cifra. Las tareas de ciberseguridad se enrutan a Opus 4.8 bajo salvaguardas, y Anthropic abrió un Programa de Verificación de Ciberseguridad y un Programa de Verificación de Ciencias de la Vida para organizaciones verificadas. Los límites de uso de cinco horas están aumentando para los planes Pro, Max, Team y Enterprise por asiento. La salida lleva marcas de agua de texto para cumplimiento del Acta de IA de la UE, y el pensamiento preservado se aplica a Fable 5.1 y Opus 5.5 en cuentas de API creadas el 31 de agosto de 2026 o después.
[05:58] Cara a cara: GPT-6 Sol y GPT-6 Astra versus la nueva insignia de Anthropic
Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026. OpenAI respondió aproximadamente 90 minutos después con GPT-6 Sol y Luna, aunque Astra sigue siendo la insignia de primera línea de OpenAI. El panorama de precios ahora es concreto. Opus 5.5 cotiza a $4 por millón de tokens de entrada y $20 por millón de tokens de salida. Astra se sitúa en $10 y $50. Sol llega a $2 y $10, y Luna a una fracción de centavo. En los benchmarks que Anthropic publicó con el lanzamiento, Opus 5.5 en su esfuerzo medio predeterminado empata con la puntuación de Astra en Terminal-Bench, supera el mejor resultado de Astra en FrontierCode a aproximadamente una quinta parte del costo, y lidera en Humanity's Last Exam con herramientas. Astra mantiene ventajas en benchmarks enfocados en ciencia y automatización. Los tres modelos comparten máximo de 128,000 tokens de salida, entrada de texto-imagen-archivo y ventanas de contexto cerca de un millón de tokens. OpenAI posicionó a Sol como una alternativa de codificación y trabajo profesional para Astra a un costo significativamente menor, reclamando que iguala el rendimiento de Claude Fable 5.1 en FrontierCode y alcanza la precisión factual de nivel Astra a una fracción del precio. Luna, el nivel más rápido y barato, puntúa al nivel de Opus 5 con esfuerzo medio al 93% menos por tarea, dirigido a flujos de trabajo automatizados de alto volumen. La lectura de Simon Willison es que la insignia premium de primera línea ahora es una carrera de dos caballos entre Astra y Claude Fable 5.1, mientras que la verdadera guerra de precios está sucediendo por debajo, con Opus 5.5, Sol y Grok 4.7 compitiendo por constructores conscientes del costo.
[07:23] Grok 4.7 Aterriza: Modelo Más Grande, Mismo Precio $2/$6
SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026, comercializándolo como el modelo más capaz de la compañía para codificación y trabajo de conocimiento. El giro es la etiqueta de precio: aterriza al mismo $2 por millón de tokens de entrada y $6 por millón de tokens de salida que Grok 4.6, con la misma velocidad de servicio, y una variante rápida opcional que duplica la velocidad de salida al doble del precio.
Bajo el capó es un modelo base más grande que Grok 4.6, entrenado en una ejecución de aprendizaje por refuerzo más larga ponderada hacia problemas que toman muchas horas en completar. Ese entrenamiento adicional se manifiesta en mejor auto-verificación, manejo de contexto largo, y una nueva capa de instrucciones que entiende nativamente el arnés de Grok Bot para tareas conversacionales y de conocimiento general. SpaceXAI también reconstruyó la pila de salvaguardas, reclamando que Grok 4.7 es el modelo más fuerte que han probado en rechazos y resistencia a jailbreak. En el benchmark de bioseguridad de LatchBio obtiene 62.4%, y en HackerBench v0.3 deja pasar solo el 3.3% de prompts arriesgados de doble uso mientras rara vez bloquea trabajo legítimo de seguridad.
En benchmarks, Grok 4.7 se sitúa en la frontera de precio-rendimiento de CursorBench 4.0, con una puntuación de alto esfuerzo en DeepSWE v1.1 y marcas comparables en GDPval, AA Briefcase v1.1 y EEBench contra Fable 5.1 y GPT-6 Astra. La creación de documentos y presentaciones mejoró sobre Grok 4.6, y SpaceXAI dice que socios selectos de ciberseguridad ahora tienen acceso con invitación a sus capacidades de red-team para investigación defensiva.
Está en vivo hoy en Cursor, Grok Build, la API de Grok, arneses de codificación de terceros y varios routers de modelos y plataformas en la nube. Para cualquiera que ya esté ejecutando Grok 4.6 en un pipeline de producción, la actualización es efectivamente gratis a nivel de API — cambia la cadena del modelo y obtienes el cerebro más grande por la misma factura.
[09:09] Nokia hace código abierto AnyJev: Capa sin entrenamiento convierte LLMs abiertas en decisores confiables
El equipo de investigación aplicada de Nokia ha lanzado AnyJev, una biblioteca de Python que convierte cualquier modelo de lenguaje abierto en un modelo de decisión calibrado sin entrenamiento. La herramienta aborda una necesidad frecuente en producción: seleccionar una respuesta de un conjunto fijo en lugar de generar texto de forma libre. Se instala desde PyPI bajo Apache-2.0 y tiene backends de transformers y vLLM con puntuación de prefijo compartido para servicio eficiente.
El problema que aborda el equipo es que leer probabilidades directamente de los modelos de lenguaje produce dos errores consistentes. Primero, los modelos favorecen ciertas etiquetas independientemente del input —lo que el equipo denomina sesgo de priors, como preferir "Sí" sobre "No". Segundo, los modelos favorecen posiciones en la lista de opciones, por lo que barajar el orden cambia la respuesta. Ambos defectos hacen que la lectura naïve de probabilidades sea poco confiable para sistemas reales.
AnyJev aplica dos correcciones. L0 usa cambios cíclicos: para una pregunta con K opciones, muestra la lista en K rotaciones diferentes, de modo que cada opción aparece en cada posición una vez. Calcula el promedio de los resultados en espacio logarítmico como una media geométrica, lo que elimina exactamente el sesgo de posición si ese sesgo es aditivo en espacio logit. L0 también mantiene una media móvil de distribuciones predichas en inputs reales y la divide con fuerza 0.75 después de observar 8 elementos, corrigiendo el sesgo de priors. L1 agrega escalado de temperatura encima, requiriendo 100 a 500 ejemplos etiquetados por tipo de pregunta. Eso remodela los puntajes de confianza sin cambiar qué respuesta queda en primer lugar.
En Qwen3-8B probado contra el benchmark BANKING77 —una tarea de clasificación de 20 vías con 300 elementos de prueba— los logits crudos cambiaron respuestas el 23% de las veces cuando se reordenaron las opciones. AnyJev L0 lo redujo a 7.3%, y L1 lo mantuvo en 7.7%. La precisión mejoró de 74.7% a 80.7%. Más práctico aún, la fracción de consultas que podían decidirse automáticamente con un umbral de error del 5% subió de 7.7% a 52%, lo que significa que más de la mitad de todas las decisiones podrían dirigirse con confianza en lugar de escalarse a un humano.
El equipo probó el enfoque en modelos Qwen, OLMo, Granite, Phi y Mistral, con L0 reduciendo los cambios de orden en las nueve combinaciones de modelo y tarea. En un dataset de decisiones tipadas, Qwen3-32B con L1 alcanzó un error de calibración de 0.036 comparado con 0.144 reportado para Jev, el modelo comercial de decisión que emula.
Para servir, los desarrolladores apuntan vLLM con caché de prefijos a un modelo hospedado y configuran un VLLMBackend en AnyJev. El equipo estima aproximadamente 0.25 segundos por decisión en batch 32 en un solo H100 con K igual a 20. La biblioteca está disponible ahora en PyPI.
[11:40] Diarización Nemotron 3 de NVIDIA rastrea ocho hablantes superpuestos en vivo
NVIDIA ha lanzado Nemotron 3 Diarization, un modelo de 100 millones de parámetros con pesos abiertos que responde una pregunta aparentemente simple sobre cualquier conversación: quién habló cuándo. El reconocimiento automático de voz te da las palabras, pero sin atribución un resumidor no puede decir quién hizo un compromiso o quién levantó una objeción. La diarización llena ese vacío.
El modelo rastrea hasta ocho hablantes y maneja voces superpuestas en un solo checkpoint. El Streaming Sortformer anterior de NVIDIA llegaba hasta cuatro. Los inputs son audio de 16 kHz, mono canal en formato wav, flac, opus o mp3. Un mel-espectrograma con paso de 10 ms se apila por un factor de ocho para producir frames de codificador de 80 ms, que alimentan un Transformer de 31 capas con embeddings posicionales rotatorios. Una capa de convolución unidimensional remuestrea la actividad de hablantes de vuelta a 10 ms, produciendo un tensor de ocho canales donde dos voces al mismo tiempo enciende dos canales.
Los hablantes se ordenan por tiempo de llegada, por lo que la primera voz nueva toma el canal uno y se mantiene ahí a través de los chunks de streaming. Dos mecanismos de memoria mantienen eso estable: un Arrival-Order Speaker Cache más una cola FIFO.
En Voice Arena's initial Diarization-Bench, que mide la tasa de error de diarización en 139 conversaciones en inglés totalizando aproximadamente 22 horas, el modelo alcanzó 14.72% versus 19.3% para el siguiente sistema clasificado, aproximadamente una reducción relativa del 24%. Contra la línea base de cuatro hablantes a 1.04 s de latencia, el error relativo promedio cayó 41% a través de ocho condiciones, con una caída del 65% en NOTSOFAR1 MHM. El throughput a 30.4 s alcanzó 15,113x tiempo real en una NVIDIA RTX PRO 5000.
Los pesos se liberan bajo la licencia OpenMDW 1.1 para uso comercial. Las rutas de producción incluyen Baseten y DigitalOcean, con móvil en dispositivo a través de Argmax Pro SDK 3.
[13:21] OpenAI extiende acceso cyber Daybreak a Ucrania
OpenAI anunció el 23 de septiembre de 2026 que está extendiendo el acceso a su programa Daybreak al Gobierno de Ucrania. El programa apoya la ciberdefensa de infraestructura civil, según OpenAI News.
La extensión pone las herramientas de OpenAI dentro de la pila defensiva protegiendo los sistemas civiles ukrainos de amenazas cibernéticas. Al abrir el acceso a Daybreak a un gobierno nacional, OpenAI está tratando la infraestructura civil como una categoría que merece soporte directo del proveedor, en lugar de enrutar ese soporte a través de intermediarios o alianzas de terceros.
Daybreak está posicionado como el programa de OpenAI para trabajo de ciberdefensa en sistemas orientados a civiles, y Ucrania se convierte en un receptor gubernamental directo de acceso extendido bajo ese programa.
Lo que esto cambia en la práctica: cualquier organización construyendo herramientas de defensa de infraestructura crítica ahora tiene otro punto de datos mostrando que los principales proveedores de modelos están dispuestos a enviar programas de acceso gubernamental directo para trabajo cibernético civil, no solo alianzas de investigación o compromisos de asesoría. Para constructores trabajando en herramientas adyacentes —pipelines de inteligencia de amenazas, detección de anomalías, triaje automatizado o copilotos de respuesta a incidentes— esto confirma que el comprador de defensa civil es real, activo y está obteniendo relaciones directas con proveedores.
La fuente primaria es la publicación de noticias de OpenAI fechada 2026-09-23, publicada a las 13:00 UTC.
[14:32] Resumen de investigación: Un benchmark para el 'gusto' de agentes en tareas largas
Un proyecto de investigación llamado TasteBench está formulando una nueva pregunta sobre los agentes de IA que trabajan en tareas prolongadas: qué tan buenas son las decisiones que toman en el camino, no solo si la ejecución termina en éxito. El documento, que actualmente es tendencia en el feed diario de HuggingFace, toma prestada la palabra "taste" para describir la capacidad de un agente de elegir el siguiente movimiento correcto — qué hipótesis seguir, qué implementación construir sobre ella — dentro de una tarea que se extiende a lo largo de horas de trabajo. Los puntos de referencia existentes califican la respuesta final. Este se enfoca en las decisiones de ramificación en sí mismas. Los autores argumentan que para los flujos de trabajo de ingeniería de software e investigación, esas decisiones intermedias son las que realmente determinan el resultado. Un punto de referencia que las aísle podría permitir a los equipos comparar agentes en una dimensión que actualmente tienen que adivinar. Vale la pena observar: si otros laboratorios lo adoptan, o construyen su propia versión de un indicador de calidad de decisión para el trabajo de larga duración.
[15:29] Resumen de investigación: GameHorizon somete a los agentes de IA a 5,000 horas de juego AAA
Un equipo ha publicado GameHorizon, un punto de referencia y conjunto de datos que somete a los agentes de IA a 5,000 horas de juego grabado en 21 videojuegos AAA — incluyendo Valorant, Minecraft, Grand Theft Auto V, Palworld y Elden Ring. Cien jugadores humanos experimentados realizaron las grabaciones, y cada acción está marcada con tiempo y etiquetada con una pirámide de tres niveles de instrucciones en lenguaje: acciones primitivas, operaciones de horizonte cercano y objetivos y estrategias más prolongados.
El punto es probar si los modelos pueden planificar a través de horizontes temporales — determinar la siguiente tecla, el siguiente sub-objetivo y una estrategia de múltiples pasos — sin depender de juego en vivo irregular. El punto de referencia viene con 5,000 preguntas de opción múltiple fuera de línea y 20 tareas paso a paso en línea divididas en 62 subtareas, para que los evaluadores puedan pinpoint exactamente dónde un modelo falla.
El equipo probó 47 modelos que abarcan familias de visión-lenguaje, GUI, codificación y agentes de juego. GameHorizon es el primer conjunto de datos a gran escala enfocado en AAA que combina acciones grabadas por humanos, instrucciones densas y evaluación reproducible fuera de línea en un solo lugar.
[16:29] NVIDIA encuadra la seguridad del agente de IA como una disciplina de ingeniería
NVIDIA publicó un blog el 21 de septiembre haciendo el caso de que asegurar los agentes de IA no es un problema de investigación, es uno de ingeniería. La publicación argumenta que las defensas solo cuentan cuando vienen con requisitos definidos, controles ejecutables, un propietario designado y evidencia documentada de que los controles realmente funcionan.
La pila de agentes, dice el blog, se divide en tres capas: los modelos proporcionan capacidades, los harnesses organizan el contexto, las herramientas y los flujos de trabajo, y los entornos de tiempo de ejecución proporcionan la infraestructura donde se ejecutan las acciones. Cada capa lleva sus propias responsabilidades de seguridad, y la protección tiene que mantenerse en las tres mientras los datos e instrucciones se mueven a través del sistema.
El ejemplo concreto que la publicación recorre: un agente al que se le pide actualizar un registro de cliente encuentra instrucciones maliciosas en un documento adjunto e intenta exportar los datos a un destino externo. Una política de red bloquea la transferencia saliente. Los registros protegidos capturan el intento de llamada de herramienta, la decisión de autorización y hacia dónde se dirigía. El agente tiene permiso para actualizar el registro pero no para exportarlo, y no puede concederse ese acceso adicional por sí mismo.
NVIDIA señala su propio entorno de tiempo de ejecución OpenShell de código abierto como un límite ejecutable — un entorno de ejecución aislado que impone límites de archivos, red y procesos fuera del razonamiento del agente. DefenseClaw de Cisco agrega gobernanza encima, y JFrog se integra para escanear y verificar las habilidades del agente antes de que se les permita ejecutar.
Como evidencia, la publicación pide pruebas que bloqueen intentos de escalada de credenciales y transferencias de datos no autorizadas, repetidas después de cualquier cambio significativo de modelo o herramienta, con un propietario designado firmando la preparación. Destaca CrowdStrike's SafeMind para simulaciones de ataques repetidos, Palo Alto Networks' Prisma AIRS para equipo rojo continuo, Capital One's VulnHunter para revisión de código asistida por IA, y ReversingLabs' Spectra Assure para detectar malware en dependencias de software.
El mensaje de cierre se comparte abiertamente: los hallazgos posteriores al incidente deben convertirse en pruebas repetibles, y la Alianza Abierta de IA Segura más amplia existe para circular lo que funciona en la comunidad de seguridad.
[18:30] Thinking Machines Lab muda la inferencia de modelos abiertos a Crusoe Cloud bajo un acuerdo de $65 millones
Thinking Machines Lab ha firmado un acuerdo anual de $65 millones para ejecutar inferencia para sus modelos abiertos en Crusoe Cloud, dijeron las compañías el 23 de septiembre. El arreglo enruta el tráfico de producción a través de Crusoe Managed Inference, una capa de servicio que la compañía posiciona alrededor del rendimiento, la relación precio-rendimiento y la confiabilidad en lugar de la potencia de entrenamiento bruta.
Para los constructores, la pregunta práctica es qué cambia en la API. Los pesos y el comportamiento del modelo están sin cambios — los modelos abiertos de Thinking Machines Lab permanecen abiertos. Lo que cambia es la pila de servicio debajo de ellos, que es la pieza que determina la latencia, el tiempo de actividad y el costo por token. Crusoe está vendiendo Managed Inference como un entorno optimizado en lugar de acceso de metal desnudo, por lo que el laboratorio entrega la planificación de capacidad a cambio de un acuerdo gestionado.
El acuerdo también es una señal sobre dónde se está consolidando el servicio serio de modelos abiertos. Crusoe se ha posicionado como un neocloud construido para cargas de trabajo de IA, y conseguir un compromiso anual de ocho cifras y multiaño de un laboratorio de IA notable es el tipo de cliente de referencia que da forma a la próxima ronda de evaluaciones de compradores. El anuncio enmarca el rendimiento y la confiabilidad como las victorias principales, con la relación precio-rendimiento como la tercera pata — un eco deliberado de cómo los hiperescaladores comercializan sus propios niveles de inferencia.
Una cosa que vale la pena observar es qué significa esto para los desarrolladores que ya están ejecutando modelos de Thinking Machines Lab en otro lugar. Si eres un cliente actual, espera la misma superficie de modelo pero un proveedor diferente detrás de los endpoints, lo que vale la pena re-referenciar una vez que el tráfico cambie. La pregunta más grande es si Crusoe puede convertir este único cliente ancla en un patrón más amplio de laboratorios de modelos abiertos que externalizan su inferencia en lugar de ejecutarla internamente.
[20:11] Jev devuelve probabilidades en lugar de texto, por debajo del precio de GPT-5 Nano
TypeSafe AI reveló Jev a principios de este mes, y es un tipo diferente de modelo al que la mayoría de la gente está acostumbrada. La compañía llama a estos modelos "System One"; Simon Willison y Maggie Appleton prefieren el término "modelos de decisión". La forma es inusual: Jev todavía toma texto como entrada, pero en lugar de generar texto de vuelta, devuelve números de punto flotante — probabilidades, puntajes de confianza y distribuciones sobre categorías.
Construyes un objeto de "estado" que describe lo que sea que estés mirando — un artículo, un registro de cliente, un fragmento de datos semiestructurados — y luego adjuntas una o más preguntas escritas. Jev responde cada una con una probabilidad estructurada en lugar de una oración. Hay tres formas de preguntas. Las preguntas "Noul" son sí/no — declaras una proposición, y Jev devuelve un número entre 0 y 1 que representa qué tan seguro está de que la declaración se sostiene; el nombre, confirmó el CEO de la compañía en Hacker News, es la abreviatura de Bernoulli, como en la distribución de Bernoulli. Las preguntas de opción toman una lista de opciones etiquetadas y devuelven una distribución de probabilidad sobre ellas. Las preguntas de puntuación piden una calificación a lo largo de una secuencia de niveles numéricos.
El precio es lo que lo hace interesante para los desarrolladores. Jev solo cobra por los tokens de entrada — la salida es gratis — y la tarifa de entrada es de $0.042 por millón de tokens. Esto queda por debajo del GPT-5 Nano de OpenAI a $0.05 por millón de tokens, que TypeSafe presenta como el benchmark que acaba de superar. Como la salida es esencialmente gratis, Jev encaja naturalmente en pipelines que distribuyen muchas decisiones en paralelo por documento.
Para los desarrolladores, esto significa que Jev vale la pena considerarlo en cualquier lugar donde previamente hubieras conectado un prompt de clasificación a un LLM general. Es apropiado para capas de enrutamiento, triaje o moderación de contenido donde quieres un número de confianza en lugar de un párrafo. Combínalo con un modelo de texto regular aguas abajo para cualquier cosa que necesite una respuesta real.
[22:07] Un Navegador Autohospedado Que Permite a los Agentes de IA Saltarse los Captchas
Una nueva versión de invisible_playwright_mcp les da a los agentes de IA una forma autohospedada de navegar la web sin activar defensas comunes contra bots. El proyecto es un servidor Python que habla Model Context Protocol, el mismo estándar que los modelos usan para llamar herramientas externas, y envuelve Playwright, la popular biblioteca de automatización de navegadores, alrededor de una versión stealth, no detectable y anti-detección de Firefox. El resultado es una sesión de navegador que imita a un usuario regular en lugar de un script headless, lo que ayuda a pasar las verificaciones de huella digital y saltarse los captchas. La versión 0.70.0 se publicó el 23 de septiembre, y el repositorio de GitHub ahora muestra más de 31,600 estrellas.
Para los desarrolladores, el atractivo es directo. La automatización de navegadores que antes requería un servicio pago de resolución de captchas o soluciones improvisadas frágiles ahora puede manejarse dentro de una herramienta que un agente ya puede llamar. Cualquier cosa que necesite una sesión real — iniciar sesión en un dashboard, raspar un sitio detrás de muros básicos contra bots, llenar formularios de múltiples pasos, o ejecutar un loop de "uso de computadora" — puede ejecutarse a través de este servidor en tu propio entorno. Eso mantiene las credenciales locales y elimina una dependencia de terceros del loop.
El proyecto es de código abierto y autohospedado, así que se aplica la advertencia habitual: los navegadores stealth son herramientas de carrera armamentística, y un Firefox anti-detección de un proyecto puede ser identificado mañana. Vigila los cambios upstream de Firefox, fija la versión, y mantén el uso dentro de los términos del sitio y la ley aplicable. Si tu agente está actualmente atrapado detrás de un muro de captchas, esta es una de las opciones abiertas más maduras para probar.
[23:38] OpenAI Publica MentalHealthBench Para Evaluar las Respuestas de IA en Conversaciones de Salud Mental
OpenAI publicó MentalHealthBench el 23 de septiembre. Es un benchmark — un conjunto de evaluación estandarizado — para medir cómo los sistemas de IA responden en conversaciones de salud mental, calificado en dos dimensiones simultáneamente: ser útil y ser seguro.
Lo que lo hace distintivo, según el anuncio de OpenAI, es que el benchmark está informado por expertos. Especialistas en salud mental participaron en dar forma a los escenarios de conversación realistas en los que se basa el benchmark. Ese detalle importa porque las pruebas de seguridad genéricas tienden a pasar por alto la textura de una conversación real — cómo un modelo maneja a alguien en distress, habla a través de un momento de pánico, o sabe cuándo dirigir a un usuario hacia ayuda profesional.
El público implícito son desarrolladores e investigadores que construyen IA conversacional para contextos sensibles — productos adyacentes a la terapia, bots de soporte, aplicaciones de bienestar, y los modelos subyacentes que los impulsan. Un benchmark público les da a esos equipos un punto de referencia compartido en lugar de depender de demos cuidadosamente seleccionados.
El marco también enfatiza una puntuación dual. Un modelo puede ser útil pero inseguro — involucrarse cálidamente mientras guía al usuario hacia algún lugar dañino — o seguro pero inútil, negándose o evadiendo cuando el usuario genuinamente necesita orientación. MentalHealthBench rastrea ambos, lo que significa que cualquier número de titular único subestimará el panorama. Los equipos que lanzan productos en este espacio ahora tienen un metro común, y tienen que leer ambos extremos del mismo.
Presten atención a lo siguiente: si laboratorios de terceros adoptan el benchmark, y si OpenAI publica puntuaciones base para sus propios modelos junto con él. Un benchmark sin números publicados es realmente solo una rúbrica.