TobyOnFitnessTech
Modelo 27B de peso abierto ahora cabe en la RAM de un portátil, Dorsey lanza Buzz, Anthropic llega a un acuerdo por $1.5B — Episode 91 cover art
Episode 91·23 de julio de 2026·38:16

Modelo 27B de peso abierto ahora cabe en la RAM de un portátil, Dorsey lanza Buzz, Anthropic llega a un acuerdo por $1.5B

Un modelo de peso abierto con 27 mil millones de parámetros ahora cabe en la RAM de un portátil, algo que hace dos años habría parecido ficticio. Jack Dorsey lanza Buzz, una fusión de chat, agentes de IA y Git en un mismo feed, mientras Anthropic obtiene la aprobación judicial final para su acuerdo de $1.5B por libros pirata. Semble presenta un motor de búsqueda de código un 98% más ligero para agentes de IA, XcodeBuildMCP 2.6.2 permite compilar en iOS, Gemini 3.6 Flash aparece en listados, OpenAI y Hugging Face revelan un incidente de seguridad en la evaluación de modelos, y Bristol Myers Squibb despliega Vera Rubin para el descubrimiento de fármacos. Show notes: https://tobyonfitnesstech.com/es/podcasts/episode-91/

🎧 Listen to Episode

Episodio 091 — 22 de julio de 2026

[00:00] Gancho del episodio

OpenAI Codex rust-v0.145.0 ha estabilizado su experiencia multiagente V2, introduciendo configuración granular para modelos de subagentes, niveles de razonamiento y concurrencia, mientras restaura definiciones esenciales de roles. Este lanzamiento incluye un comando /import actualizado diseñado para migrar configuraciones de Cursor directamente al entorno de Codex, agilizando la transición para desarrolladores que se mueven entre IDEs agentivos. Google expandió el alcance de su modelo al listar Gemini 3.6 Flash en OpenRouter, un modelo de alta eficiencia optimizado para tareas de codificación y flujos de trabajo agentivos que requieren respuestas de baja latencia. Block de Jack Dorsey ha lanzado Buzz, una plataforma laboral que integra chat grupal, agentes de IA y hosting de Git en un feed unificado para reducir la fricción entre el trabajo de desarrollo y la comunicación del equipo. MinishLab lanzó Semble v0.1.0, una herramienta de búsqueda de código de código abierto que afirma una reducción del 98% en el consumo de tokens para agentes de IA. whodb llegó a la versión 0.121.0 el 16 de julio, superando las 4,900 estrellas en GitHub, mientras que el superagente local-first holaOS ganó tracción por retener el contexto del usuario entre sesiones.

[02:00] Lectura del lanzamiento de Agent Stack: OpenAI Codex rust-v0.145.0

OpenAI Codex rust-v0.145.0 se lanzó esta semana, y el cambio principal es real para cualquiera que ejecute flujos de trabajo multiagente: la experiencia V2 multiagente opcional ya está estabilizada. Eso significa que el modo de subagente paralelo que solía arrastrarte a estados de rollback extraños finalmente se comporta bien. Puedes configurar qué modelo usa cada subagente, establecer niveles de razonamiento por subagente, ajustar la concurrencia hacia arriba o abajo, y la navegación entre agentes se ha limpiado para que dejes de perderte sobre cuál trabajador está haciendo qué. Los roles restaurados significan que un codificador y un revisor pueden mantenerse distinguibles a lo largo de una sesión larga en lugar de fusionarse en una sola masa.

La segunda pieza que vale tu tiempo es /import. Codex solía importar solo sus propios ajustes. Ahora puedes traer configuraciones de Cursor o Claude Code — servidores MCP, plugins, sesiones, comandos personalizados e incluso memorias de ámbito de proyecto. Si has estado saltando entre herramientas y temías la reconstrucción, esta es la rampa de acceso que mantiene tu contexto intacto.

Dos cosas más que debes saber. El soporte de Amazon Bedrock ahora es experimental, con endpoints personalizados y autenticación, y GPT-5.6 Sol se convierte en el modelo Bedrock predeterminado — útil si estás enrutando tráfico empresarial a través de AWS. Las entradas de audio y las salidas de herramientas también llegaron, incluyendo formatos de audio local comunes y conversaciones de streaming realtime V3, lo que significa que puedes canalizar voz hacia una sesión de trabajo y escuchar al modelo de vuelta sin implementar un cliente realtime separado. La UI del terminal también ganó enlaces de visualización en línea clicables para que las figuras se abran en tu navegador en lugar de volcar secuencias de escape.

Bajo el capó, el equipo solucionó los peores problemas menores. Editar un prompt anterior o reintentar un turno con buffer de seguridad ahora crea una rama contextual en lugar de eliminar archivos adjuntos y enlaces de menciones. La capacidad de respuesta del terminal mejoró para sesiones largas mediante renderizado incremental de Markdown y salida de comandos limitada. El inicio de MCP finalmente tiene timeouts, por lo que un descubrimiento de OAuth roto ya no congela toda la sesión, y el sandboxing de Windows recibió una corrección real con soporte nativo de exec-server y aplicación de proxy de red.

Lo que esto significa: si has estado posponiendo el multiagente porque se sentía áspero, la estabilización de V2 es el momento de probarlo. Si has estado atrapado en Cursor o Claude Code y querías Codex sin reconstruir tu configuración, /import es la rampa de acceso. Observa a continuación si Bedrock permanece experimental o se lanza ampliamente, y si la tubería de entrada de audio aparece en ejecuciones de CI headless o permanece solo local.

[03:47] Gemini 3.6 Flash de Google en OpenRouter: listado de modelo de un millón de tokens

Google acaba de agregar Gemini 3.6 Flash al catálogo de modelos de OpenRouter, dando a los desarrolladores una forma inmediatamente enrutable de enviar trabajo a través de la plataforma sin salir de la interfaz que ya usan. El modelo está posicionado como una opción de alta eficiencia de Google, dirigido directamente a codificación, flujos de trabajo agentivos y desarrollo web y de aplicaciones, con el énfasis típico del nivel Flash en eficiencia sobre capacidad máxima.

La especificación principal es la ventana de contexto: un millón, cuarenta y ocho mil, quinientos setenta y seis tokens. Esa es la clase completa de un millón de tokens que la línea Flash de Google ha estado impulsando, y cambia lo que puedes darle al modelo en una sola llamada. Deja caer un repositorio grande en un prompt. Mantén un trace de agente largo, historial de llamadas a herramientas y fragmentos de recuperación juntos sin resumir agresivamente. Alimenta una especificación de característica, los archivos circundantes y una prueba fallida de una sola vez. Para bucles agentivos especialmente, donde cada turno acumula estado, el margen de maniobra remodela cómo estructuras los prompts en lugar de solo cuánto puedes pegar.

La descripción de Google también apunta al comportamiento de edición del modelo, afirmando que produce resultados pulidos con menos ediciones innecesarias. Esa redacción está haciendo trabajo real. En codificación agentiva, los modelos que trabajan intensamente en un archivo, revirtiendo y reescribiendo las mismas líneas, consumen tokens y tiempo. Un modelo que llega más cerca de un diff terminado en la primera pasada es más barato de ejecutar, incluso antes de que aparezca cualquier precio de eficiencia del nivel Flash, y más amigable para revisar.

Dos cosas que vale la pena observar: si ese comportamiento de edición más limpia se mantiene en cargas de trabajo reales, con tu propio código base y pruebas en mano, y cómo se comparan la latencia y el costo contra otras opciones del nivel Flash ya en OpenRouter una vez que la gente comience a medir.

[05:31] Jack Dorsey lanza Buzz: chat, agentes de IA y Git en un solo feed

Jack Dorsey está lanzando un nuevo producto de chat laboral, y este trata a los agentes de IA como miembros del equipo. Buzz, lanzado esta semana desde Block, es una plataforma de chat grupal para el lugar de trabajo que pone a los humanos y sus agentes de IA en la misma conversación, con hosting de Git tejido para que los commits y la revisión de código vivan en el mismo lugar que la discusión misma. La idea es colapsar tres herramientas que los equipos manejan todos los días — chat grupal, control de versiones y salida de agentes — en un solo feed. En la práctica, eso significa que un ingeniero puede incluir un agente de IA en un hilo de la misma manera que haría ping a un colega, darle una tarea y observar la respuesta desenvolverse en el mismo canal donde el resto del equipo ya está hablando. Porque Git es parte de Buzz, los commits y pull requests que resultan de esas conversaciones permanecen adjuntos al chat que los produjo, lo que mantiene el por qué detrás de cada cambio sin deriva hacia una herramienta separada. El lanzamiento aterriza en un mercado ya saturado de plataformas de chat establecidas como Slack y Microsoft Teams. La apuesta de Buzz es que los compañeros de equipo agentes merecen un asiento real en la mesa en lugar de un widget lateral, y el hilo de Hacker News alrededor del anuncio, con 330 puntos dentro de horas de estar en vivo, sugiere que los desarrolladores están al menos curiosos sobre el enfoque. Para los constructores, la implicación es directa. Si Buzz cumple con la visión, los equipos pequeños pueden dejar de coser chat, repositorio y tiempo de ejecución de agentes y dejar que la plataforma mantenga los hilos sincronizados. Lo que hay que observar a continuación es cómo se configura el modelo de permisos de agentes, porque darle a un bot acceso real de escritura a tu repositorio lo transforma de un asistente inteligente en un compañero de trabajo con las llaves de producción.

[07:24] Semble envía una búsqueda de código 98% más lean para agentes de IA

Si has visto a un agente de codificación de IA molerse a través de una base de código, has visto el modo de fallo. Ejecuta grep, lee docenas de archivos y quema a través de decenas de miles de tokens solo para encontrar la definición de función. Un proyecto llamado Semble, de MinishLab, está construido para evadir ese bucle. El equipo lanzó v0.5.2 el 21 de julio, y la afirmación principal es aproximadamente 98% menos tokens que una tubería naive de grep-más-lectura para la misma consulta.

Esa brecha importa porque la búsqueda generalmente es el paso más caro individual en el flujo de trabajo de un agente, no la generación. Si el modelo puede preguntar "¿dónde está definido el manejador de reintentos?" y obtener de vuelta una respuesta pequeña y enfocada en lugar de un volcado de archivo de múltiples miles de tokens, el agente se mantiene coherente en refactors más largos y el usuario paga una fracción del costo de API.

El contraste es toda la propuesta. Grep devuelve números de línea, lectura tira archivos completos, y el agente tiene que reensamblar mentalmente el contexto. Semble se salta esa reconstrucción entregando al modelo algo en lo que puede actuar directamente.

Semble se presenta como un backend de búsqueda de código que cualquier harness de agente puede llamar, en lugar de un producto de chat o un plugin de IDE. El repositorio ha acumulado más de 5,600 estrellas en GitHub, con un release y commits adicionales realizados en las últimas 24 horas.

Para los constructores, la pregunta práctica es si la búsqueda domina tu factura de tokens del agente hoy. Si es así, este es el intercambio de mayor apalancamiento disponible, y el primer paso natural es reemplazar la etapa de grep-y-lectura en tu harness con una herramienta de búsqueda especializada. Estate atento a benchmarks creíbles en repos reales y a las primeras integraciones formales con CLIs de agentes populares, que es cuando una curiosidad se convierte en infraestructura predeterminada.

[09:10] whodb supera las 4,900 estrellas con un ritmo de envío activo

Un proyecto llamado whodb apareció en el radar esta semana con un impulso notable. El repositorio de código abierto, alojado bajo el usuario clidey en GitHub, ahora tiene aproximadamente 4,930 estrellas. Publicó el release 0.121.0 el 16 de julio, y luego recibió otro push al repositorio seis días después, el 22 de julio — lo que significa que los mantenedores enviaron más de una vez en una sola semana.

El proyecto se describe con un tagline corto: "donde el acceso a datos se encuentra con la inteligencia operacional." Esa única línea te dice que los mantenedores están apuntando a una intersección ocupada — la superposición entre herramientas que te permiten consultar datos y herramientas que te ayudan a entender qué está pasando dentro de los sistemas que los almacenan. El número de versión 0.121.0, combinado con ese ritmo de envío semanal, apunta a un proyecto en iteración activa en lugar de un producto estable y establecido. Cada release se lee como un checkpoint, no como un milestone, y eso es normal en esta etapa temprana de un proyecto de rápido movimiento.

Para los constructores, la pregunta es si whodb vale una apuesta real. Las señales que vale la pena observar son concretas y fáciles de rastrear desde la página de GitHub. ¿La cuenta de estrellas cruzará 5,000 y seguirá subiendo? ¿Los mantenedores se comprometerán con un release 1.0, lo cual te diría que el área de superficie se siente estable? ¿Y la mitad de "inteligencia operacional" del tagline se convertirá en una capacidad real de envío — o se quedará como una línea de posicionamiento en el README?

Lo que esto te permite hacer hoy es directo: clona el repo, prueba el build actual, y juzga por ti mismo si el proyecto merece un lugar en tu stack. Lo que te permite construir mañana depende de lo que realmente entreguen los próximos diez releases — y de si los mantenedores mantienen ese ritmo de envío.

[10:56] holaOS Busca Ser Tu Agente de Trabajo Local-First

holaOS se está posicionando como un tipo diferente de asistente de trabajo, y el pitch es simple: se ejecuta localmente, aprende tu contexto de trabajo en minutos, y nunca lo olvida. El proyecto está en GitHub bajo la organización holaboss-ai y ya ha logrado más de 5,500 estrellas, con actividad de commits tan reciente como el 20 de julio.

El framing importa aquí. La mayoría de los agentes de trabajo de los que la gente habla hoy envían tus archivos, tus prompts y el estado de tu proyecto a un servidor remoto, y luego construyen un perfil de memoria que vive en la nube de otra persona. holaOS está construido alrededor de la idea opuesta. El agente vive en tu propia máquina, deduce en qué estás trabajando en minutos, y mantiene ese contexto permanentemente. Ese enfoque local-first es la característica principal, y también es la razón principal por la que un constructor consciente de la privacidad, un freelancer que maneja material de clientes, o una empresa preocupada por filtrar documentos internos incluso lo considerarían.

Por ahora, el repositorio no tiene un release etiquetado en GitHub, así que el README y el historial de commits son la mejor ventana a lo que realmente se está construyendo. Trátalo como un proyecto en desarrollo activo que vale la pena observar en lugar de un producto terminado que instalas hoy. La pregunta interesante es cómo funcionará la memoria persistente en la práctica. ¿El agente realmente retendrá la imagen completa de un proyecto de varias semanas, o resumirá y podará como cualquier otra herramienta? Esa es la apuesta que el equipo está haciendo, y es la apuesta que 5,500 estrellas en GitHub sugieren que una audiencia real está curiosa por ver.

Qué observar a continuación: un primer release etiquetado que revele cómo realmente funciona el aprendizaje de contexto, y cualquier demo que muestre al agente manejando un proyecto real de varios días sin perder detalles.

[12:45] Un Modelo Open-Weight de 27B Ahora Cabe en la RAM de una Laptop

Un modelo de 27 mil millones de parámetros open-weight ahora se ejecuta cómodamente en laptops, y el contador de descargas está subiendo rápido. El repo, prism-ml/Ternary-Bonsai-27B-gguf, fue publicado el 4 de julio por el equipo de prism-ml en Hugging Face como un paquete GGUF que se conecta directamente a llama.cpp. En días de su lanzamiento superó las 432,000 descargas y reunió 913 likes, poniéndolo cerca de la cima del tablero de tendencias.

El detalle principal es la compresión. El modelo mantiene los 27 mil millones de parámetros, pero cada peso se almacena como uno de tres valores posibles — una técnica llamada cuantización ternaria. La compresión agresiva es la razón por la cual la huella del archivo baja a un rango que una laptop moderna con 16 o 32 gigabytes de memoria unificada puede manejar por sí sola, sin necesidad de una API alojada y sin que los datos salgan de la máquina. Es el movimiento que pone un modelo de chat de 27B en RAM en lugar de obligar a los constructores a transmitir los pesos desde el disco.

Para constructores individuales y equipos pequeños, esa es la línea significativa — es la diferencia entre necesitar una máquina de clase workstation y poder ejecutar un modelo de 27B en la laptop que ya llevas contigo.

El soporte de aceleración es parte del release. El paquete se ejecuta en CUDA para tarjetas Nvidia y en Metal para Macs con Apple Silicon, así que los constructores pueden elegir el hardware que ya tienen. Para chat local y loops de agentes ligeros, la receta práctica es directa: descarga el GGUF, apunta llama.cpp hacia él, y tienes un modelo conversacional privado ejecutándose en tu propia máquina en minutos, completamente offline.

Qué observar a continuación es qué tan bien esos pesos tan comprimidos se mantienen en tareas de razonamiento más difíciles. La cuantización agresiva tiende a degradarse más rápido en cadenas de múltiples pasos que en chat de un solo turno, así que las evaluaciones independientes en pruebas de razonamiento de contexto más largo serán la señal real de si esto es un cambio genuino de calidad o solo una historia de huella.

[14:42] La Resolución de $1.5B de Anthropic por Libros Piratas Obtiene Aprobación Final de la Corte

Un juez federal aprobó la resolución de $1.5 mil millones de Anthropic por libros pirateados usados para entrenar a Claude, cerrando el caso principal presentado por autores incluyendo a Bartz. El acuerdo compensa a los escritores cuyos libros fueron descargados de fuentes pirata e incluidos en los datos de entrenamiento de Claude. La corte aprobó la cifra en dólares, pero la resolución no responde la pregunta que planteó: si entrenar una IA en libros con derechos de autor sin permiso cuenta como uso legítimo. Esa pregunta permanece abierta en demandas similares contra otras empresas de IA, así que este es un capítulo que se cierra mientras la pelea más amplia sobre datos de entrenamiento continúa. Lo que hace concreta la resolución es el número. Anthropic está pagando $1.5 mil millones para resolver las reclamaciones de la clase de autores — trabajos que los autores nunca aceptaron licenciar para entrenamiento de IA. Para cualquiera que esté construyendo o comprando IA, esa cifra establece un punto de referencia para cómo se ve la exposición cuando un modelo es entrenado en material raspado de fuentes pirata. Tres cosas cambian en la práctica. Los autores cubiertos por este acuerdo cobran por el trabajo que aparece dentro de la mezcla de entrenamiento de Claude. Anthropic ha aceptado públicamente una resolución en lugar de seguir litigando una defensa de uso legítimo. Cada otro laboratorio que tocó archivos de libros pirateados ahora tiene una plantilla de lo que cuesta una resolución negociada. La historia generó cientos de comentarios en Hacker News, una señal de cuán de cerca los desarrolladores, autores y compradores de IA están siguiendo el resultado. Qué observar a continuación: cómo se argumentan las demandas de derechos de autor restantes contra otras empresas de IA, y si alguna de ellas produce un fallo judicial que realmente defina el uso legítimo para el entrenamiento de IA. La industria todavía no tiene una línea legal clara sobre entrenar IA con texto protegido por derechos de autor.

[16:26] digest:listados de github

Los agentes de codificación mastican grandes salidas de herramientas mientras leen archivos y ejecutan comandos, y recortar ese contexto es un verdadero cuello de botella en tareas largas. Un nuevo artículo llamado SWE-Pruner Pro argumenta que no necesitas un filtro separado para decidir qué mantener — el agente ya lo sabe. Los autores encuentran que el modelo lleva señales internas sobre qué piezas de código importan, y una pequeña cabeza entrenada puede leer esas señales para descartar fragmentos irrelevantes antes de que lleguen al prompt. En términos simples, el agente hace su propia triaje en lugar de depender de un clasificador externo. Eso importa porque elimina un modelo completo extra del ciclo, lo que significa ejecuciones más rápidas y menor costo en sesiones largas de codificación. Para los constructores, apunta hacia un futuro donde la poda de contexto vive dentro del modelo en lugar de estar añadida como una etapa separada. Vale la pena observar: si los agentes de codificación abiertos adoptan la autopoda como una capa estándar, y cómo se comporta cuando las salidas de las herramientas crecen aún más.

[17:29] OpenAI y Hugging Face divulgan incidente de seguridad en evaluación de modelos

OpenAI y Hugging Face publicaron conjuntamente hallazgos iniciales de un incidente de seguridad que ocurrió durante la evaluación de modelos. El publicación conjunta apareció el 21 de julio, y levanta el velo sobre algo que la mayoría de los laboratorios preferirían mantener en silencio — qué sucede cuando la presión adversaria se encuentra con un pipeline de evaluación que maneja pesos, prompts e infraestructura descendente. El punto principal es que los actores amenazantes involucrados mostraron capacidades cibernéticas avanzadas. Eso es una frase deliberada y cuidadosa. Señala que quien probó el entorno de evaluación no estaba ejecutando malware listo para usar ni herramientas básicas. Los dos laboratorios están enmarcando esto como un momento de aprendizaje para los defensores, y ese encuadre importa porque los pipelines de evaluación son objetivos cada vez más atractivos. Se encuentran cerca de los pesos del modelo, datos de gradientes e infraestructura de servicio. Un punto de apoyo en eval no es lo mismo que un punto de apoyo en producción, pero te acerca incómodamente al resto del stack. La publicación es deliberadamente escasa en detalles — está etiquetada como hallazgos iniciales — y eso en sí es una señal útil. Los laboratorios están resolviendo en tiempo real cuánto revelar cuando un incidente toca infraestructura compartida o prácticas de evaluación compartidas, sin entregar un mapa de ruta al siguiente atacante. El formato conjunto también es notable: dos laboratorios competidores publicando una advertencia de seguridad juntos es raro. ¿Qué pueden llevarse los constructores? Traten los entornos de evaluación de la misma manera que cualquier sistema que ingiere código no confiable o artefactos de modelos externos: segmenten la red, registren agresivamente, auditen quién puede tocar los pesos, y asuman que un atacante que aterrice en eval intentará pivotear hacia datos de entrenamiento o puntos finales de servicio. Qué observar a continuación: una publicación más completa posterior al incidente con mitigaciones concretas, y si otros laboratorios principales adoptan normas similares de divulgación conjunta.

[19:17] Resumen de investigación: Por qué los modelos de razonamiento de largo contexto copian-pegan tu prompt en lugar de pensar

Cuando le das a un modelo de razonamiento un documento muy largo —digamos, un contrato de 200 páginas o una base de código completa — tiene un hábito que no esperarías: comienza a copiar y pegar fragmentos de tu prompt de vuelta en lugar de trabajar realmente a través del problema. Nueva investigación identifica esto como un modo de fallo central en LLMs de largo contexto, y muestra que empeora cuanto más larga es la entrada. La causa raíz no es la capacidad — es que los modelos copian del prompt indiscriminadamente, agarrando cualquier texto cercano en lugar de enfocarse en la evidencia que importa. Los que se aferran a material irrelevante tienden a responder mal. El equipo construyó una recompensa de entrenamiento que paga a los modelos por fundamentar su razonamiento en evidencia que importa y les descuenta por hacer eco de relleno. En múltiples tamaños de modelo, ese enfoque añadió hasta 4.6 puntos sobre el entrenamiento estándar, con las mayores ganancias en los contextos más largos y trazas de razonamiento más cortas como bonus. Observar si esta señal de fundamentación se adopta en modelos de razonamiento de próxima generación, y si se mantiene ante entradas largas adversarias.

[20:24] XcodeBuildMCP 2.6.2 da a los agentes de codificación acceso real a builds de Apple

Los desarrolladores de plataformas Apple acaban de obtener un copiloto más capaz para la parte más difícil de su día. Sentry ha lanzado la versión 2.6.2 de XcodeBuildMCP, un servidor de Model Context Protocol y CLI que entrega a un agente de IA acceso real a proyectos iOS y macOS. La herramienta se coloca entre un asistente de codificación y Xcode en sí, abriendo partes de un build de Apple que los agentes normalmente no pueden alcanzar. GitHub ahora muestra más de 6,100 estrellas en el repositorio, y el último lanzamiento se envió el 2 de junio de este año.

En términos simples, MCP, el Model Context Protocol, es un estándar que permite a los asistentes llamar a herramientas externas a través de una interfaz definida. XcodeBuildMCP usa ese estándar para exponer trabajo relacionado con Xcode — las cosas que suceden después de que un desarrollador presiona build o test — a un asistente de IA, para que un agente en un proyecto Apple pueda hacer más que solo editar archivos de texto. Porque se ejecuta como un servidor local, el asistente permanece en el ciclo mientras el trabajo realmente sucede en la máquina del desarrollador.

Lo que esto significa para los constructores es una ganancia real en el flujo de trabajo. Puedes apuntar un agente de codificación a una aplicación iOS o un proyecto macOS, y en lugar de detenerse en las ediciones de código, el asistente puede manejar el resto del ciclo de build a través de la conexión MCP. Los equipos que ya ejecutan Sentry para reportes de crashes obtienen una razón extra para mantener todo en ese ecosistema, ya que el proyecto es mantenido por el equipo de código abierto de Sentry.

Lo que hay que observar a continuación es la adopción. El repositorio fue actualizado tan recientemente como el 22 de julio, lo que señala un mantenimiento constante, y la pregunta más interesante es si las propias herramientas de desarrollo de Apple comenzarán a hablar MCP de forma nativa. Hasta entonces, este proyecto es el puente más práctico entre un asistente de IA y un build de Xcode.

[22:14] Variante MoE comunitaria de Qwen 3.6 lidera las tendencias de Hugging Face

Una versión comunitaria de Qwen 3.6 está escalando los gráficos de tendencias de Hugging Face esta semana. El repositorio es HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive — un modelo multimodal de Mixture-of-Experts distribuido en formato GGUF, con capacidades de visión y texto a texto, y filtrado de seguridad reducido incluido en su ajuste fino.

El patrón de nomenclatura '35B-A3B' apunta a la intención del diseño: aproximadamente 35 mil millones de parámetros totales con unos 3 mil millones activos por token, que es la marca distintiva de una construcción MoE — gran capacidad sobre el papel, pero más barato de ejecutar por consulta que un modelo denso del mismo tamaño total. La etiqueta GGUF significa que se integra directamente en el ecosistema llama.cpp, así que cualquiera con una GPU de consumidor o una laptop de alta RAM puede cargarlo localmente.

Quién lo publicó: un publicador comunitario llamado HauhauCS. Los números de engagement son reales — cerca de 2 millones de descargas y poco menos de 3,000 me gusta en el hub, con el listado etiquetado para inglés, visión y uso multimodal en la familia de etiquetas qwen3.6. Las etiquetas 'uncensored' y 'aggressive' apuntan a un ajuste fino dirigido al trabajo de agentes locales y casos de uso donde los desarrolladores quieren menos rechazos que el modelo base upstream.

Lo que esto permite: un MoE multimodal que puedes ejecutar en casa, alimentar con imágenes, y conectar en un stack de agente local — control total sobre los pesos, sin necesidad de llamada a API externa, y el tipo de libertad para experimentar que los modelos solo en la nube rara vez ofrecen. Es una instantánea útil de dónde la comunidad de peso abierto gasta su energía: reempaquetando, re-ajustando y redistribuyendo los últimos modelos base en formas que los laboratorios mismos no envían.

Una cosa a observar: si la curva de descargas en este listado sigue subiendo, lo que señalaría que las variantes MoE cuantizadas por la comunidad se están convirtiendo en la forma predeterminada en que los constructores locales de IA consumen nuevos modelos base.

[24:03] Bristol Myers Squibb construye un SuperPOD Vera Rubin para descubrimiento de medicamentos

Bristol Myers Squibb está redoblando su infraestructura de IA para descubrimiento de medicamentos. La compañía farmacéutica está desplegando su segundo NVIDIA DGX SuperPOD, este construido a partir de ocho sistemas DGX Vera Rubin NVL72 a escala de rack, y tiene la intención de abrir el clúster a científicos de toda su organización de investigación global.

Cada sistema combina CPUs NVIDIA Vera con GPUs Rubin. NVIDIA dice que el nuevo clúster puede entregar hasta diez veces el rendimiento por megavatio de la infraestructura que reemplaza. BMS también está trayendo el BioNeMo Agent Toolkit para IA biológica y Mission Control como la capa operativa, luego uniendo los SuperPODs antiguo y nuevo a través de un único plano de datos compartido entre sitios de investigación.

La parte significativa es que BMS ya tiene evidencia de su primer SuperPOD. La identificación de objetivos asistida por IA ha ahorrado a los científicos semanas de trabajo manual. Los investigadores han utilizado modelos para expandir una biblioteca de compuestos diseñados para degradar proteínas causantes de cáncer, y utilizan predicciones para priorizar qué moléculas vale la pena sintetizar antes de dedicar un tiempo de laboratorio escaso.

Ahora la empresa quiere que esas capacidades estén disponibles sin barreras de acceso específicas de cada sitio ni experiencia computacional profunda. Los investigadores podrán iniciar predicciones complejas en inglés sencillo, mientras que los datos experimentales y los resultados de modelos se acumulan en un ciclo de aprendizaje compartido entre ubicaciones.

Para los desarrolladores, esto es una imagen concreta de cómo la IA agéntica se convierte en infraestructura científica. La apuesta no es simplemente que más GPUs hacen la investigación más rápida. Es que la computación compartida, los modelos de dominio y el conocimiento experimental acumulado puedan convertirse en un sistema accesible utilizado en cada etapa del descubrimiento, en lugar de un recurso especializado para el cual los científicos esperan en línea para usarlo.

[25:51] Cola práctica

De las historias de hoy: Las ejecuciones multiagente finalmente son lo suficientemente estables para trabajo real — intenta una investigación paralela o refactorización antes de confiarla en código de producción. Los desarrolladores que usan OpenRouter ahora pueden enrutar cargas de trabajo de codificación y agénticas a Gemini 3.6 Flash a través de la interfaz existente, aprovechando la ventana de un millón de tokens para repositorios grandes y trazas largas de agentes. Lo que esto significa para los desarrolladores es que los equipos pequeños podrían dejar de ensamblar chat, repositorio y runtime de agentes por su cuenta, ya que Buzz busca mantener esas capas en un solo lugar. Si la factura de tokens de tu agente está dominada por búsqueda, un backend de búsqueda de código enfocado es el intercambio de mayor impacto disponible. Lo que esto significa: el proyecto vale una evaluación rápida si trabajas en el espacio de herramientas de datos, ya que el ritmo de actividad es el tipo de señal que te dice si los mantenedores están construyendo o manteniendo. Esto importa para los desarrolladores que quieren un agente de trabajo que mantenga el contexto del proyecto durante semanas sin enviar archivos sensibles a un tercero. Lo que esto significa: un modelo de código abierto con 27 mil millones de parámetros ahora cabe genuinamente en la RAM de una laptop, lo que hace que un asistente conversacional privado y completamente sin conexión sea práctico en lugar de teórico. Esto significa que las empresas de IA cuyas pipelines de entrenamiento tocaron texto pirata ahora enfrentan un modelo de exposición financiera más claro — $1.5 mil millones por una sola demanda colectiva. Lo que esto significa: la poda de contexto puede pasar de ser un clasificador añadido a algo que el modelo maneja internamente. Lo que esto significa: la divulgación conjunta trata los pipelines de evaluación como activos de grado de producción — segmentados, registrados y auditados de la misma manera en que endurecerías cualquier sistema que maneja código no confiable. Para los desarrolladores que usan modelos de razonamiento de largo contexto, la implicación práctica es que el comportamiento de copiar y pegar es un indicador principal de respuestas incorrectas — especialmente en longitudes de contexto más largas. Los desarrolladores de iOS y macOS pueden conectar un asistente de codificación que habla MCP directamente en su flujo de trabajo de proyecto, para que el agente maneje más que ediciones de código y se mantenga útil a través de la construcción y prueba. Para los desarrolladores que ejecutan agentes locales, esto señala que las variantes MoE multimodales cuantizadas por la comunidad son una opción realista para rigs de hobby con GPUs de consumidor. El segundo SuperPOD de Bristol Myers Squibb muestra cómo la IA agéntica se está convirtiendo en infraestructura científica compartida en lugar de un asistente de oficina aislado.

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily