El Pulso del 4 de agosto de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
DeepSeek-V4-Flash-0731: un modelo agente de menos parámetros activos que compite con sistemas de frontera
POR QUÉ ENTRA EN EL RADAREl lanzamiento oficial de DeepSeek afirma saltos grandes respecto de su preview en benchmarks de agentes y coding, e incorpora DSpark speculative decoding en el checkpoint. También expone niveles de esfuerzo de razonamiento low/high/max y recomienda hasta 384K tokens de salida para trabajo agéntico high/max.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La próxima carrera de modelos abiertos no es por cantidad de parámetros: es por throughput de agentes.” Explicar parámetros activos, speculative decoding y por qué un modelo que completa tareas más rápido puede vencer en la práctica a uno más grande.
Un DeepSeek V4 Flash de 304B corriendo en una sola AMD MI300X
POR QUÉ ENTRA EN EL RADARUna configuración de producción detallada reporta el checkpoint completo de 156,67 GiB en HBM, 168,6 tok/s de decode en single-stream y contexto validado de 256K en una sola MI300X—sin offload de pesos ni cuantización extra. La historia interesante es la ingeniería: compatibilidad de formato FP8, routing MoE, verificación especulativa y gestión de KV-cache.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Una GPU, un modelo de 304B: los trucos de infraestructura que no se ven.” Usar la matemática de HBM y distinguir “el modelo entra” de “sirve de forma confiable bajo concurrencia.”
La receta de producción de Cloudflare para inferencia open-model de contexto largo más barata
POR QUÉ ENTRA EN EL RADARCloudflare reporta que el KV cache en FP8 duplica el contexto residente de Kimi K2.6 de ~686K a ~1,37M tokens; pesos en INT4 bajan GLM 5.2 de 705GB a 421GB. El diseño clave es desagregar prefill y decode, manteniendo la configuración de mayor precisión donde gana.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué la cuantización ya no es un tradeoff calidad-versus-velocidad.” Mostrar el punto contraintuitivo: FP8 puede ser un poco más lento por request, pero materialmente mejor para el throughput de toda la flota.
Swiftlet: Qwen de 80B en una Mac con 4,3GB de RAM—y 35B en un iPhone
POR QUÉ ENTRA EN EL RADARSwiftlet streamea desde storage solo los experts MoE necesarios por token, en lugar de mantener todos los pesos en RAM. Reporta un modelo Qwen3-Next de 80B en 4 bits con 4,3GB de RAM pico (42GB en disco) y un modelo de 35B en iPhone a aproximadamente 1 tok/s. Su propio README da el caveat importante: solo ~3B parámetros están activos por token, así que el recall fáctico se parece al de un modelo más chico.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El titular del modelo de 80B en tu teléfono es cierto—pero acá está el catch.” Gran oportunidad para un explainer honesto sobre MoE, parámetros activos, RAM vs SSD y tradeoffs del mundo real.
La ingeniería del harness—no el IQ crudo del modelo—se está volviendo el campo de batalla de los agentes
POR QUÉ ENTRA EN EL RADAREl survey enmarca el performance de agentes como un problema de sistemas: workflows/evals, permisos, archivos como memoria persistente, subagentes explícitos, jobs de backend e ingeniería de contexto. Es un framing fuerte aguas arriba para explicar por qué los coding agents pueden sentirse radicalmente distintos aunque compartan modelos base similares.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejen de comparar agentes por el nombre del modelo.” Presentar un modelo simple: LLM + tools + memoria + workflow + evals, y después mostrar dónde un mal harness destruye un buen modelo.
Claude Code 2.1.221 agrega una vista Focus y endurece el manejo de credenciales en el sandbox
POR QUÉ ENTRA EN EL RADAREl último release agrega una vista Focus en VS Code que colapsa el ruido de tools en resúmenes por turno, más enmascaramiento de archivos de credenciales en Linux/WSL (con macOS cayendo a deny). También corrige un bypass del chequeo de permisos de Bash que involucraba conditionals de regex de zsh—un excelente recordatorio de que los permisos de agentes son arquitectura de seguridad, no polish de UI.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La feature más importante de tu coding agent no es la inteligencia: es la contención.” Recorrer por qué permisos, sandboxing y auditabilidad importan cuando los agentes pueden tocar credenciales y código.
OpenAI publica diez avances de matemática/CS generados por IA con formalizaciones en Lean
POR QUÉ ENTRA EN EL RADAROpenAI dice que un modelo interno Astra encontró resultados en sphere packing, coding theory, group theory, cryptography y combinatorics; el repositorio aporta formalizaciones en Lean 4 para cada uno. La distinción importante: la verificación formal chequea un teorema o artefacto de prueba declarado—no resuelve por sí sola todas las preguntas de novedad, interpretación o del proceso de investigación.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La IA dice que resolvió diez problemas de matemática. ¿Qué significa en realidad ‘probado’?” Explicar la diferencia entre descubrimiento, revisión humana y certificados de prueba chequeables por máquina.
Qwen3.8-Max señala otro empujón open-weight de frontera—pero tratar los claims del release como provisorios hasta que aterricen pesos y docs oficiales
POR QUÉ ENTRA EN EL RADARReportes de la comunidad describen un Qwen3.8-Max de 2,4T de parámetros y dicen que los pesos abiertos son inminentes, con un sibling de 27B esperado. El anuncio primario del modelo y los pesos no fueron recuperables del blog principal de Qwen en esta corrida, así que no presentar claims de benchmarks o disponibilidad como hechos confirmados todavía.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El Qwen más grande hasta ahora puede estar por abrirse—esto es lo que hay que verificar el día del launch.” Armar un checklist friendly para creators: licencia, active params, contexto, receta de hardware, eval harness y pesos reales.
Matt Wolfe — “AI News: An INSANE Week… Here’s What Matters”
Abrir fuente original ↗AI Jason — “Loop engineer practice 1: Reddit loop grew 0 to 95 Karma in 7 days”
Abrir fuente original ↗AI Jason — “Tmux + Fable = Cut 35% less token”
Abrir fuente original ↗