EL PULSO DE LA IAES

El Pulso del 4 de agosto de 2026

Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.

ModelosAgentesOpenAI
ESCUCHAR ESTA EDICIÓN
El Pulso del 4 de agosto de 2026
Ahora en el PulsoTesis editorial de esta edición
Pulso RegusciLabs
El próximo Pulso, directo a vos.
  1. 01Ficha del modelo DeepSeek (primaria) — https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    DeepSeek-V4-Flash-0731: un modelo agente de menos parámetros activos que compite con sistemas de frontera

    POR QUÉ ENTRA EN EL RADAR

    El lanzamiento oficial de DeepSeek afirma saltos grandes respecto de su preview en benchmarks de agentes y coding, e incorpora DSpark speculative decoding en el checkpoint. También expone niveles de esfuerzo de razonamiento low/high/max y recomienda hasta 384K tokens de salida para trabajo agéntico high/max.

    ÁNGULO EDITORIAL SUGERIDO

    “La próxima carrera de modelos abiertos no es por cantidad de parámetros: es por throughput de agentes.” Explicar parámetros activos, speculative decoding y por qué un modelo que completa tareas más rápido puede vencer en la práctica a uno más grande.

    Abrir fuente original ↗
  2. 02Repo de despliegue reproducible — https://github.com/ryanzhou/deepseek-v4-flash-mi300x

    Un DeepSeek V4 Flash de 304B corriendo en una sola AMD MI300X

    POR QUÉ ENTRA EN EL RADAR

    Una configuración de producción detallada reporta el checkpoint completo de 156,67 GiB en HBM, 168,6 tok/s de decode en single-stream y contexto validado de 256K en una sola MI300X—sin offload de pesos ni cuantización extra. La historia interesante es la ingeniería: compatibilidad de formato FP8, routing MoE, verificación especulativa y gestión de KV-cache.

    ÁNGULO EDITORIAL SUGERIDO

    “Una GPU, un modelo de 304B: los trucos de infraestructura que no se ven.” Usar la matemática de HBM y distinguir “el modelo entra” de “sirve de forma confiable bajo concurrencia.”

    Abrir fuente original ↗
  3. 03Ingeniería de Cloudflare — https://blog.cloudflare.com/smaller-faster-safer-models/

    La receta de producción de Cloudflare para inferencia open-model de contexto largo más barata

    POR QUÉ ENTRA EN EL RADAR

    Cloudflare reporta que el KV cache en FP8 duplica el contexto residente de Kimi K2.6 de ~686K a ~1,37M tokens; pesos en INT4 bajan GLM 5.2 de 705GB a 421GB. El diseño clave es desagregar prefill y decode, manteniendo la configuración de mayor precisión donde gana.

    ÁNGULO EDITORIAL SUGERIDO

    “Por qué la cuantización ya no es un tradeoff calidad-versus-velocidad.” Mostrar el punto contraintuitivo: FP8 puede ser un poco más lento por request, pero materialmente mejor para el throughput de toda la flota.

    Abrir fuente original ↗
  4. 04Repositorio Swiftlet — https://github.com/leonickson1/Swiftlet

    Swiftlet: Qwen de 80B en una Mac con 4,3GB de RAM—y 35B en un iPhone

    POR QUÉ ENTRA EN EL RADAR

    Swiftlet streamea desde storage solo los experts MoE necesarios por token, en lugar de mantener todos los pesos en RAM. Reporta un modelo Qwen3-Next de 80B en 4 bits con 4,3GB de RAM pico (42GB en disco) y un modelo de 35B en iPhone a aproximadamente 1 tok/s. Su propio README da el caveat importante: solo ~3B parámetros están activos por token, así que el recall fáctico se parece al de un modelo más chico.

    ÁNGULO EDITORIAL SUGERIDO

    “El titular del modelo de 80B en tu teléfono es cierto—pero acá está el catch.” Gran oportunidad para un explainer honesto sobre MoE, parámetros activos, RAM vs SSD y tradeoffs del mundo real.

    Abrir fuente original ↗
  5. 05Survey técnico de Lilian Weng — https://lilianweng.github.io/posts/2026-07-04-harness/

    La ingeniería del harness—no el IQ crudo del modelo—se está volviendo el campo de batalla de los agentes

    POR QUÉ ENTRA EN EL RADAR

    El survey enmarca el performance de agentes como un problema de sistemas: workflows/evals, permisos, archivos como memoria persistente, subagentes explícitos, jobs de backend e ingeniería de contexto. Es un framing fuerte aguas arriba para explicar por qué los coding agents pueden sentirse radicalmente distintos aunque compartan modelos base similares.

    ÁNGULO EDITORIAL SUGERIDO

    “Dejen de comparar agentes por el nombre del modelo.” Presentar un modelo simple: LLM + tools + memoria + workflow + evals, y después mostrar dónde un mal harness destruye un buen modelo.

    Abrir fuente original ↗
  6. 06Changelog de Claude Code (primaria) — https://raw.githubusercontent.com/anthropics/claude-code/main/CHANGELOG.md

    Claude Code 2.1.221 agrega una vista Focus y endurece el manejo de credenciales en el sandbox

    POR QUÉ ENTRA EN EL RADAR

    El último release agrega una vista Focus en VS Code que colapsa el ruido de tools en resúmenes por turno, más enmascaramiento de archivos de credenciales en Linux/WSL (con macOS cayendo a deny). También corrige un bypass del chequeo de permisos de Bash que involucraba conditionals de regex de zsh—un excelente recordatorio de que los permisos de agentes son arquitectura de seguridad, no polish de UI.

    ÁNGULO EDITORIAL SUGERIDO

    “La feature más importante de tu coding agent no es la inteligencia: es la contención.” Recorrer por qué permisos, sandboxing y auditabilidad importan cuando los agentes pueden tocar credenciales y código.

    Abrir fuente original ↗
  7. 07Anuncio de OpenAI — https://openai.com/index/ten-advances-in-mathematics/

    OpenAI publica diez avances de matemática/CS generados por IA con formalizaciones en Lean

    POR QUÉ ENTRA EN EL RADAR

    OpenAI dice que un modelo interno Astra encontró resultados en sphere packing, coding theory, group theory, cryptography y combinatorics; el repositorio aporta formalizaciones en Lean 4 para cada uno. La distinción importante: la verificación formal chequea un teorema o artefacto de prueba declarado—no resuelve por sí sola todas las preguntas de novedad, interpretación o del proceso de investigación.

    ÁNGULO EDITORIAL SUGERIDO

    “La IA dice que resolvió diez problemas de matemática. ¿Qué significa en realidad ‘probado’?” Explicar la diferencia entre descubrimiento, revisión humana y certificados de prueba chequeables por máquina.

    Abrir fuente original ↗
  8. 08Hilo de discovery en r/LocalLLaMA — https://www.reddit.com/r/LocalLLaMA/comments/1vellf2/qwen38maxmatcheskimik3anddeepseekv4flash/

    Qwen3.8-Max señala otro empujón open-weight de frontera—pero tratar los claims del release como provisorios hasta que aterricen pesos y docs oficiales

    POR QUÉ ENTRA EN EL RADAR

    Reportes de la comunidad describen un Qwen3.8-Max de 2,4T de parámetros y dicen que los pesos abiertos son inminentes, con un sibling de 27B esperado. El anuncio primario del modelo y los pesos no fueron recuperables del blog principal de Qwen en esta corrida, así que no presentar claims de benchmarks o disponibilidad como hechos confirmados todavía.

    ÁNGULO EDITORIAL SUGERIDO

    “El Qwen más grande hasta ahora puede estar por abrirse—esto es lo que hay que verificar el día del launch.” Armar un checklist friendly para creators: licencia, active params, contexto, receta de hardware, eval harness y pesos reales.

    Abrir fuente original ↗
  9. 09Fuente original

    Matt Wolfe — “AI News: An INSANE Week… Here’s What Matters”

    Abrir fuente original ↗
  10. 10Fuente original

    AI Jason — “Loop engineer practice 1: Reddit loop grew 0 to 95 Karma in 7 days”

    Abrir fuente original ↗
  11. 11Fuente original

    AI Jason — “Tmux + Fable = Cut 35% less token”

    Abrir fuente original ↗
LLEVÁ ESTE PULSO A TU IA

Seguí el análisis donde ya trabajás.

Copiá este prompt y pegalo en ChatGPT, Claude, Gemini o la IA que uses. Incluye las señales, las fuentes y una guía para convertirlas en decisiones.

No conecta ninguna cuenta ni comparte datos automáticamente.
PROMPT.md