El Pulso del 17 de mayo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Modelos de interacción (colaboración humano–IA en tiempo real, micro-turnos y multi-stream)
POR QUÉ ENTRA EN EL RADAREs una propuesta arquitectónica concreta para modelos de “colaboración en tiempo real” (percepción y salida simultáneas), en lugar de sumar interactividad con arneses externos (VAD, turn-taking, etc.). Además, enmarca la interactividad como un eje de escala junto a la inteligencia.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El próximo salto de los LLM no es más contexto: es el tiempo (micro-turnos, interrupción, solapamiento). Qué cambia cuando los modelos se entrenan nativamente para interactuar.”
Codex “desde cualquier lugar” (dirección desde el móvil + conexiones remotas + hooks)
POR QUÉ ENTRA EN EL RADARLa dirección de producto es “agentes que corren largo” más check-ins humanos como UX central. El detalle que importa son las primitivas de flujo: conexiones remotas, aprobaciones y hooks empresariales (validadores, escaneo de secretos, logging, memorias).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La historia real no es ‘Codex en el teléfono’: es el modelo operativo emergente del agente —aprobaciones, hooks y sesiones remotas como el nuevo CI/CD.”
$δ$-mem: memoria online eficiente para LLMs (estado con regla delta + correcciones de atención de bajo rango)
POR QUÉ ENTRA EN EL RADARUn camino intermedio limpio entre ‘simplemente agrandar el contexto’ y ‘fine-tuning completo’: mantener el backbone congelado y sumar un estado diminuto de memoria asociativa online (por ejemplo, 8×8) que escribe de forma continua y modula la atención. Es exactamente el tipo de mecanismo que quienes construyen agentes deberían seguir en los próximos modelos “nativos de memoria”.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Se le puede dar memoria a un LLM con una matriz 8×8: acá está el truco, y lo que implica para asistentes que aprenden con el tiempo.”
llama.cpp: pruebas de soporte MTP (multi-token prediction) en Qwen3.6 + RTX 5090
POR QUÉ ENTRA EN EL RADARLa velocidad de inferencia local sigue siendo el mayor cuello de botella para asistentes “siempre activos”. MTP puede cambiar de forma dramática la latencia percibida (sobre todo en salidas cortas), y los benchmarks de la comunidad muestran dónde ayuda y qué flags importan.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El camino más rápido a un mejor ‘feel’ de asistente puede ser MTP + buen decoding, no modelos nuevos. Qué activar en llama.cpp y qué esperar.”
NVIDIA SANA-WM (modelado de mundos a escala de minutos; claim de video 720p)
POR QUÉ ENTRA EN EL RADARLos world models y la generación a horizonte más largo se están acercando desde la investigación a claims “casi productizables” (escala de minutos, 720p). Aunque la página no traiga todos los detalles, es una miga fuerte de upstream para seguir: papers, código y la próxima ola de tooling de video.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los world models se están comiendo en silencio a la generación de video: qué podría habilitar el ‘modelado de mundos a escala de minutos’ (escenas consistentes, cámara controlable, acciones largas).”
Nueva experiencia de finanzas personales en ChatGPT (vinculación de cuentas + memorias financieras)
POR QUÉ ENTRA EN EL RADAREs una plantilla de cómo van a llegar las features “agentic” al usuario común: conectar sistemas reales (Plaid), sumar memorias de dominio, endurecer guardrails y controles de borrado. También es una cuña de distribución para asistentes profundamente anclados en contexto.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Las finanzas son la primera categoría mainstream de ‘agente conectado’. Qué nos enseña sobre permisos de datos, memoria y UX de confianza.”
Anthropic Labs: Claude Design (trabajo visual: slides, prototipos, one-pagers)
POR QUÉ ENTRA EN EL RADARLos productos Labs son donde primero aparecen los patrones de interacción. “Design” es un buen proxy de hacia dónde va multimodal + uso de herramientas: outputs estructurados, loops de iteración y artefactos listos para publicar.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La IA pasa de ‘generar’ a ‘shippear’. Los flujos de diseño son el canario —porque la calidad del output se nota al instante.”
Zerostack: agente de coding inspirado en Unix, escrito en Rust
POR QUÉ ENTRA EN EL RADAREl ecosistema de agentes se fragmenta: más agentes local-first, compilados y con permisos estrictos, en lugar de un único asistente cloud monolítico. Los agentes en Rust resultan interesantes por sandboxing y distribución.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué los agentes de coding se están volviendo herramientas Unix: composables, locales, con permisos estrictos —y qué implica eso para los flujos de desarrollo.”