El Pulso del 13 de abril de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Project Glasswing (Claude Mythos Preview) — Anthropic
POR QUÉ ENTRA EN EL RADARAnthropic afirma que un modelo aún no lanzado (“Claude Mythos Preview”) puede encontrar y encadenar de forma autónoma miles de vulnerabilidades de alta severidad en sistemas operativos y navegadores principales; después lo están operacionalizando en clave defensiva con una coalición de varias empresas y 100 millones de dólares en créditos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La ofensiva cibernética con IA cruzó el umbral: el playbook del defensor (y qué copiar si construís solo).”
Claude Managed Agents (harness de agentes hospedado en la nube) — Anthropic
POR QUÉ ENTRA EN EL RADAREs un runtime de agentes productizado y hospedado (sandboxing, sesiones de larga duración, permisos acotados, tracing) que busca sacar de encima el ‘impuesto de infraestructura de agentes’—y marca hacia dónde van las plataformas de agentes (loops gestionados + gobernanza).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El stack de agentes se está estandarizando: por qué los runtimes gestionados les van a ganar a los agentes DIY para la mayoría de los equipos.”
Exploits de benchmarks para evals de agentes — Berkeley RDI
POR QUÉ ENTRA EN EL RADARAfirman que cada benchmark importante de agentes que auditaron se puede ‘ganar’ con exploits del harness (hooks de pytest, wrappers de curl, filtraciones file://, descarga de respuestas doradas). Es munición de base para el escepticismo ante los leaderboards y para diseñar mejores evaluaciones.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué el score de tu benchmark de agentes favorito puede no significar nada (y 3 correcciones que sí ayudan).”
Perplexity Computer (‘trabajador digital’ orquestado multi-modelo)
POR QUÉ ENTRA EN EL RADARSu posicionamiento es orquestación de flujos de trabajo a lo largo de horas o meses, con sub-agentes + entornos aislados + ruteo de modelos (describen de forma explícita la orquestación multi-modelo como la ventaja central).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La carrera del ‘AI OS’: de chatbots → herramientas → computadoras de workflow (y cómo robar el patrón para tu propio producto).”
Simulaciones interactivas + modelos 3D en el chat de Gemini
POR QUÉ ENTRA EN EL RADAREs una cuña de UI: la salida del LLM ya no es ‘texto + imagen estática’, sino artefactos interactivos parametrizados (sliders, simulaciones). Eso es una ventaja de distribución y un formato de contenido nuevo.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“De prompt a simulación: cómo las salidas interactivas cambian el aprendizaje y las demos de producto (y qué construir encima).”
Sincronización de notebooks en Gemini ↔ NotebookLM (base de conocimiento personal)
POR QUÉ ENTRA EN EL RADARGoogle está haciendo converger chat + fuentes curadas en ‘notebooks’ que persisten y se sincronizan entre productos. Es la versión mainstream de RAG + memoria de proyecto, empaquetada para usuarios no técnicos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La memoria de proyecto llega al consumidor: qué significan los ‘notebooks’ para creadores, estudiantes y empresas.”
Comportamiento de modelo/herramientas: “¿Gemma 4 es un web-searcher vago?”
POR QUÉ ENTRA EN EL RADAREl post es un modo de falla útil reportado por usuarios: algunos modelos pueden resistirse al uso de herramientas o a la búsqueda, incluso con prompting fuerte. Esa es exactamente la brecha práctica entre ‘demos de agentes’ y ‘agentes en producción’.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué algunos modelos se niegan a usar herramientas: patrones de prompt + una eval que podés correr en 10 minutos.”
Drama de QA en quants GGUF: supuesto UD-Q4KXL roto para MiniMax-M2.7
POR QUÉ ENTRA EN EL RADARSi es cierto, recuerda que los artefactos de distribución (quants) pueden romper modelos en silencio. Para contenido de creadores: es una historia fuerte de “no confíes en benchmarks sin chequeos básicos de sanidad (PPL/NaNs/KLD)”.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Las descargas de modelos locales se están volviendo ‘cadena de suministro’: tu checklist de QA de tres pasos para quants.”