El Pulso del 29 de marzo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Lanza ARC-AGI-3 (benchmark interactivo de inteligencia agéntica)
POR QUÉ ENTRA EN EL RADAREs un cambio de paradigma en evaluación: de “responder preguntas” a “explorar entornos desconocidos, inferir objetivos, construir modelos del mundo y planificar”. Humanos al 100%; la IA de frontera reportada en menos del 1% (0,26% en la página de ARC Prize).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los LLM no fallan en ‘razonar’: fallan en descubrir objetivos y explorar. ARC-AGI-3 lo vuelve medible de forma incómoda.”
Anthropic: campañas masivas de destilación de Claude (DeepSeek / Moonshot / MiniMax)
POR QUÉ ENTRA EN EL RADARNúmeros y tácticas concretas (24 mil cuentas fraudulentas, 16 millones de intercambios) y un reclamo claro: la destilación a escala puede eludir la intención de controles de seguridad y de exportación, copiando capacidades más rápido y más barato.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La destilación es normal en ML, pero ahora es una primitiva de espionaje industrial. Así intentan extraer cadena de pensamiento y comportamientos de uso de herramientas.”
Claude “Dispatch + Computer Use” (handoff teléfono → escritorio; Claude controla mouse y teclado)
POR QUÉ ENTRA EN EL RADAREs la próxima cuña de UX para agentes: el modelo no necesita una integración API perfecta; si puede usar tus apps como un humano, la superficie de producto se expande de golpe (con nuevos problemas de seguridad).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes con computer use son la nueva ‘automatización de navegador’, pero con un modelo en el loop: ¿qué es realmente útil y qué es cebo de demo?”
Claude Code: “Auto mode” (clasificador de permisos en lugar de --dangerously-skip-permissions)
POR QUÉ ENTRA EN EL RADAREs un cambio silencioso pero enorme para flujos reales de agentes: menos interrupciones humanas, manteniendo una capa de seguridad que bloquea acciones destructivas.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El verdadero foso de los agentes de código no es el IQ del modelo: es la gobernanza en runtime —permisos, sandboxes y clasificadores de acción.”
OpenAI lanza GPT‑5.4 mini + nano (modelos chicos afinados para alto volumen y subagentes)
POR QUÉ ENTRA EN EL RADARRefuerza la tendencia de ‘diseño de sistemas’: el modelo grande planifica y los más chicos ejecutan en paralelo. También llama la atención que OpenAI posicione explícitamente a mini como fuerte en uso de herramientas y en “sistemas que usan la computadora”.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejá de comparar modelos sueltos. Empezá a comparar stacks: modelo planificador + enjambre de subagentes mini/nano.”
OpenAI lanza un Safety Bug Bounty (abuso + inyección de prompts agéntica / riesgos MCP)
POR QUÉ ENTRA EN EL RADAREs una señal upstream de que la “inyección de prompts agéntica + exfiltración de datos” ya es una categoría de primer orden (mencionan explícitamente productos agénticos y riesgos relacionados con MCP).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Entramamos en la era en que la inyección de prompts se trata como una clase de vulnerabilidad: ¿qué cuenta como un ‘hijack’ de agente reproducible?”
Incidente de supply chain en LiteLLM (releases maliciosos en PyPI 1.82.7 / 1.82.8)
POR QUÉ ENTRA EN EL RADAREs un compromiso de la ‘capa de tooling’ de IA: las librerías de gateway y orquestación viven en máquinas de desarrollo, CI y producción. El incidente muestra cuán frágil es el ecosistema de agentes frente a ataques por dependencias.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Tu stack de agentes de IA ya forma parte del perímetro de seguridad. El modo de falla: dependencia transitiva → secretos de CI → compromiso en la nube.”
TurboQuant (cuantización vectorial con rotaciones aleatorias) + adaptación de la comunidad para cuantizar pesos
POR QUÉ ENTRA EN EL RADARLa cuantización vuelve a ser algorítmica (no solo “probar GPTQ/AWQ”). La intuición de la rotación aleatoria es fácil de explicar, y el repo OSS muestra compresión casi sin pérdida al estilo “4+4 residual”.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La intuición de 60 segundos de TurboQuant (y por qué ‘coordenadas polares’ es la explicación equivocada). Después: ¿qué cambia si cuantizás pesos versus el KV-cache?”
BDH (Dragon Hatchling) write-back de fast-weights: primera implementación open source que funciona
POR QUÉ ENTRA EN EL RADAREs un ejemplo raro de “el modelo reescribe sus propios pesos durante la inferencia” implementado y depurado en abierto, incluyendo experimentos de consolidación.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“RAG vs fine-tuning vs fast weights: tres caminos de memoria —y por qué los fast weights son atractivos (y peligrosos) para sistemas agénticos.”
LawBreaker: benchmark adversario de física calificado con matemática simbólica (anti-sicofancia / anti-anclaje)
POR QUÉ ENTRA EN EL RADARUn patrón práctico de evaluación: generar variantes adversarias infinitas y calificar con matemática simbólica (sin juez LLM). Es un blueprint para ‘endurecer’ evals en otros dominios.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los benchmarks se están gameando; el grading simbólico es una salida. Construí un ‘LawBreaker’ para tu nicho.”