El Pulso del 20 de febrero de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Gemini 3.1 Pro: razonamiento central mejorado (despliegue en preview)
POR QUÉ ENTRA EN EL RADARGoogle enmarca de forma explícita a “3.1 Pro” como la nueva línea de base para razonamiento complejo y flujos agénticos, y lo está desplegando en API, Vertex, la app y NotebookLM. Citan un salto grande en ARC-AGI-2 (77,1% verificado) y lo posicionan como la “inteligencia central” detrás de Deep Think.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El salto en el benchmark es el titular — pero la historia de distribución pesa más: dónde Google está metiendo este modelo (CLI, Studio, Antigravity) muestra su apuesta por flujos de desarrollo agénticos.”
Claude Opus 4.6 (contexto de 1M en beta + nuevos controles de agente/producto)
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Opus 4.6 suma contexto de 1M (en beta) y Anthropic empuja agent teams, compaction, adaptive thinking y effort controls como primitivas de producto — no solo como claims del modelo. Eso condiciona cómo se construyen los “agentes de horizonte largo” (memoria/compaction + orquestación de tools).
WebMCP (navigator.modelContext): una “tools API” a nivel de browser para agentes
POR QUÉ ENTRA EN EL RADARSi este estándar aterriza, es el endgame de la automatización de UI tipo “el agente hace click en botones”. Los sitios pueden exponer tools con schema directo al agente: más barato en tokens y mucho más confiable que visión + scraping del DOM. También cambia la superficie competitiva del “AI browser” (features de Chrome/Edge, modelo de seguridad, consentimiento, auditoría).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“WebMCP es, en la práctica, ‘MCP, pero para el runtime web’. Por qué eso importa más que otro framework de agentes — y por qué los equipos de producto deberían prestar atención ya.”
Paper CDLM: Consistency Diffusion Language Models (sampling más rápido + KV caching)
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Los Diffusion LMs vuelven una y otra vez porque pueden paralelizar, pero vienen lentos (muchos steps) y no pueden hacer KV-cache como los AR LMs. CDLM afirma latencia 3,6×–14,5× menor manteniendo calidad en math/coding mediante (1) consistency training para finalización multi-token y (2) máscara causal block-wise para compatibilidad con KV cache.
Fast KV Compaction vía Attention Matching (comprimir contexto sin summarization lossy)
POR QUÉ ENTRA EN EL RADARTodos están chocando contra el techo del KV cache con contexto largo. Este paper propone compaction de KV en espacio latente, mucho más rápida que enfoques previos estilo “Cartridges”, y habla de “50× de compaction en segundos” con poca pérdida de calidad (según el abstract). Si se confirma, habilita de forma directa agentes de contexto largo más baratos y apps densas en retrieval.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La summarization es el instrumento contundente. La KV compaction es el abordaje quirúrgico — y podría cambiar la economía de las sesiones largas.”
Claude Code suma ergonomía agéntica práctica (worktrees + background agents)
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗Unas release notes chicas pueden ser la señal más temprana de cómo se van a usar de verdad, día a día, los “AI coding agents”. El aislamiento por worktree y los background agents hacen más seguras y más paralelizables las tareas largas: o sea, más cerca del workflow real de un junior engineer.
YC creator-watch: “Inside Claude Code With Its Creator Boris Cherny”
POR QUÉ ENTRA EN EL RADARAbrir fuente original ↗El creator-watch solo importa si vamos upstream: este episodio apunta a primitivas concretas (subagents, terminal UX, verbosity, teams) que después aparecen como cambios de producto en otro lado. También sirve como referencia de “cómo se hace la salchicha” para explicar decisiones de coding agéntico a una audiencia de desarrollo.
Claim de hardware de inferencia ultra-rápida: Llama 3.1 8B hard-wired a ~17K tok/s/user
POR QUÉ ENTRA EN EL RADAREsto está upstream del discurso habitual de creadores sobre “Groq/Cerebras”: Taalas afirma una arquitectura nueva que fusiona storage + compute on-chip, con la mira en cambios de orden de magnitud en latencia y costo. Aunque la primera generación venga agresivamente cuantizada, la tesis de producto es: AI ubicua = inferencia sub-milisegundo + especialización de hardware barata.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El próximo ‘breakthrough del modelo’ podría ser un breakthrough de sistemas: cuando la inferencia se vuelve instantánea, ¿qué apps se vuelven posibles (agentes, copilots en tiempo real, embodied)?”