El Pulso del 24 de febrero de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Claude Sonnet 4.6 (1M de contexto en beta) + un salto grande en “computer use”
POR QUÉ ENTRA EN EL RADARPrecios de clase Sonnet con comportamientos cercanos a Opus cambian la economía del “modelo por defecto” para agentes. El post también pone el progreso en computer use (OSWorld / OSWorld-Verified) y la mitigación de prompt injection como prioridades de primer orden.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La verdadera mejora no son 1M de tokens: es computer use confiable + resistencia a inyecciones. Esto es lo que conviene probar esta semana.”
Gemini 3.1 Pro: salto en razonamiento (citan score de ARC-AGI-2) + despliegue en todos lados
POR QUÉ ENTRA EN EL RADARGoogle está vendiendo explícitamente el “razonamiento central” como el producto, y lo ata a flujos agénticos (API, Vertex, Gemini app, NotebookLM). El blog también insinúa un pipeline preview → GA que los creators pueden adelantar con pruebas estilo benchmark.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“3 stress-tests rápidos que muestran el delta de razonamiento frente a tu modelo de uso diario (sin cherry-picks).”
Benchmark “Car Wash Test”: 53 modelos, la consistencia le gana a los aciertos de una sola vez
POR QUÉ ENTRA EN EL RADAREl benchmark es trivial pero revelador: muchos modelos dan un razonamiento coherente para el objetivo equivocado (heurística de distancia). El encuadre de consistencia en 10 corridas es una plantilla práctica de evaluación para agentes en producción.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejá de preguntar ‘¿lo acertó una vez?’ Empezá a preguntar ‘¿lo acierta 10/10?’ — un harness de eval de 5 minutos que cualquiera puede correr.”
“Foundation Tool” de Wolfram para LLMs: MCP Service + CAG (generation aumentada por cómputo)
POR QUÉ ENTRA EN EL RADAREs un empaquetado concreto de “LLM + tool” en puntos de integración estándar (no solo un plugin). MCP + “Agent One API” es un blueprint de cómo se van a commoditizar los ecosistemas de tools.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“RAG no alcanza: CAG = ‘retrieval’ infinito vía cómputo. Dónde le gana a la búsqueda y por qué cambia la confiabilidad de los agentes.”
Steerling-8B: modelo interpretable que puede trazar tokens a conceptos + datos de entrenamiento
POR QUÉ ENTRA EN EL RADAREs un intento serio de interpretabilidad inherente: atribución a nivel de token hacia tokens del prompt, pathways de conceptos y fuentes de datos de entrenamiento—más steering de conceptos en inference-time sin reentrenar.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Si esto funciona, el ‘alignment por fine-tune’ empieza a verse viejo. Demo: concept steering como perilla de safety/control.”
Claude Code → Figma: capturar UI de production/localhost en frames editables de Figma (“roundtripping”)
POR QUÉ ENTRA EN EL RADAREsto es infraestructura de workflow, no un modelo. Baja la fricción entre generación de código agéntica y la revisión de diseño del equipo, y se apoya en MCP como puente de vuelta al código.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La pieza que faltaba en ‘la IA te arma la app’ es la colaboración. Esto hace que el prototipado code-first sea legible para el equipo.”
Escribir código ahora es barato (hábitos de ingeniería agéntica)
POR QUÉ ENTRA EN EL RADARArticulación clara del verdadero cuello de botella: no producir código, sino producir buen código (tests, docs, manejo de errores, no-funcionales). Es un gran encuadre para gestionar “agentes en paralelo” sin generar un desastre.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Nueva regla: promptealo igual (async). Pero también: shippeá solo lo que puedas verificar. Un checklist simple para código de agentes.”
Creator-watch (NUEVO): YC sobre “The AI Agent Economy Is Here” + hooks upstream
POR QUÉ ENTRA EN EL RADAREl chatter de creators es la señal downstream; la jugada upstream es minar los primitivos: infra de agentes, evaluación, protocolos de tools y confiabilidad de “computer use”.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La economía de agentes es real—pero está cuello de botellada por: evals, confiabilidad de tools e inyecciones. Acá van los 3 primitivos en los que apostar.”