EL PULSO DE LA IAES

El Pulso del 24 de febrero de 2026

Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.

AgentesModelosAnthropic
ESCUCHAR ESTA EDICIÓN

El guion de audio está listo; la voz se publicará cuando termine la generación.

  1. 01Anthropic News (primaria)

    Claude Sonnet 4.6 (1M de contexto en beta) + un salto grande en “computer use”

    POR QUÉ ENTRA EN EL RADAR

    Precios de clase Sonnet con comportamientos cercanos a Opus cambian la economía del “modelo por defecto” para agentes. El post también pone el progreso en computer use (OSWorld / OSWorld-Verified) y la mitigación de prompt injection como prioridades de primer orden.

    ÁNGULO EDITORIAL SUGERIDO

    “La verdadera mejora no son 1M de tokens: es computer use confiable + resistencia a inyecciones. Esto es lo que conviene probar esta semana.”

    Abrir fuente original ↗
  2. 02Google (Models & Research) (primaria)

    Gemini 3.1 Pro: salto en razonamiento (citan score de ARC-AGI-2) + despliegue en todos lados

    POR QUÉ ENTRA EN EL RADAR

    Google está vendiendo explícitamente el “razonamiento central” como el producto, y lo ata a flujos agénticos (API, Vertex, Gemini app, NotebookLM). El blog también insinúa un pipeline preview → GA que los creators pueden adelantar con pruebas estilo benchmark.

    ÁNGULO EDITORIAL SUGERIDO

    “3 stress-tests rápidos que muestran el delta de razonamiento frente a tu modelo de uso diario (sin cherry-picks).”

    Abrir fuente original ↗
  3. 03Opper blog (primaria)

    Benchmark “Car Wash Test”: 53 modelos, la consistencia le gana a los aciertos de una sola vez

    POR QUÉ ENTRA EN EL RADAR

    El benchmark es trivial pero revelador: muchos modelos dan un razonamiento coherente para el objetivo equivocado (heurística de distancia). El encuadre de consistencia en 10 corridas es una plantilla práctica de evaluación para agentes en producción.

    ÁNGULO EDITORIAL SUGERIDO

    “Dejá de preguntar ‘¿lo acertó una vez?’ Empezá a preguntar ‘¿lo acierta 10/10?’ — un harness de eval de 5 minutos que cualquiera puede correr.”

    Abrir fuente original ↗
  4. 04Stephen Wolfram (primaria)

    “Foundation Tool” de Wolfram para LLMs: MCP Service + CAG (generation aumentada por cómputo)

    POR QUÉ ENTRA EN EL RADAR

    Es un empaquetado concreto de “LLM + tool” en puntos de integración estándar (no solo un plugin). MCP + “Agent One API” es un blueprint de cómo se van a commoditizar los ecosistemas de tools.

    ÁNGULO EDITORIAL SUGERIDO

    “RAG no alcanza: CAG = ‘retrieval’ infinito vía cómputo. Dónde le gana a la búsqueda y por qué cambia la confiabilidad de los agentes.”

    Abrir fuente original ↗
  5. 05Guide Labs (primaria)

    Steerling-8B: modelo interpretable que puede trazar tokens a conceptos + datos de entrenamiento

    POR QUÉ ENTRA EN EL RADAR

    Es un intento serio de interpretabilidad inherente: atribución a nivel de token hacia tokens del prompt, pathways de conceptos y fuentes de datos de entrenamiento—más steering de conceptos en inference-time sin reentrenar.

    ÁNGULO EDITORIAL SUGERIDO

    “Si esto funciona, el ‘alignment por fine-tune’ empieza a verse viejo. Demo: concept steering como perilla de safety/control.”

    Abrir fuente original ↗
  6. 06Figma blog (primaria)

    Claude Code → Figma: capturar UI de production/localhost en frames editables de Figma (“roundtripping”)

    POR QUÉ ENTRA EN EL RADAR

    Esto es infraestructura de workflow, no un modelo. Baja la fricción entre generación de código agéntica y la revisión de diseño del equipo, y se apoya en MCP como puente de vuelta al código.

    ÁNGULO EDITORIAL SUGERIDO

    “La pieza que faltaba en ‘la IA te arma la app’ es la colaboración. Esto hace que el prototipado code-first sea legible para el equipo.”

    Abrir fuente original ↗
  7. 07Simon Willison (primaria)

    Escribir código ahora es barato (hábitos de ingeniería agéntica)

    POR QUÉ ENTRA EN EL RADAR

    Articulación clara del verdadero cuello de botella: no producir código, sino producir buen código (tests, docs, manejo de errores, no-funcionales). Es un gran encuadre para gestionar “agentes en paralelo” sin generar un desastre.

    ÁNGULO EDITORIAL SUGERIDO

    “Nueva regla: promptealo igual (async). Pero también: shippeá solo lo que puedas verificar. Un checklist simple para código de agentes.”

    Abrir fuente original ↗
  8. 08Y Combinator (YouTube RSS)

    Creator-watch (NUEVO): YC sobre “The AI Agent Economy Is Here” + hooks upstream

    POR QUÉ ENTRA EN EL RADAR

    El chatter de creators es la señal downstream; la jugada upstream es minar los primitivos: infra de agentes, evaluación, protocolos de tools y confiabilidad de “computer use”.

    ÁNGULO EDITORIAL SUGERIDO

    “La economía de agentes es real—pero está cuello de botellada por: evals, confiabilidad de tools e inyecciones. Acá van los 3 primitivos en los que apostar.”

    Abrir fuente original ↗
LLEVÁ ESTE PULSO A TU IA

Seguí el análisis donde ya trabajás.

Copiá este prompt y pegalo en ChatGPT, Claude, Gemini o la IA que uses. Incluye las señales, las fuentes y una guía para convertirlas en decisiones.

No conecta ninguna cuenta ni comparte datos automáticamente.
PROMPT.md