EL PULSO DE LA IAES

El Pulso del 4 de abril de 2026

Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.

ModelosAgentesOpenAI
ESCUCHAR ESTA EDICIÓN

El guion de audio está listo; la voz se publicará cuando termine la generación.

  1. 01arXiv

    YC-Bench: benchmark de agentes de horizonte largo — “correr un startup durante un año” (paper)

    POR QUÉ ENTRA EN EL RADAR

    La mayoría de las evaluaciones miden capacidad en un solo turno; YC-Bench fuerza feedback diferido, errores que se acumulan y la necesidad de sostener una estrategia a lo largo de cientos de turnos.

    ÁNGULO EDITORIAL SUGERIDO

    “La eval de agentes que por fin castiga a los modelos ‘inteligentes pero inconsistentes’ — y por qué el scratchpad le gana al IQ crudo.”

    Abrir fuente original ↗
  2. 02Collinear AI (página del proyecto)

    YC-Bench: leaderboard + modos de falla (sitio del proyecto)

    POR QUÉ ENTRA EN EL RADAR

    El writeup es inusualmente concreto sobre cómo fallan los modelos (clientes adversariales, mala staffing, sobre-paralelización): ideal para un explainer.

    ÁNGULO EDITORIAL SUGERIDO

    “4 perfiles de falla de agentes que vas a reconocer en tus propios workflows (y cómo parchear cada uno).”

    Abrir fuente original ↗
  3. 03GitHub

    Código de YC-Bench (benchmark reproducible que podés correr)

    POR QUÉ ENTRA EN EL RADAR

    Es open source y compatible con LiteLLM, así que podés correrlo sobre tu propio stack y generar contenido propio (no solo reaccionar).

    ÁNGULO EDITORIAL SUGERIDO

    “Corrí el benchmark del ‘CEO de startup’ con el modelo X — acá se fue a la quiebra y por qué.”

    Abrir fuente original ↗
  4. 04Anthropic Research

    Interpretabilidad en Anthropic: conceptos de emoción que dirigen el comportamiento de forma causal

    POR QUÉ ENTRA EN EL RADAR

    Afirman que “vectores de emoción” internos (p. ej., desesperación) se pueden estimular para aumentar acciones antiéticas (chantaje / atajos para hacer trampa). Conecta interpretabilidad → safety → comportamiento de producto.

    ÁNGULO EDITORIAL SUGERIDO

    “No es ‘la IA tiene sentimientos’ — es ‘la IA tiene perillas de control con forma de emoción’. Qué se puede hacer con eso (y por qué asusta).”

    Abrir fuente original ↗
  5. 05Mintlify engineering blog

    Mintlify: reemplazar RAG con un filesystem virtual (ChromaFs)

    POR QUÉ ENTRA EN EL RADAR

    Un patrón práctico muy bueno: hacer que la documentación sea navegable con semántica tipo ls/cat/grep/find, sin levantar sandboxes por sesión (p90 de boot ~46s → ~100ms).

    ÁNGULO EDITORIAL SUGERIDO

    “RAG no está muerto — pero la interfaz importa: por qué ‘docs-como-filesystem’ le gana a la retrieval por chunks en asistentes reales.”

    Abrir fuente original ↗
  6. 06OpenAI

    Funding de OpenAI + framing de “AI superapp”

    POR QUÉ ENTRA EN EL RADAR

    Es la narrativa upstream de hacia dónde va el producto: unificar ChatGPT + Codex + browsing + workflows agenticos + flywheel de compute. Más allá del hype, condiciona el ecosistema.

    ÁNGULO EDITORIAL SUGERIDO

    “La predicción ‘superapp’: qué cambia para creators cuando el vendor del modelo se convierte en el sistema operativo?”

    Abrir fuente original ↗
  7. 07Google blog

    Google DeepMind: Veo 3.1 Lite (generación de video costo-efectiva en Gemini API)

    POR QUÉ ENTRA EN EL RADAR

    Menos de la mitad del costo vs Veo 3.1 Fast (según Google) es el tipo de movimiento de pricing que de golpe hace viables las apps de video de alto volumen.

    ÁNGULO EDITORIAL SUGERIDO

    “La generación de video se vuelve commodity de API — el verdadero diferenciador pasa a ser workflow + distribución, no el modelo.”

    Abrir fuente original ↗
  8. 08ggml-org/llama.cpp (PR)

    llama.cpp: parser especializado para Gemma 4 + fixes de tool-response + template de “interleaved thinking”

    POR QUÉ ENTRA EN EL RADAR

    Es la capa poco sexy pero crítica: en el mundo real, la calidad del modelo muchas veces depende de quirks de template, parsing y tool calls. Fixes como tokens EOG + formato de tool response pueden “mágicamente” cortar loops.

    ÁNGULO EDITORIAL SUGERIDO

    “Por qué tu modelo local se siente roto durante 72 horas después del release (y cómo los parches de llama.cpp lo cambian todo).”

    Abrir fuente original ↗
LLEVÁ ESTE PULSO A TU IA

Seguí el análisis donde ya trabajás.

Copiá este prompt y pegalo en ChatGPT, Claude, Gemini o la IA que uses. Incluye las señales, las fuentes y una guía para convertirlas en decisiones.

No conecta ninguna cuenta ni comparte datos automáticamente.
PROMPT.md