EL PULSO DE LA IAES

El Pulso del 2 de agosto de 2026

Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.

ModelosAgentesHardware
ESCUCHAR ESTA EDICIÓN
El Pulso del 2 de agosto de 2026
Ahora en el PulsoTesis editorial de esta edición
Pulso RegusciLabs
El próximo Pulso, directo a vos.
  1. 01Google DeepMind — anuncio

    Gemini Robotics 2: control de cuerpo completo, razonamiento corporeizado y adaptación en el dispositivo

    POR QUÉ ENTRA EN EL RADAR

    Google está dividiendo el stack robótico en un controlador VLA, un planificador de razonamiento corporeizado y un modelo on-device. Afirma que se pueden adaptar cuerpos de robots nuevos en pocas horas con menos de 200 ejemplos, mientras ER 2 maneja tareas multi-minuto y multi-paso, y coordinación multi-robot.

    ÁNGULO EDITORIAL SUGERIDO

    «Los robots con IA acaban de sumar cerebro, cuerpo y modo offline: por qué ese stack de tres capas es lo importante.» Mostrar planificador → modelo de movimiento → hardware como visual.

    Abrir fuente original ↗
  2. 02Anthropic — anuncio de Opus 5 · changelog de Claude Code (raw)

    Claude Opus 5 es ahora el modelo Opus por defecto en Claude Code — con contexto de 1M y un nuevo modo rápido

    POR QUÉ ENTRA EN EL RADAR

    Anthropic posiciona Opus 5 como capacidad casi Fable a la mitad del precio; el release de Claude Code lo hace el modelo Opus por defecto, expone una ventana de contexto de 1M de tokens y lista USD 10 / USD 50 por millón de tokens de entrada/salida para el modo rápido. La historia no es tanto «nuevo ganador de benchmarks» como «el trabajo con agentes de larga duración se está volviendo el flujo por defecto del desarrollador».

    ÁNGULO EDITORIAL SUGERIDO

    «El verdadero upgrade de Opus 5 no es el CI. Es que los agentes de código pueden sostener un proyecto entero en contexto — ¿pero deberían?»

    Abrir fuente original ↗
  3. 03Google DeepMind — página del modelo

    Gemini 3.6 Flash: la eficiencia se vuelve un atributo competitivo

    POR QUÉ ENTRA EN EL RADAR

    Google dice que 3.6 Flash usa un 17% menos de tokens de salida que 3.5 Flash, y lista una ventana de entrada de 1M de tokens, 64k de salida, tool use y computer use. Su tabla publicada enmarca el modelo como un trabajador de agentes práctico, no como un modelo «lite» barato.

    ÁNGULO EDITORIAL SUGERIDO

    «La próxima carrera de IA no es solo de modelos más inteligentes; es de modelos que terminan el mismo trabajo con menos tokens.» Explicar por qué la eficiencia en tokens de salida afecta de forma directa la latencia y el costo de los agentes.

    Abrir fuente original ↗
  4. 04ByteDance Seed — anuncio de Seedance 2.5

    Seedance 2.5 mueve el video con IA de clips hacia escenas editables

    POR QUÉ ENTRA EN EL RADAR

    Seedance 2.5 genera hasta 30 segundos de audio-video sincronizado por pasada, soporta extensiones multi-ronda y acepta hasta 30 imágenes, 10 clips de video y 10 de audio como referencias. La edición a nivel de timestamp y un control de referencias más fuerte son las afirmaciones relevantes para creadores — no solo generaciones más lindas.

    ÁNGULO EDITORIAL SUGERIDO

    «El video con IA se está volviendo un sistema de edición, no una tragamonedas de prompts.» Demo del workflow de producción: referencias → escena de una toma → edición puntual → extensión.

    Abrir fuente original ↗
  5. 05Wafer — write-up técnico

    Kimi K3 en AMD MI355X: la capacidad de memoria puede ganarle al default CUDA en inferencia MoE gigante

    POR QUÉ ENTRA EN EL RADAR

    Wafer reporta que Kimi K3 (2.8T parámetros) alcanza ~952 tok/s agregados por nodo MI355X y 118 tok/s en un solo stream. Su ventaja reclamada de performance por dólar frente a B300 se apoya en 288 GB de HBM por GPU y un menor costo de rental; también muestra cómo un fix chico de ROCm, más speculative decoding y un workaround en la forma del kernel de atención, cambiaron materialmente los resultados.

    ÁNGULO EDITORIAL SUGERIDO

    «El ganador de GPU para modelos abiertos gigantes puede no ser NVIDIA.» Arrancar con el caveat: son mediciones de un solo vendor; después explicar por qué la memoria y el prefill importan tanto como la velocidad de decode del titular.

    Abrir fuente original ↗
  6. 06FareedKhan-dev — kimi-k3-in-c

    Un modelo Kimi K3 de 2.78T corriendo en una sola CPU con 8.24 GB de RAM — técnicamente real, prácticamente lento

    POR QUÉ ENTRA EN EL RADAR

    Este proyecto en C99 streamea expertos ruteados directo desde un checkpoint de 1.56 TB, mantiene solo un working set en RAM y reporta salida byte-idéntica entre distintos presupuestos de memoria. El preset de 8 GB tarda aproximadamente 33 segundos por token: no es una receta de serving para consumidores, pero es una demostración inusualmente clara de cómo la arquitectura MoE cambia el problema de memoria.

    ÁNGULO EDITORIAL SUGERIDO

    «¿Una IA de 2,8 billones de parámetros en 8 GB de RAM? Sí — a una palabra cada medio minuto.» Explicar la diferencia entre caber, correr y ser usable.

    Abrir fuente original ↗
  7. 07NeelM0906 — repositorio Mference

    Mference lleva la inferencia MoE streameada desde SSD a Apple Silicon

    POR QUÉ ENTRA EN EL RADAR

    El runtime Swift/Metal mantiene el núcleo compartido y el cache residentes mientras streamea expertos seleccionados desde SSD. Reporta Gemma 4 26B a ~2 GB de memoria y Qwen 3.6 35B a ~1.45 GB, más un path experimental DeepSeek-V4-Flash. La señal práctica clave: las herramientas de inferencia local son cada vez más específicas de arquitectura, no wrappers genéricos.

    ÁNGULO EDITORIAL SUGERIDO

    «La RAM de tu Mac ya no es el límite total para IA local — pero la velocidad del SSD pasa a ser parte del modelo.» Hacer tangible el trade-off: RAM, footprint en disco, tokens por segundo.

    Abrir fuente original ↗
  8. 08AI Builder Club — skill Open Agent Teams

    Open Agent Teams: un protocolo chico para flujos multi-agente de código confiables

    POR QUÉ ENTRA EN EL RADAR

    El skill upstream propone ejecutores tmux detached, un archivo de resultado y un sentinel de done basado en archivos, en lugar de señales frágiles de terminal. Esta es la capa operativa poco glamurosa que convierte «muchos agentes» de un demo en algo observable y recuperable.

    ÁNGULO EDITORIAL SUGERIDO

    «Los flujos multi-agente no fallan porque los agentes sean tontos; fallan porque la orquestación es desprolija.» Mostrar el patrón confiable más simple: coordinador, worker aislado, artefacto, señal de completitud.

    Abrir fuente original ↗
LLEVÁ ESTE PULSO A TU IA

Seguí el análisis donde ya trabajás.

Copiá este prompt y pegalo en ChatGPT, Claude, Gemini o la IA que uses. Incluye las señales, las fuentes y una guía para convertirlas en decisiones.

No conecta ninguna cuenta ni comparte datos automáticamente.
PROMPT.md