El Pulso del 2 de agosto de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
Gemini Robotics 2: control de cuerpo completo, razonamiento corporeizado y adaptación en el dispositivo
POR QUÉ ENTRA EN EL RADARGoogle está dividiendo el stack robótico en un controlador VLA, un planificador de razonamiento corporeizado y un modelo on-device. Afirma que se pueden adaptar cuerpos de robots nuevos en pocas horas con menos de 200 ejemplos, mientras ER 2 maneja tareas multi-minuto y multi-paso, y coordinación multi-robot.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Los robots con IA acaban de sumar cerebro, cuerpo y modo offline: por qué ese stack de tres capas es lo importante.» Mostrar planificador → modelo de movimiento → hardware como visual.
Claude Opus 5 es ahora el modelo Opus por defecto en Claude Code — con contexto de 1M y un nuevo modo rápido
POR QUÉ ENTRA EN EL RADARAnthropic posiciona Opus 5 como capacidad casi Fable a la mitad del precio; el release de Claude Code lo hace el modelo Opus por defecto, expone una ventana de contexto de 1M de tokens y lista USD 10 / USD 50 por millón de tokens de entrada/salida para el modo rápido. La historia no es tanto «nuevo ganador de benchmarks» como «el trabajo con agentes de larga duración se está volviendo el flujo por defecto del desarrollador».
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El verdadero upgrade de Opus 5 no es el CI. Es que los agentes de código pueden sostener un proyecto entero en contexto — ¿pero deberían?»
Gemini 3.6 Flash: la eficiencia se vuelve un atributo competitivo
POR QUÉ ENTRA EN EL RADARGoogle dice que 3.6 Flash usa un 17% menos de tokens de salida que 3.5 Flash, y lista una ventana de entrada de 1M de tokens, 64k de salida, tool use y computer use. Su tabla publicada enmarca el modelo como un trabajador de agentes práctico, no como un modelo «lite» barato.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«La próxima carrera de IA no es solo de modelos más inteligentes; es de modelos que terminan el mismo trabajo con menos tokens.» Explicar por qué la eficiencia en tokens de salida afecta de forma directa la latencia y el costo de los agentes.
Seedance 2.5 mueve el video con IA de clips hacia escenas editables
POR QUÉ ENTRA EN EL RADARSeedance 2.5 genera hasta 30 segundos de audio-video sincronizado por pasada, soporta extensiones multi-ronda y acepta hasta 30 imágenes, 10 clips de video y 10 de audio como referencias. La edición a nivel de timestamp y un control de referencias más fuerte son las afirmaciones relevantes para creadores — no solo generaciones más lindas.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El video con IA se está volviendo un sistema de edición, no una tragamonedas de prompts.» Demo del workflow de producción: referencias → escena de una toma → edición puntual → extensión.
Kimi K3 en AMD MI355X: la capacidad de memoria puede ganarle al default CUDA en inferencia MoE gigante
POR QUÉ ENTRA EN EL RADARWafer reporta que Kimi K3 (2.8T parámetros) alcanza ~952 tok/s agregados por nodo MI355X y 118 tok/s en un solo stream. Su ventaja reclamada de performance por dólar frente a B300 se apoya en 288 GB de HBM por GPU y un menor costo de rental; también muestra cómo un fix chico de ROCm, más speculative decoding y un workaround en la forma del kernel de atención, cambiaron materialmente los resultados.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El ganador de GPU para modelos abiertos gigantes puede no ser NVIDIA.» Arrancar con el caveat: son mediciones de un solo vendor; después explicar por qué la memoria y el prefill importan tanto como la velocidad de decode del titular.
Un modelo Kimi K3 de 2.78T corriendo en una sola CPU con 8.24 GB de RAM — técnicamente real, prácticamente lento
POR QUÉ ENTRA EN EL RADAREste proyecto en C99 streamea expertos ruteados directo desde un checkpoint de 1.56 TB, mantiene solo un working set en RAM y reporta salida byte-idéntica entre distintos presupuestos de memoria. El preset de 8 GB tarda aproximadamente 33 segundos por token: no es una receta de serving para consumidores, pero es una demostración inusualmente clara de cómo la arquitectura MoE cambia el problema de memoria.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«¿Una IA de 2,8 billones de parámetros en 8 GB de RAM? Sí — a una palabra cada medio minuto.» Explicar la diferencia entre caber, correr y ser usable.
Mference lleva la inferencia MoE streameada desde SSD a Apple Silicon
POR QUÉ ENTRA EN EL RADAREl runtime Swift/Metal mantiene el núcleo compartido y el cache residentes mientras streamea expertos seleccionados desde SSD. Reporta Gemma 4 26B a ~2 GB de memoria y Qwen 3.6 35B a ~1.45 GB, más un path experimental DeepSeek-V4-Flash. La señal práctica clave: las herramientas de inferencia local son cada vez más específicas de arquitectura, no wrappers genéricos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«La RAM de tu Mac ya no es el límite total para IA local — pero la velocidad del SSD pasa a ser parte del modelo.» Hacer tangible el trade-off: RAM, footprint en disco, tokens por segundo.
Open Agent Teams: un protocolo chico para flujos multi-agente de código confiables
POR QUÉ ENTRA EN EL RADAREl skill upstream propone ejecutores tmux detached, un archivo de resultado y un sentinel de done basado en archivos, en lugar de señales frágiles de terminal. Esta es la capa operativa poco glamurosa que convierte «muchos agentes» de un demo en algo observable y recuperable.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Los flujos multi-agente no fallan porque los agentes sean tontos; fallan porque la orquestación es desprolija.» Mostrar el patrón confiable más simple: coordinador, worker aislado, artefacto, señal de completitud.