El Pulso del 11 de agosto de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Seedance 2.5: generación de audio y video de 30 segundos con edición guiada por referencias
POR QUÉ ENTRA EN EL RADARSeedance 2.5 pasa a generaciones de audio y video de 30 segundos, con extensión en varias rondas, y acepta hasta 30 imágenes, 10 videos y 10 clips de audio como referencia. Su edición a nivel de timestamp acerca la unidad útil a una escena, más que a un plano descartable.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El video con IA ya no fabrica clips: empieza a dirigir escenas.» Mostrar un brief de historia de 30 segundos y explicar referencias más extensión como el nuevo flujo de producción.
FLUX 3 Video entra en disponibilidad general: audio nativo, keyframes, continuación
POR QUÉ ENTRA EN EL RADARFLUX 3 Video llega por la API de BFL con clips HD de hasta 20 segundos, audio nativo, control por imagen y keyframes, secuencias de varios planos, y continuación a partir de cuatro segundos de video o audio suministrado. Apunta de forma explícita al diálogo multilingüe y al lip-sync.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«La guerra de modelos de video ahora se juega en la continuidad, no en los fotogramas lindos.» Comparar los controles prácticos: el pack grande de referencias de Seedance versus los keyframes y la continuación de FLUX.
Muse Glimmer: Meta publica un modelo abierto de 30B para agentes locales
POR QUÉ ENTRA EN EL RADARPesos bajo Apache-2.0, optimizado para agentes locales siempre activos, function calling y coding en el dispositivo. Meta dice que su modelo en ~4-bit ocupa menos de 20 GB, y que eso deja margen para KV cache, visión y un drafter de speculative decoding en una máquina de 24–32 GB.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Un empleado de IA privado en la notebook empieza a ser viable.» Explicar el trade-off: autonomía y privacidad versus setup, confiabilidad y restricciones de hardware.
h3-metal corre generación de video MiniMax-H3 nativa en Apple Silicon
POR QUÉ ENTRA EN EL RADAREste proyecto independiente de inferencia nativa en Metal soporta prompt-to-video/audio, condicionamiento por primer y último frame, y referencias ordenadas de imagen, video y audio. Su setting rápido documentado llega a un video de ~0,92 segundos a 512 px en ~3,5 segundos en un M5 Max, con compromisos claros de calidad.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Ya se puede correr generación seria de video con IA en una Mac: acá está el catch.» Usarlo como una historia de benchmark real de velocidad y calidad, no como un claim de hype.
El playbook de «finanzas nativas de IA» de OpenAI: diseñar alrededor de decisiones, no de chat
POR QUÉ ENTRA EN EL RADAROpenAI describe dos objetivos operativos —cierre en día cero y forecasting actualizado de forma continua— y una regla de implementación útil: mapear una decisión consecuente hacia atrás a través de datos, aprobaciones y handoffs. La IA redacta explicaciones y marca excepciones; finanzas sigue siendo dueño de la validación y del sign-off.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El mejor workflow de IA no es un chatbot: es un pipeline de decisiones.» Convertir el ejemplo de finanzas en una plantilla que creadores y pymes puedan copiar.
OpenAI Daybreak y GPT-5.6-Cyber: el acceso frontier en ciber se segmenta por niveles
POR QUÉ ENTRA EN EL RADARDaybreak Blue apunta a defensores aprobados que usan modelos frontier generales; Daybreak Red suma GPT-5.6-Cyber, entrenado ad hoc, para investigación autorizada de vulnerabilidades y validación de exploits. OpenAI reporta una tasa de completion del 95,0% en ciber avanzada para el modelo especializado versus 1,5% para GPT-5.6 Sol estándar con salvaguardas normales: un corte inusualmente tajante entre capacidad y acceso.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El próximo foso de producto en IA puede ser quién tiene acceso, no el modelo.» Enmarcarlo como la capa de política y gobernanza alcanzando a la capacidad agéntica.
Upstream en robótica: la memoria se vuelve arquitectura, no una ventana de contexto
POR QUÉ ENTRA EN EL RADARMulti-Scale Embodied Memory combina memoria de video de horizonte corto con memoria de largo plazo comprimida en texto. Los autores reportan tareas robóticas de varias etapas de hasta 15 minutos, incluyendo limpieza de cocina y preparación de grilled cheese.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Por qué los robots olvidan distinto que los chatbots.» Una analogía simple: la memoria de video resuelve «¿adónde se fue el objeto?» y la de texto resuelve «¿en qué paso de la receta quedé?»
Upstream en robótica: SimToolReal aprende uso diestro de herramientas sin entrenamiento por tarea
POR QUÉ ENTRA EN EL RADARUna sola política entrenada en simulación aprende a manipular objetos similares a herramientas, generados de forma procedural, hacia poses aleatorias, y después transfiere zero-shot a herramientas reales. El paper reporta un 37% mejor performance que baselines previos de retargeting y agarre fijo, en 120 rollouts reales, 24 tareas y 12 objetos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El breakthrough para robots puede ser entrenar con herramientas falsas, no más datos reales.» Explicar por qué la variación procedural hace más robusta la transferencia.