El Pulso del 5 de mayo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
DeepSeek-V4 Preview: de código abierto, 1M de contexto por defecto (V4-Pro + V4-Flash)
POR QUÉ ENTRA EN EL RADARDeepSeek está empujando la combinación “pesos abiertos + casi frontera + contexto extremo + precio bajo”. El reclamo acá no es solo calidad: es estructura de costos + 1M de contexto como default, y eso cambia cómo se diseñan memoria de agentes, retrieval y herramientas de horizonte largo.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“1M de contexto no es una feature: es una categoría de producto nueva.” Mostrar 2–3 flujos que se rompen con 128k y se vuelven triviales con 1M (refactors de codebase, archivos de reuniones largas, logs de investigación de varios días).
DeepSeek V4 Pro alcanza el “nivel frontera” en FoodTruck Bench (benchmark agéntico) y muestra una varianza inusualmente chica
POR QUÉ ENTRA EN EL RADARLa mayoría de las comparaciones de modelos se enfoca en evals de un solo disparo. Acá hay una simulación de agentes a 30 días, con memoria persistente + reflexión diaria + 34 herramientas. La señal fuerte es la consistencia entre corridas (distribución apretada), no solo el mejor score.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La verdadera killer feature es la varianza.” Explicar por qué las empresas deberían preferir modelos con resultados aburridos y repetibles antes que modelos con genialidad ocasional.
OpenAI: cómo entregan voice AI de baja latencia a escala (rearquitectura del stack WebRTC)
POR QUÉ ENTRA EN EL RADARLos agentes de voz se están convirtiendo en la UI por defecto de muchos flujos, pero la latencia y el jitter son lo que los hace sentir falsos. Este post es una mirada poco frecuente a las restricciones de infraestructura (estado ICE/DTLS, escalado de puertos, routing) que terminan definiendo la UX del producto.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El cuello de botella más grande de tu agente de voz no es el modelo: es la red.” Convertirlo en un modelo mental simple: de dónde viene la latencia, qué te compra WebRTC y qué implica “barge-in” a nivel técnico.
NVIDIA Nemotron 3 Nano Omni: modelo multimodal abierto para loops de percepción de agentes (visión + audio + lenguaje)
POR QUÉ ENTRA EN EL RADARLos stacks de agentes suelen encadenar modelos especializados; eso suma latencia y pierde contexto cross-modal. NVIDIA está posicionando un único modelo “omni” abierto como capa de percepción para agentes de computer-use y flujos de documentos + audio + video.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejen de armar agentes como una carrera de postas.” Mostrar un diagrama de arquitectura: (1) modelo omni de percepción para loops rápidos + (2) modelo planner grande para el razonamiento más duro.
Coding agéntico: qué hacer cuando el código se vuelve barato
POR QUÉ ENTRA EN EL RADARLas herramientas se mueven más rápido que los modelos mentales. Este tipo de posts de “efectos de segundo orden” suelen envejecer bien: diseño de flujos, disciplina de review, estrategia de tests y dónde los humanos todavía aportan apalancamiento.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La nueva skill no es escribir código: es poner restricciones.” Dar 3 checklists concretas: spec, tests y PR review para código generado con IA.
Addy Osmani: “Agent Skills” (taxonomía de capacidades que vale la pena entrenar y medir)
POR QUÉ ENTRA EN EL RADARTodos demuestran agentes; pocos definen qué skills importan (planificación, confiabilidad en el uso de herramientas, autocorrección, higiene de memoria, evals). Una taxonomía es combustible upstream para mejores benchmarks y claims de producto más claros.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes necesitan una ‘matriz de skills’ como los videojuegos.” Armar una rúbrica simple que la audiencia pueda usar para comparar herramientas más allá de las vibes.
arXiv: destilar el razonamiento de DeepSeek-R1 en modelos abiertos más chicos para detección de clones de código cross-language
POR QUÉ ENTRA EN EL RADARLa destilación está pasando de “imitar logits” a “transferir comportamiento de razonamiento + estabilizar salidas”. Este es un ejemplo concreto: hacer que modelos chicos sean confiables para una tarea de etiqueta binaria (clone / no-clone) con estabilización de respuesta.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El futuro son modelos chicos que se comportan como los grandes.” Explicar: datos sintéticos orientados a razonamiento + forzar conclusiones + cabezales de clasificación = pipelines más predecibles.
(Creator-watch → después upstream) Matt Wolfe: el roundup de AI News incluye DeepSeek V4 + Nemotron + otros (usar como descubrimiento, no como fuente primaria)
POR QUÉ ENTRA EN EL RADAREs un buen barrido de radar de lo que los creadores agregadores están por cubrir. El valor real está en los links upstream de la descripción.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Así se minan videos agregadores para llegar a las fuentes upstream más rápido que el resto.” Enseñar el flujo: mirar 2 minutos → saltar a la descripción → abrir los 3 links primarios.