El Pulso del 9 de julio de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
OpenAI se retracta de su impulso previo hacia SWE-Bench Pro tras auditarlo
POR QUÉ ENTRA EN EL RADAREsto va más allá del “drama de benchmarks”. OpenAI afirma que alrededor del 30% de las tareas de SWE-Bench Pro parecen rotas, con tests excesivamente estrictos, prompts poco especificados y un diseño de tareas engañoso. Eso debilita una gran parte del discurso de “el agente X le ganó al agente Y” en coding.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Muchos benchmarks de coding con IA pueden ser inteligencia de cartón.” Enfocalo en cómo la economía de los leaderboards puede distorsionar lo que founders y equipos de desarrollo realmente compran.
GPT-Live: el nuevo stack de voz full-duplex de OpenAI
POR QUÉ ENTRA EN EL RADAREl cambio clave es arquitectónico: GPT-Live sostiene conversación continua mientras delega el trabajo más difícil a un modelo frontier en segundo plano. Esa separación entre “capa de interacción natural” y “capa de razonamiento profundo” se siente como un patrón de producto importante para agentes.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La próxima guerra de UX en IA no es el chat: son los sistemas operativos conversacionales.” Mostrá por qué la voz full-duplex importa más que un punto extra en un benchmark.
Databricks midió agentes de coding sobre su propio codebase de varios millones de líneas
POR QUÉ ENTRA EN EL RADAREste es el contrapunto más interesante a las evaluaciones públicas: benchmarks privados, internos, sobre repos reales. Databricks sostiene que el precio por token del modelo fue un mal proxy del costo real de la tarea, y que la elección del harness cambió de forma drástica la calidad y el costo.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué el mejor modelo de coding puede ser el sistema de coding equivocado.” Enfocate en el diseño del harness, la gestión de contexto y el costo por tarea, no en la hype del modelo crudo.
Anthropic detalla las salvaguardas cibernéticas de Fable 5 y propone un marco de severidad para jailbreaks
POR QUÉ ENTRA EN EL RADAREs material de base para la ola inevitable de opiniones sobre “jailbreaks de IA”. Anthropic intenta estandarizar niveles de severidad, algo que podría moldear cómo labs, gobiernos y la prensa hablan de filtraciones de capacidad cibernética.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los labs de IA intentan crear un CVSS para jailbreaks.” Ese frame es entendible y te da un formato limpio de explainer.
Caso Anthropic: el gobierno de Alberta usó Claude Code para escanear 466M de líneas de código
POR QUÉ ENTRA EN EL RADARLos números concretos son el gancho: 466 millones de líneas escaneadas en 20 horas, con fixes y tests generados en el camino. Es útil porque muestra una historia operativa, no de demo, de despliegue de IA en gobierno, con throughput medible.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El Estado acaba de tener su primer playbook real de mantenimiento de software con IA.” Apoyate en deuda técnica, modernización y por qué las instituciones viejas pueden volverse grandes compradoras de IA.
Alibaba open-sourcea Open Code Review
POR QUÉ ENTRA EN EL RADAREs exactamente el tipo de release de herramienta upstream que los agregadores después empaquetan con gusto. Alibaba afirma que su diseño híbrido determinista-más-agente supera a los agentes de código de propósito general en precisión y F1, usando cerca de un noveno de los tokens.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes de IA generales vuelven a perder frente a sistemas de IA más acotados.” Buena tesis: productos de agente purpose-built pueden superar a copilotos generales en producción.
Paper nuevo: EvoSOP para agentes que usan tools y se auto-evolucionan
POR QUÉ ENTRA EN EL RADARLa idea es simple y se pega: los agentes deberían comprimir cadenas repetidas de acciones de bajo nivel en tools de orden superior, reutilizables, al estilo de un SOP. Es un modelo mental fuerte de por dónde podría mejorar a continuación la confiabilidad de los agentes.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El futuro de los agentes puede parecer menos autonomía cruda y más playbooks reutilizables.” Encaja bien con un explainer educativo con ejemplos.