El Pulso del 23 de setiembre de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
GPT-6 Sol y Luna — OpenAI
POR QUÉ ENTRA EN EL RADAROpenAI posiciona a Sol y Luna como modelos mucho más baratos de la familia GPT-6: Sol figura a $2/M de entrada y $10/M de salida, y Luna a $0.10/M de entrada y $0.50/M de salida, un 50% por debajo de sus equivalentes GPT-5.6. El relato de fondo no es un triunfo de benchmark del modelo tope; es hacer asequibles, a volumen sostenido, los agentes de código, de uso de computadora y de flujos de negocio.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«El lanzamiento importante de GPT-6 no es el modelo más inteligente: es el que deja a los agentes lo bastante baratos como para no apagarlos.» Mostrá una comparación simple de costo por tarea y después explicá por qué el costo por flujo completado le gana al precio del token por sí solo.
Mejor caché de prompts para GPT-6 — OpenAI
POR QUÉ ENTRA EN EL RADAREl nuevo sistema descuenta hasta un 90% los prefijos reutilizados elegibles dentro de una ventana de 30 minutos, y suma diagnósticos de caché, breakpoints explícitos y precalentamiento. Es una noticia de implementación, aguas arriba y útil: los agentes arrastran una y otra vez esquemas de herramientas, instrucciones y contexto de proyecto, así que el diseño del caché puede dominar la economía y la latencia.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Tu agente de IA puede estar saliendo caro porque le estás rompiendo el caché.» Demostrá los tres asesinos habituales del caché: cambiar las definiciones o el orden de las herramientas, reescribir el prefijo del prompt, y no precalentar.
Claude Opus 5.5 — Anthropic
POR QUÉ ENTRA EN EL RADARAnthropic afirma un costo de carga típica un 40% menor que Opus 5, lecturas de caché un 60% más baratas y una salida un 30% más rápida, junto con resultados más sólidos en código agéntico, uso de computadora y trabajo de conocimiento. El lanzamiento también pone adelante la evaluación externa y una resistencia más fuerte a acciones difíciles de revertir y a la inyección de prompts.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Opus 5.5 compite en dos cosas que a los creadores se les escapan: el precio de lectura de caché y una autonomía más segura.» Enmarcalo como una guía práctica de selección para agentes de código de alto riesgo y contexto largo, no como un recuento genérico de benchmarks.
CliffCompaction: compactación de contexto eficiente en costo para agentes de código de horizonte largo
POR QUÉ ENTRA EN EL RADAREl paper propone una compactación que solo descarta o recorta material original, en lugar de reescribir resúmenes, y evita de forma explícita “compactar una compactación”. Los autores reportan hasta un 50% menos de costo con contexto acotado y un desempeño multi-sesión sostenido más allá del millón de tokens.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Dejá de pedirle a los agentes que resuman su propia memoria.» Explicá la deriva de la compactación con una imagen del teléfono descompuesto y contrastá la reescritura con pérdida frente a la retención selectiva fiel. Encaja perfecto con la noticia de caché de GPT-6.
Treg: un “OpenRouter para herramientas de agentes”
POR QUÉ ENTRA EN EL RADARTreg agrega más de 3.000 endpoints de más de 60 proveedores detrás de una sola interfaz pensada para el agente, y permite compartir claves del equipo, CLIs y skills sin exponer credenciales al agente. Es un ejemplo concreto de que la capa emergente de acceso a herramientas se está volviendo tan importante como el ruteo de modelos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«Los ruteadores de modelos resolvieron qué cerebro usar. Treg quiere resolver qué manos puede usar tu agente.» Discutí la oportunidad —y los riesgos de credenciales, dependencia de proveedor y permisos.
Jev / modelos System One: decisiones instantáneas y calibradas en lugar de generar texto
POR QUÉ ENTRA EN EL RADAREl argumento de fondo es un modelo de decisión local, rápido y calibrado: le das opciones y recibís probabilidades, no una explicación generada. La contralectura desmitifica el mecanismo con provecho y sostiene que clasificar y puntuar logits es familiar, aunque el entrenamiento especializado y la calibración sí puedan ser valiosos.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«¿De verdad hace falta un LLM que escriba una respuesta cuando lo único que necesitamos es aprobar / rechazar / escalar?» Armá un ejemplo mínimo de ruteo y hacé de la calibración —no del hype— la prueba.
Gemini 3.8 Flash y 3.8 Flash Cyber
POR QUÉ ENTRA EN EL RADARGoogle está separando un modelo general rápido y una variante orientada a ciber, y sigue así el giro de la industria hacia modelos operativos especializados y de alto throughput, en lugar de un único flagship universal. El índice también marca comprensión de video agéntica y un lanzamiento de AlphaGenome Atlas este mes: posibles hilos de seguimiento.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗«La próxima guerra de modelos es la especialización: agentes rápidos, agentes de ciber, agentes de video, no un chatbot para gobernarlos a todos.» Usá la explosión de familias de modelos para argumentar a favor del ruteo por carga de trabajo.