El Pulso del 8 de mayo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Natural Language Autoencoders (NLAs): “convertir las activaciones del modelo en texto legible”
POR QUÉ ENTRA EN EL RADAREs una nueva interfaz de interpretabilidad: en vez de que los SAE produzcan vectores/features que después interpretan expertos, el método entrena un “verbalizador” activación→texto más un reconstructor texto→activación, y puntúa por reconstrucción. Además se posiciona de forma directa como herramienta de seguridad y auditoría (sacar a la luz awareness de evaluación y motivaciones ocultas).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Interpretabilidad que habla en inglés: por qué los NLA pueden cambiar la auditoría de modelos (y dónde todavía pueden alucinar).”
Informe de impacto de AlphaEvolve: el agente de “evolución de algoritmos” potenciado por Gemini ya es una plataforma dentro de Google
POR QUÉ ENTRA EN EL RADAREs una señal fuerte de que el patrón “agente de código + loop de búsqueda/evolución” se está productizando y metiendo en infraestructura y diseño de hardware (TPU, Spanner, caches, optimizaciones de compilador), no solo en demos matemáticas de juguete. También viene cargado de links a papers upstream que se pueden seguir antes de que llegue la cobertura de creadores.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La verdadera próxima ola no es ‘chatear con código’: son los loops de evolución algorítmica llegando a producción.”
OpenAI publica 3 nuevos modelos de audio en tiempo real en la API (razonamiento + traducción + STT en streaming)
POR QUÉ ENTRA EN EL RADARLos detalles importan: GPT‑Realtime‑2 (razonamiento de clase GPT‑5) más capacidades de tool-calling (“preambles”, llamadas a tools en paralelo, contexto más largo de 128K, esfuerzo de razonamiento ajustable), más un modelo de traducción y un Whisper nuevo en streaming.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Agentes de voz que trabajan en tiempo real: qué cambia cuando las tool calls pasan a ser first-class en audio.”
Salto en inferencia local: ds4 de antirez (motor Metal DeepSeek V4 Flash) — acotado, validado, priorizando contexto largo
POR QUÉ ENTRA EN EL RADAREs un motor de inferencia local de “un modelo a la vez”, afinado alrededor de DeepSeek V4 Flash, con énfasis explícito en validación con vectores oficiales, KV cache disk-first (el SSD como ciudadano de primera del KV) y contexto largo (afirma soporte de 1M de contexto).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“La inferencia local ya no se trata de ‘corre’: se trata de credibilidad de punta a punta (vectores de validación, tests de contexto largo, KV en disco).”
Aceleración en LLaMA.cpp: parche de Multi-Token Prediction (MTP) + GGUF de asistente Gemma 4
POR QUÉ ENTRA EN EL RADARSi MTP se vuelve práctico en los stacks locales mainstream, es un desbloqueo de latencia (tokens en borrador), sobre todo para workloads de tipo asistente. El post también incluye un repo parchado concreto que se puede inspeccionar.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Speculative decoding para las masas: qué cambia MTP en llama.cpp, y cómo chequear con cabeza fría los speedups que se reclaman.”
AI Co‑Mathematician: un workbench agéntico para investigación matemática abierta (FrontierMath Tier 4: 48%)
POR QUÉ ENTRA EN EL RADARNo es “otro benchmark de matemática”: describe un workspace asíncrono y con estado que rastrea incertidumbre + hipótesis fallidas + produce artefactos matemáticos nativos. Vale la pena mirarlo como “UX de agente” para dominios de investigación.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Los agentes de matemática no son un chatbot: son un cuaderno de lab + búsqueda + loop de demostración. Acá está la forma de producto.”
Suba de precio de GPT‑5.5: OpenRouter dice que el costo efectivo subió ~49%–92% (depende de la longitud del prompt)
POR QUÉ ENTRA EN EL RADARLas narrativas de pricing se simplifican a “se duplicó.” Esto sugiere una realidad más matizada: cambiaron las longitudes de completion (más cortas en prompts largos), así que los costos efectivos varían según la forma del workload.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejá de citar el list price: cómo la longitud del prompt cambia tu factura real después de un update de modelo.”