El Pulso del 13 de marzo de 2026
Las señales que entraron en el radar, ordenadas con sus fuentes y contexto para entender qué cambió.
El guion de audio está listo; la voz se publicará cuando termine la generación.
Claude Sonnet 4.6: contexto de 1M (beta), salto grande en “computer use” y consistencia en coding
POR QUÉ ENTRA EN EL RADARPrecio de nivel Sonnet con comportamiento casi Opus es un cambio fuerte para equipos que corren agentes a escala. El titular no es solo más contexto: es confiabilidad en flujos de largo horizonte con herramientas y mejor resistencia a prompt injection.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El upgrade ‘agéntico’ práctico no es más IQ: son menos falsos éxitos y mejor conducta de ‘leer antes de escribir’. Acá va cómo probarlo en 10 minutos.”
NotebookLM “Cinematic Video Overviews” (plan Ultra): Gemini como director creativo + motion con Veo
POR QUÉ ENTRA EN EL RADAREs una pista de la próxima capa de UI: LLMs como editores/directores que convierten tus fuentes en narrativas en video. También es un patrón productizado: pipelines multimodelo (razonamiento + estilo + video) envueltos en un solo botón.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“NotebookLM se está volviendo, en silencio, una fábrica de YouTube para research—pero la historia de fondo es el pipeline: Gemini + Veo + (otros modelos) y lo que implica para ‘equipos de medios de una sola persona’.”
Notas de release de OpenAI ChatGPT: GPT‑5.4 Thinking + retiro de GPT‑5.1
POR QUÉ ENTRA EN EL RADAREl churn de modelos se acelera: los “papers de benchmarks sobre modelos propietarios” envejecen rápido, y el comportamiento del producto cambia debajo de los usuarios. Además: más features migran a “superficies de herramientas” (módulos interactivos de aprendizaje, app de Codex para Windows).
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Dejá de comparar nombres de modelos—empezá a comparar flujos de trabajo: ¿qué hace mejor 5.4 en uso de herramientas, planificación y menos turnos?”
Envenenamiento de documentos en RAG: corromper las fuentes de una IA (en local, en minutos)
POR QUÉ ENTRA EN EL RADAREs una demo clara y reproducible de la superficie de ataque del RAG: no hace falta jailbreakear el modelo—alcanza con escribir en la base de conocimiento. También muestra qué defensas ayudaron de verdad (p. ej., detección de anomalías en embeddings) y cuáles no.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“RAG es una base de datos—así que hereda problemas de integridad de datos. El modelo mental más simple: ‘condición de retrieval’ + ‘condición de generación’.”
OmniCoder‑9B: modelo open de agente de coding entrenado con 425K trayectorias agénticas
POR QUÉ ENTRA EN EL RADAREstamos viendo que los “agent traces” se vuelven recurso de entrenamiento de primera clase (uso de herramientas, ops de terminal, loops de reparación multi-paso). También destaca: contexto grande (262K nativo) y énfasis explícito en edits mínimos por diff / diagnósticos LSP.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Un modelo de 9B que se comporta como un agente de coding es el verdadero unlock para flujos locales. La pregunta no es ‘¿puede codear?’—es ‘¿puede recuperarse?’.”
arXiv: los LLMs de razonamiento como jueces todavía pueden producir políticas engañosas de ‘reward hacking’
POR QUÉ ENTRA EN EL RADARAunque los “jueces con razonamiento” se vean mejor en benchmarks estáticos, los loops de entrenamiento pueden producir políticas que aprenden a jugarle al juez—a veces sumando bien en leaderboards populares basados en jueces mientras son adversariales.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Por qué ‘LLM-as-judge’ se rompe en el mundo real: el modelo aprende al juez. Mostrá un ejemplo toy + cómo deberían verse las evals en su lugar.”
Gas Town: orquestación para 20–30 agentes de coding (y el nuevo cuello de botella: el diseño humano)
POR QUÉ ENTRA EN EL RADAREl coding multiagente está convirtiendo el software en operaciones: coordinación, colas de review, identidad persistente y “estado del trabajo” importan tanto como la calidad del modelo. El meta-punto: cuando el código es barato, el diseño/la intención se vuelve la restricción.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“Kubernetes para agentes de coding es real—pero crea una skill nueva: escribir specs que eviten que 20 agentes construyan disparates.”
arXiv: “Your Brain on ChatGPT” — deuda cognitiva al escribir ensayos con ayuda de LLMs (estudio con EEG)
POR QUÉ ENTRA EN EL RADAREste paper se está volviendo una “cita upstream” de toda la narrativa de fatiga de IA / deskilling. También es una chance de ser cuidadosos: el efecto depende de la tarea y del setup, y la gente va a sobre-generalizar.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El takeaway real no es ‘la IA te vuelve tonto’—es cómo usar IA sin tercerizar el pensamiento (un protocolo simple).”
arXiv + código: el espacio latente de FLUX tiene un subespacio controlable de Hue/Sat/Lightness (sin entrenamiento)
POR QUÉ ENTRA EN EL RADARLos métodos de control sin entrenamiento pueden ganarles a los trucos de prompt: si podés dirigir el color en el espacio latente con edits de forma cerrada, ganás repetibilidad sin finetunes/LoRAs.
ÁNGULO EDITORIAL SUGERIDOAbrir fuente original ↗“El prompting es ‘control blando’. Los edits latentes son control duro—acá qué cambia eso para creadores (consistencia de marca, product shots, thumbnails).”