62,7 y 99,9: el mismo modelo, el mismo examen, dos notas
OpenAI publicó un 99,9 % en ARC-AGI-3 para GPT-6 Astra. ARC Prize midió 62,7 % el mismo día. La diferencia es el arnés, y explica por qué las tablas de benchmarks ya no comparan modelos.
Leer
Future — Data & AI.
Elegí la pastilla roja.
Notas, prototipos y campo abierto. Construyendo sistemas que piensen con nosotros, no por nosotros.
OpenAI publicó un 99,9 % en ARC-AGI-3 para GPT-6 Astra. ARC Prize midió 62,7 % el mismo día. La diferencia es el arnés, y explica por qué las tablas de benchmarks ya no comparan modelos.
Leer
CORAL, de Meta, mete un agente LLM en bucle cerrado sobre un recomendador en producción. Lo interesante no son las cifras: es dónde decidieron enchufar el modelo.
Leer
Claude Code escribe el guion de orquestación, lanza una flota de subagentes y la coordinación no cuesta ni un token. Tercera entrega de la serie: del bucle al grafo que se ejecuta solo.
Leer
Hay una veintena de especificaciones para darle identidad a un agente de IA y casi ninguna está terminada. Pero el problema serio es otro: SCIM y SPIFFE trabajan en escalas de tiempo incompatibles, y el punto donde se tocan no lo cubre nadie.
Leer
Google publicó un whitepaper de 51 páginas sobre el nuevo ciclo de vida del software con vibe coding. El marco conceptual —el espectro, Agente = Modelo + Harness, el modelo fábrica— es excelente. El aparato estadístico se cae a la primera pregunta. Reseña capa por capa, con las nueve cifras de cabecera trazadas a su…
Leer
Graphify convierte un repositorio en un grafo de conocimiento determinista, sin embeddings y sin coste de LLM. Su benchmark es de los mejores del sector — y contiene la fila que desmonta su propio titular: cuatro milésimas sobre un híbrido RRF clásico. Análisis técnico del pipeline, lectura crítica de las cifras y el problema de…
Leer
Un paper de agosto propone dejar de instalar skills en los agentes de IA y empezar a llamarlas por su nombre. La idea es buena y el diagnóstico es mejor. La implementación lleva tres semanas en GitHub, tiene dos forks y un paquete que todavía no existe.
Leer
Dieciséis bacteriófagos diseñados por un modelo generativo infectaron y mataron E. coli. El peligro no es la máquina que escribe genomas: es que la cerradura que nos protegía estaba en otra puerta, y lleva años reconociendo caras.
Leer
El gobierno de agentes suele discutirse como doctrina. Nosotros lo bajamos a un banco de pruebas: un gatekeeper de ~200 líneas, microVMs clonadas en caliente y cuatro modelos intentando —sin saberlo— saltarse las reglas. Los números, la matriz de inyección de prompt y las dos fugas que más nos enseñaron.
Leer
Los runtimes de agentes han convergido en la misma arquitectura y casi el mismo precio. La pregunta interesante ya no es cuál comprar: es qué hace cumplir de verdad el que ya tienes, y dónde empieza lo que te toca construir a ti.
Leer
Altman dice que ya estamos dentro de la singularidad. Separamos las tres criaturas que comparten etiqueta: la singularidad real de la física, la metáfora prestada de la IA y el atrezo cuántico de la ciencia ficción.
Leer
Amodei aclara que Anthropic nunca pidió prohibir los modelos de pesos abiertos. Su texto es más razonable de lo que decían los titulares —y aun así, el debate real está en otro sitio: en si queremos un monocultivo eficientísimo o un banco de semillas.
Leer
Los cuatro patrones de Andrew Ng siguen siendo el vocabulario correcto, pero el eje real de la arquitectura agéntica no es cuántos agentes tienes: es dónde vive el estado. Un recorrido honesto de loops a grafos, con lo que ha cambiado desde 2024.
Leer
La impresión y la señal: tres Claudes, un siglo y medio, y una misma pregunta — cuando comunicamos algo, ¿qué es exactamente lo que transmitimos?
Leer
Loop engineering sin humo: la anatomía de un bucle autónomo, cómo monto el mío con un tablero de GitHub y subagentes, y las piezas de Claude Code que lo hacen posible.
Leer
forkd aplica la vieja llamada fork() a máquinas virtuales enteras: cien sandboxes aislados en 101 ms clonando una célula madre ya caliente. La idea, explicada con calma y con biología.
Leer
Una entrada cada vez que hay algo que valga la pena. Sin métricas, sin trucos. Solo notas honestas desde el borde.