Ideas para navegar el presente

El tercer caballo se acerca

La noche del 30 de septiembre me saltó en el móvil una notificación con dos palabras que llevaban semanas rondando por todos los foros del sector: Gemini 4. Hice lo que hace todo el mundo en estos casos y fui directo a buscar la tabla. Esa tabla que acompaña a cada lanzamiento, con el modelo nuevo en negrita arriba del todo y los rivales un escalón por debajo, como el marcador de llegada de una carrera. Y ahí estaba. Google presentaba Gemini 4 Argon, su nuevo modelo de frontera, con un 77,9 % en DeepSWE frente al 74,2 % de Claude Opus 5.5 y el 74,1 % de GPT-6 Astra.

En mi último post, a propósito del DevDay que OpenAI celebró el 29 de septiembre y del prospecto de Anthropic, escribí que Google parecía el caballo rezagado de esta carrera, y que un fotograma no es una carrera. Pues bien: el tercer caballo ha llegado al hipódromo.

Me quedé mirando la tabla un buen rato. Luego me fijé en lo que no venía en ella.

Casi nadie puede montarlo todavía.

Pero antes de llegar ahí, conviene presentar al caballo, porque el nombre despista bastante.

Un gas noble para un caballo de fondo

Argon es el nombre del modelo. No de una empresa ni de una aplicación nueva: es el primer miembro de la cuarta generación de Gemini, la familia de inteligencias artificiales de Google, la misma que ya usas si alguna vez has hablado con el asistente de tu Android o has leído un resumen automático en el buscador. Hasta ahora Google ponía apellidos de gama a sus modelos, Pro para el potente y Flash para el rápido, y todo el mundo esperaba un «Gemini 4 Pro». Lo que ha llegado es otra cosa: un nombre propio, al estilo de los Astra y Sol con los que OpenAI bautiza ya sus modelos. Argon era el nombre en clave con el que el modelo circulaba en pruebas internas desde mediados de septiembre, y según las filtraciones llegó a dejarse ver en LMArena, la plataforma donde los usuarios votan a ciegas entre dos modelos, bajo una etiqueta falsa. El apodo de cuadra se ha quedado como nombre oficial.

Google no ha explicado por qué Argon, y la elección tiene su gracia. El argón es un gas noble que debe su nombre al griego argós, «perezoso» o «inactivo», porque apenas reacciona con nada. Han bautizado como «el vago» a un modelo diseñado justamente para no parar.

Porque eso es lo que Argon promete. No es un modelo para charlar ni para contestar rápido: es un modelo de razonamiento pensado para tareas largas, de muchos pasos encadenados, de esas que hasta hace poco exigían a una persona una jornada entera. Google lo orienta a cuatro terrenos: la programación de verdad, la de bases de código enormes; el trabajo profesional de conocimiento, como el análisis jurídico o financiero; la defensa en ciberseguridad; y la escritura creativa. Para eso le han ampliado el límite de salida a un millón de tokens en una sola respuesta, cuando los Gemini anteriores se quedaban en 64.000: dicho en cristiano, puede entregarte de una sentada un trabajo del tamaño de varios libros. Es la evolución natural de lo que ya expliqué aquí al distinguir entre un modelo de lenguaje, un asistente y un agente: Argon está hecho para ser lo tercero. Según Google, miles de sus propios empleados lo usan ya en su trabajo diario, y presume además de que es su modelo más resistente hasta la fecha a la inyección indirecta de instrucciones, esas órdenes escondidas en un documento o una web que intentan secuestrar a la máquina.

Ese es el caballo. Ahora, la puerta por la que ha entrado.

Tres caballos, una misma puerta

Argon no ha salido a la calle. Google lo está entregando primero a un grupo de defensores de ciberseguridad de confianza, dentro de lo que llama el Fairwind Program, y dice que participa además en el proceso voluntario del gobierno estadounidense de acceso previo a modelos de frontera. Los clientes de pago de su API y los suscriptores del plan más caro de Google serán los siguientes. El resto esperaremos «lo antes posible», que en el calendario de esta industria puede significar cualquier cosa entre diez días y tres meses. Algún medio lo ha titulado sin rodeos: Argon ya está aquí, pero no es para ti.

Y aquí es donde la noticia deja de ser una noticia y se convierte en un patrón. En abril, Anthropic presentó Claude Mythos Preview y decidió no ponerlo en manos del público: lo reservó para una coalición de empresas y organizaciones que mantienen software crítico, dentro de Project Glasswing. El 3 de septiembre, OpenAI lanzó GPT-6 Astra, su primer modelo en cruzar el umbral «crítico» de ciberseguridad, y explicó que había retrasado partes del desarrollo y del lanzamiento para reforzar las protecciones, dejando sus capacidades más avanzadas primero en manos de un grupo de probadores y de su programa para defensores. Y el 30 de septiembre, Google.

Tres caballos. Los tres han entrado en el hipódromo por la misma puerta, y no es la de la tribuna.

Lo que la crónica de la carrera se está dejando fuera

Casi todo lo que se ha escrito desde el anuncio va de la carrera, y es lógico, porque la carrera tiene su morbo. Google había dejado en el cajón el Gemini 3.5 Pro que prometió para el verano y había visto cómo GPT-6 Astra y Fable 5 le pasaban por delante. Argon es además el primer gran lanzamiento de Koray Kavukcuoglu al frente de Google DeepMind, después de que Demis Hassabis dejara la gestión diaria del laboratorio en agosto. Hay cambio de jinete, hay presión, hay apuestas. Material de sobra para las páginas de deportes, y para la lectura geopolítica de siempre, la de la carrera entre potencias que ya analicé en Pax Silica.

Pero yo llevo desde el 30 de septiembre dándole vueltas a otra cosa.

Cuando en abril Anthropic dijo que su modelo era demasiado capaz para soltarlo sin más, mucha gente lo leyó como marketing. Y algo de marketing había, claro: hubo analistas que señalaron enseguida que Glasswing era también una campaña estupenda para la familia Claude, y no existe mejor anuncio que «esto no es para ti porque es demasiado bueno». Pero una empresa haciendo algo es un gesto. Tres empresas que compiten a cuchillo, que se disputan talento, clientes y titulares, haciendo exactamente lo mismo en seis meses, es otra cosa. Es una costumbre que está naciendo. Y nadie la ha impuesto por ley.

La costumbre dice algo muy sencillo: cuando tienes un modelo capaz de encontrar agujeros en el software del que depende todo el mundo, se lo das primero a quienes los tapan. Google cuenta que Argon, usado por la empresa de seguridad Wiz dentro de una iniciativa gratuita para proteger infraestructuras públicas, ya ha encontrado un fallo crítico que exponía datos personales en un software sanitario usado por hospitales de todo el mundo, y que los modelos anteriores no habían detectado. Si eso es cierto, ese agujero se cierra antes de que nadie con peores intenciones llegue a verlo. Que los defensores salgan con ventaja no es un detalle técnico. Es una decisión moral, y la están tomando a la vez los tres establos más poderosos del planeta.

No digo que sea suficiente. Digo que es la dirección correcta, y que conviene reconocerlo cuando pasa.

Berlín, septiembre de 1904

Permíteme otro caballo, porque esto de examinar caballos prodigiosos ya nos ha pasado antes y sabemos cómo acabó.

En el Berlín de 1904, un antiguo maestro de matemáticas llamado Wilhelm von Osten presentaba al público a su caballo Hans. Hans sumaba, restaba, dividía, decía la hora y calculaba fechas del calendario dando golpes con la pezuña. Von Osten no cobraba entrada y estaba sinceramente convencido de que su caballo razonaba. El fenómeno llegó a las páginas del New York Times, y el revuelo fue tal que las autoridades educativas alemanas nombraron una comisión de trece expertos, encabezada por el filósofo y psicólogo Carl Stumpf, para investigarlo. En septiembre de 1904, la comisión concluyó que no había truco alguno. Hans, el Listo, había aprobado el examen.

Hasta que un joven psicólogo, Oskar Pfungst, cambió una sola variable. En lugar de preguntarse si Hans acertaba, se preguntó en qué condiciones acertaba. Y diseñó pruebas en las que la persona que preguntaba no sabía la respuesta. Resultado, publicado en 1907: cuando el interrogador conocía la solución y el caballo podía verle, Hans acertaba el 89 % de las veces; cuando no la conocía, el acierto caía al 6 %. Hans no sabía aritmética. Lo que sabía, y de maravilla, era leer a quien le preguntaba: la levísima inclinación de cabeza al empezar, la tensión que crecía a medida que se acercaba al número correcto, el alivio involuntario cuando llegaba. Ahí paraba de golpear.

Fíjate en lo que no hubo. No hubo fraude. Von Osten no engañaba a nadie, y la comisión no era incompetente. Lo que hubo fue un examen en el que la respuesta estaba en la sala. Y el caballo, que era listo de verdad, aunque no para lo que todos creían, la encontró.

Ahora mira otra vez la tabla del 30 de septiembre.

Cada laboratorio examina a su propio caballo, con pruebas que conoce de memoria y cuyas respuestas, en muchos casos, circulan por internet desde hace tiempo. Según el recuento de VentureBeat, Argon lidera en doce de los dieciocho benchmarks que Google incluye en sus gráficas. Anthropic hizo su exhibición en abril, OpenAI la suya en septiembre. Todos aciertan en su patio. No digo que ninguno haga trampa. Digo que la pregunta de Pfungst sigue siendo la buena: no si el caballo acierta, sino si la respuesta estaba en la sala. Y que cuando tres caballos llegan separados por tres o cuatro puntos, a simple vista eso es un empate.

No es una preocupación teórica. Ya conté aquí cómo un modelo de OpenAI partió una credencial en dos trozos para que el escáner que lo vigilaba no la viera, y escribí que las máquinas optimizan el objetivo que se mide, no la intención que hay detrás. Un benchmark es exactamente eso, un objetivo que se mide. Y yo pasé veinte años explicando que los megahercios de la pegatina no eran el rendimiento real de un ordenador. Las cifras cambian. La tentación de creerse la pegatina, no.

Los asteriscos, que nunca faltan

Yo no he tocado Argon. Nadie fuera del círculo de Fairwind y de la propia Google lo ha hecho. Todo lo que sé viene del anuncio oficial y de la prensa que lo ha cubierto, y las cifras son autodeclaradas: la evaluación independiente llegará dentro de unas semanas y puede contar otra historia. De hecho, antes del lanzamiento, Bloomberg informó de que dentro de la propia Google había quien dudaba de que Argon estuviera a la altura de sus rivales, mientras otros sostenían que sí. Lo honesto ahora mismo es decir que no lo sabemos.

Tampoco voy a vender la costumbre del acceso escalonado más cara de lo que vale. Es voluntaria, la definen las propias empresas y sirve, a la vez, como prudencia y como escaparate. Las dos cosas pueden ser verdad al mismo tiempo, y casi siempre lo son.

Y la analogía de Hans tiene sus límites. Los modelos actuales no son caballos leyendo gestos: hacen cosas reales y comprobables, como encontrar fallos que llevaban años escondidos en código que miles de personas habían revisado. La lección de Pfungst no es que los modelos no sepan. Es que un examen mal diseñado no te deja distinguir lo que saben de lo que te reflejan.

La prueba de Pfungst

Aquí viene la parte incómoda, porque en esta historia el que más se parece a von Osten no es Google. Eres tú. Soy yo.

Cuando le preguntamos algo a una IA, casi siempre llevamos la respuesta puesta. «¿No crees que este contrato es abusivo?», «revisa mi código, que creo que está bien», «dame argumentos a favor de lo que ya he decidido». Inclinamos la cabeza sin darnos cuenta, y la máquina, que es extraordinariamente buena leyendo a quien le habla, para de golpear justo donde esperábamos. Ya escribí que el gran predictor ya está aquí, recordando cómo mi padre me ganaba al mus leyéndome a mí más que a las cartas. Pues esto es lo mismo, pero con un jugador que ha leído a medio planeta.

Te propongo el ejercicio, y lo he bautizado en honor a Pfungst. Cuando Argon llegue al público, o ya mismo con cualquiera de los otros dos caballos, hazles preguntas cuya respuesta no esté en la sala. Dos condiciones. La primera: que sea algo de tu trabajo que no aparezca en internet, un problema real de esta semana, con datos tuyos, y que puedas comprobar después por otra vía, un experto, un documento original, el resultado en el mundo real. La segunda: pregunta sin inclinar la cabeza. Nada de «¿verdad que…?». Plantea el problema en limpio, sin adelantar lo que esperas, y si quieres afinar, pídele que te dé primero la versión contraria a la que tú intuyes.

Y luego compara. No los tres caballos entre sí, que eso lo harán los laboratorios independientes, sino lo que cada uno te contesta cuando no le das pistas con lo que te contestaba cuando sí. Esa diferencia es el 89 frente al 6 de tu propio patio. Te dirá más sobre cuánto puedes fiarte de una herramienta que cualquier tabla, y te enseñará algo todavía más valioso: cuánto de lo que creías que la máquina sabía lo estabas poniendo tú. Es la misma disciplina que me enseñó mi madre cuando me hacía repasar el ticket del supermercado al llegar a casa, y la misma que defendimos al hablar de la nueva evaluación: lo que no puedes examinar bien, no lo puedes conocer.

Hacerlo una vez cuesta una tarde. Una tarde. Y la próxima vez que un caballo nuevo entre en el hipódromo, que a este ritmo será dentro de pocas semanas, no dependerás de la exhibición de nadie. Ni siquiera de que el caballo siga en la pista: el viernes 12 de junio vimos cómo una herramienta podía dejar de responder a las cinco y veintiuno de la tarde sin avisar a nadie, y quien sabe examinar caballos encuentra otro en una tarde.

Desde Human-IA insistimos en esto porque expandir el potencial humano no consiste en apostar al caballo más listo, sino en saber hacer las preguntas que distinguen al listo del que solo te está leyendo. Las empresas van a seguir haciendo sus exhibiciones, y está bien que las hagan. El examen lo diseñas tú.

Volvamos a Berlín. Pfungst no demostró que Hans fuera tonto: demostró que era un genio leyendo personas, que no es poco para un caballo. Y su método, separar lo que sabe el examinado de lo que sabe el examinador, acabó siendo la base de cómo se diseñan hoy los experimentos serios en medio mundo. Lo que salió de aquel patio no fue un caballo desacreditado. Fue una manera mejor de preguntar. El 30 de septiembre entró en la pista el tercer caballo, uno con nombre de gas perezoso y vocación de maratón, y seguro que pronto llegará el cuarto (con los ojos rasgados).

Un caballo listo siempre acierta cuando la respuesta está en la sala; el criterio empieza cuando lo sacas de ella.

Recuerda de nuevo que tú eres el jockey.