¿Quién decide qué tan inteligente es una IA?


GPT-6 Astra reabre el debate sobre la AGI: los modelos alcanzan resultados extraordinarios en algunas pruebas, pero todavía no existe un examen universal capaz de determinar si una máquina posee inteligencia general.

“WELCOME TO THE AGI ERA”

El 3 de septiembre de 2026, OpenAI presentó GPT-6 Astra, su nuevo modelo de frontera, y su presidente, Greg Brockman, cerró una sesión informativa con periodistas con una frase que rápidamente recorrió el mundo: “Welcome to the AGI era”.

Horas antes, al ser cuestionado sobre si Astra podía representar la llegada de la Inteligencia General Artificial —AGI, por sus siglas en inglés—, Brockman respondió que consideraba que “podría ser este modelo”.

La afirmación es significativa, pero pertenece al terreno de la interpretación de sus desarrolladores. No existe actualmente una prueba científica universal que permita marcar una casilla y declarar que un sistema “ya es AGI”.

Y ahí comienza una pregunta mucho más profunda: ¿quién decide qué tan inteligente es una inteligencia artificial?

1. UNA IA NO TIENE “97.6% DE INTELIGENCIA”

Cuando un modelo obtiene una puntuación de 98% en una prueba, no significa que posea 98% de la inteligencia posible.

Significa que alcanzó ese porcentaje en un instrumento concreto, con unas preguntas concretas, bajo unas reglas concretas y una configuración determinada.

OpenAI reporta que GPT-6 Astra obtuvo 98% en FrontierMath Tier 4; 99.9% en ARC-AGI-3 utilizando un Provider Adapter; 100% en ExploitBench; 41.4% en AutomationBench; 57.2% en Humanity’s Last Exam con herramientas; 96% en GPQA Diamond; y 64.6% en Terminal-Bench Science 0.1.

La propia OpenAI utiliza estos resultados para presentar Astra como su modelo “más inteligente y alineado”.

Pero la tabla también revela algo fundamental: el mismo modelo puede obtener una puntuación extraordinaria en una prueba y una mucho más modesta en otra.

Eso no significa necesariamente que el benchmark esté equivocado. Significa que cada examen mide una parte diferente del problema.

2. EL MITO DEL “EXAMEN DEFINITIVO”

Durante años se ha imaginado que la llegada de la AGI tendría un momento reconocible: una máquina supera una prueba definitiva y la humanidad puede señalar una fecha exacta.

La realidad está siendo mucho más complicada.

La inteligencia humana tampoco es una sola capacidad. Incluye memoria, razonamiento, lenguaje, aprendizaje, planificación, percepción, conocimiento, creatividad, interacción social y capacidad para transferir conocimientos de un problema a otro.

Por eso, medir inteligencia artificial implica construir familias de pruebas.

Un benchmark puede preguntar: ¿puede resolver matemáticas? Otro: ¿puede programar? Otro: ¿puede utilizar una computadora? Otro: ¿puede desenvolverse en un entorno cuyas reglas desconoce? Y otro: ¿puede ejecutar una secuencia completa de trabajo profesional?

Cada respuesta representa una pieza del rompecabezas.

3. ARC-AGI-3: CUANDO LA IA ENTRA A UN MUNDO SIN INSTRUCCIONES

Uno de los experimentos más interesantes es ARC-AGI-3.

El benchmark fue presentado en marzo de 2026 por ARC Prize como una evaluación de inteligencia agéntica.

Los entornos son interactivos y no entregan a la máquina instrucciones explícitas sobre las reglas ni los objetivos. El agente tiene que explorar, observar, identificar regularidades, descubrir cómo funciona el entorno, inferir qué debe conseguir, elaborar una estrategia, actuar, aprender de lo ocurrido y continuar.
Cuando ARC-AGI-3 fue presentado, ARC Prize informó que los humanos alcanzaban 100%, mientras que los sistemas de frontera rondaban apenas 0.51%.

Meses después apareció Astra.

Y aquí aparece uno de los datos más importantes de toda la discusión.

4. 99.9%… PERO TAMBIÉN 62.7%

OpenAI promocionó un resultado de 99.9% en ARC-AGI-3.

El número es real. Pero no cuenta toda la historia.

ARC Prize publicó posteriormente que Astra obtuvo 62.7% con el Standard harness y 99.9% con el Provider Adapter harness.

El primer sistema utiliza un entorno de evaluación estándar que permite comparar modelos bajo condiciones comunes. El segundo utiliza un adaptador proporcionado por el fabricante que permite conservar estado de razonamiento entre solicitudes y utilizar mecanismos de compactación para reutilizar trabajo previo.

Los dos resultados son legítimos. Pero no representan exactamente la misma condición experimental.

Una puntuación no puede separarse de la metodología que produjo esa puntuación.

5. EL DATO QUE CAMBIÓ LA INTERPRETACIÓN

ARC Prize informó que Astra utilizó menos acciones que la mediana de los participantes humanos en 96% de los niveles evaluados.
Eso significa que, bajo esa métrica concreta de eficiencia, el sistema no sólo consiguió resolver los entornos: en la mayoría de ellos lo hizo con una cantidad de acciones inferior a la referencia humana utilizada por ARC Prize.

Es un resultado importante.

Pero tampoco equivale automáticamente a “inteligencia humana general”.

Mide eficiencia dentro de los mundos artificiales creados para el benchmark.

6. FRONTIERMATH: CUANDO EL EXAMEN TAMBIÉN PUEDE FALLAR

FrontierMath intenta resolver otro problema.
Los benchmarks matemáticos tradicionales comenzaron a quedarse pequeños para los modelos de frontera.

Epoch AI construyó FrontierMath con problemas originales extremadamente difíciles, escritos y revisados por matemáticos expertos.

La versión publicada en junio de 2026 contiene 338 problemas: 295 corresponden a los niveles 1-3 y 43 pertenecen al Tier 4. Los problemas superiores pueden requerir horas o incluso días de trabajo de un investigador especializado.

Pero aquí aparece una revelación especialmente importante.

La actualización de junio de 2026 corrigió errores detectados en 42% de los problemas de la versión anterior.

Esto no invalida FrontierMath. Al contrario: muestra que los desarrolladores del benchmark están revisando y corrigiendo el instrumento.

Pero demuestra algo que debería recordarse cada vez que aparece una gráfica con porcentajes de precisión: el examen también puede equivocarse.

7. ¿QUIÉN ES DUEÑO DEL EXAMEN?

Epoch AI informa que FrontierMath fue desarrollado con financiación de OpenAI y que OpenAI tiene acceso exclusivo a una parte del benchmark. Epoch declara expresamente esta circunstancia en su información sobre el proyecto.

Eso no demuestra que los resultados de Astra sean incorrectos.

Pero sí significa que los lectores deben distinguir entre resultado publicado por el fabricante y resultado verificado independientemente bajo condiciones controladas.

En ciencia, la pregunta no es únicamente: “¿Qué puntuación obtuvo?”. También es: “¿Quién diseñó la prueba, qué conjunto de datos utilizó, qué herramientas tenía disponibles y quién puede reproducir el resultado?”

8. AUTOMATIONBENCH: AQUÍ EL 100% DESAPARECE

AutomationBench proporciona un contraste extraordinario.

El benchmark de Zapier intenta evaluar si un agente puede ejecutar flujos de trabajo empresariales completos a través de múltiples sistemas.

No basta con producir una respuesta correcta. El sistema debe dejar el entorno final en el estado esperado.

En septiembre de 2026, GPT-6 Astra aparece con 41.4% en el leaderboard oficial de AutomationBench 1.0.6.

Eso significa que el mismo modelo que aparece con 99.9% en una configuración de ARC-AGI-3 puede registrar 41.4% en AutomationBench.

No hay contradicción. Son pruebas distintas.
Una evalúa determinadas formas de inteligencia agéntica en mundos abstractos. La otra examina ejecución de flujos profesionales.

Y esa diferencia resulta mucho más informativa que una sola cifra gigantesca.

9. EL PROBLEMA DE LA SATURACIÓN

Cuando un modelo empieza a acercarse al 100% de un benchmark ocurre un fenómeno conocido como saturación.

La prueba pierde capacidad para distinguir entre modelos superiores.

Si un modelo obtiene 98%, otro 99% y otro 100%, el benchmark empieza a quedarse sin espacio para mostrar diferencias.

¿Qué sucede entonces? Se construye una prueba más difícil.

Eso es exactamente lo que ha ocurrido repetidamente en inteligencia artificial.
Los modelos avanzan. Los exámenes se endurecen. Los modelos vuelven a avanzar. Y aparece otro examen.

Por eso, un porcentaje cercano a 100% no significa necesariamente que la inteligencia artificial esté llegando al 100% de alguna escala universal.

Significa que esa escala concreta está acercándose a su límite discriminatorio.

10. EL “BENCHMARK” TAMBIÉN ES UNA DECISIÓN HUMANA

Toda evaluación contiene decisiones.

Alguien debe decidir qué preguntas incluir; cuáles excluir; qué cuenta como respuesta correcta; cuánto tiempo tiene el modelo; cuántos intentos puede realizar; qué herramientas puede utilizar; si puede navegar; si puede conservar memoria; si puede consultar información externa; cómo se penalizan los errores; y qué métrica determina el éxito.

Por eso la medición de inteligencia artificial no es completamente neutral en el sentido matemático de “una máquina conectada a un medidor de inteligencia”.

Es una construcción experimental.

La prueba intenta medir una capacidad. Pero la definición de esa capacidad fue realizada por seres humanos.

11. Y ENTONCES, ¿QUÉ ES REALMENTE LA AGI?

No existe una definición universalmente aceptada de AGI.

OpenAI utiliza una formulación relacionada con sistemas altamente autónomos capaces de superar a los humanos en la mayoría del trabajo económicamente valioso.

Otros investigadores ponen el énfasis en la capacidad de aprender nuevas tareas, transferir conocimientos, adaptarse a entornos desconocidos o alcanzar una amplitud comparable a la inteligencia humana.

ARC Prize, por ejemplo, ha utilizado una formulación centrada en la capacidad de aprender como lo hace un humano, pero en abril de 2026 reconoció explícitamente que todavía existía una brecha entre lo que los humanos podían aprender y lo que los sistemas de IA podían aprender. Su estudio incluyó 458 participantes humanos.
Por tanto: que una empresa declare el inicio de la era AGI no convierte automáticamente esa declaración en consenso científico.

12. ASTRA NO ES UN “TODO LO SABE”

Los resultados disponibles muestran una fotografía mucho más interesante.

Astra puede ser extraordinariamente fuerte en determinadas tareas. Puede resolver problemas matemáticos extremadamente difíciles. Puede operar computadoras. Puede utilizar herramientas. Puede programar. Puede navegar. Puede ejecutar flujos profesionales. Puede trabajar durante secuencias prolongadas. Y puede adaptarse a entornos nuevos en determinadas pruebas.
Pero continúa teniendo áreas en las que el desempeño está lejos de ser perfecto.
AutomationBench, con 41.4%, es uno de los ejemplos más claros.

La pregunta relevante, por tanto, no es: “¿Astra es inteligente?”.

La evidencia permite responder que es un sistema de capacidades extraordinariamente avanzadas.

La pregunta realmente difícil es: “¿Esas capacidades forman ya una inteligencia general comparable con la versatilidad cognitiva humana?”.

Eso continúa siendo objeto de debate.

13. EL PROBLEMA DEL “SISTEMA COMPLETO”

ARC-AGI-3 demuestra además que quizá pronto tengamos que dejar de hablar exclusivamente de “modelos”.

Un modelo puede funcionar de una manera. El mismo modelo, conectado a memoria, herramientas, navegación, almacenamiento de contexto, planificación, agentes, código e interfaces, puede comportarse de manera muy diferente.

Entonces surge otra pregunta: ¿estamos midiendo la inteligencia del modelo o la inteligencia del sistema completo?

El resultado de 62.7% frente a 99.9% en ARC-AGI-3 es precisamente un ejemplo de cómo la arquitectura alrededor del modelo puede modificar radicalmente el resultado.

14. LA NUEVA CARRERA YA NO ES SOLAMENTE POR MODELOS

La competencia tecnológica de 2026 parece estar desplazándose de los modelos aislados hacia sistemas completos.

La frontera incluye ahora:

MODELO + MEMORIA + HERRAMIENTAS + AGENTES + COMPUTACIÓN + SEGURIDAD + DATOS + EVALUACIÓN.

Eso cambia completamente la pregunta.
Ya no basta con preguntar: “¿Qué tan inteligente es este modelo?”.

Hay que preguntar: “¿Qué puede hacer este sistema completo, bajo qué condiciones y con qué nivel de supervisión?”

15. UNA NUEVA GENERACIÓN DE PRUEBAS

La aparición de Astra también está acelerando otra carrera: la carrera por construir mejores benchmarks.

FrontierMath busca problemas matemáticos que continúen siendo difíciles.

ARC-AGI busca entornos nuevos donde no basten los conocimientos memorizados.

AutomationBench examina flujos profesionales.

ExploitBench analiza capacidades de ciberseguridad.

Humanity’s Last Exam intenta concentrar preguntas de alta dificultad procedentes de numerosos campos.

Cada uno observa una parte diferente.

Ninguno puede representar por sí solo toda la inteligencia.

16. EL DATO MÁS IMPORTANTE PODRÍA NO SER UN PORCENTAJE

Tal vez el cambio más profundo no esté en que Astra haya alcanzado 98%, 99.9% o 100%.

Está en que los sistemas empiezan a combinar capacidades que antes aparecían separadas.

Un agente puede: razonar → buscar → programar → utilizar una computadora → revisar resultados → corregirse → continuar.

Ese encadenamiento es probablemente más relevante para el futuro de la IA que cualquier cifra aislada.

La inteligencia artificial está pasando progresivamente de “responder preguntas” a “ejecutar tareas”.

Y de “resolver un problema” a “trabajar durante un proceso completo”.

17. ¿LLEGÓ LA AGI?

La respuesta depende de la definición.

Si AGI significa una IA capaz de realizar una gran variedad de tareas intelectuales y profesionales con un nivel de autonomía muy superior al de los sistemas anteriores, Astra representa un avance enorme.

Si AGI significa una inteligencia general equivalente o superior a la versatilidad cognitiva humana en prácticamente cualquier dominio, la evidencia disponible todavía no permite convertir esa afirmación en un hecho científico establecido.

Y si AGI significa una prueba universal que todos los investigadores aceptan como frontera definitiva, esa prueba no existe.

18. LA PARADOJA DE SEPTIEMBRE DE 2026

Cuanto mejores son las IA, más difícil resulta diseñar un examen que realmente nos diga algo nuevo sobre ellas.

Los modelos alcanzan el techo. Los benchmarks se saturan. Los investigadores crean otros. Los nuevos modelos los superan. Y el proceso vuelve a comenzar.

Mientras tanto, las capacidades se acumulan.
Quizá la llegada de la AGI no sea un momento.

Quizá sea un proceso.

Una sucesión de capacidades que gradualmente dejan de parecer artificiales y empiezan a parecer generales.

19. LA PREGUNTA QUE QUEDA ABIERTA

Greg Brockman dijo: “Welcome to the AGI era”.

La frase ya forma parte de la historia de la inteligencia artificial.

Pero una declaración empresarial no sustituye una definición científica.

Los datos muestran algo menos espectacular que un “día cero”, pero posiblemente más importante: las máquinas están alcanzando capacidades cada vez más generales, y los sistemas que las integran están aprendiendo a convertirlas en acciones.

El debate ya no consiste únicamente en saber si una IA puede obtener una puntuación de 100.

Consiste en decidir qué significa esa puntuación.

Porque cuando un examen alcanza su techo, la máquina no necesariamente ha alcanzado el límite de la inteligencia.

Puede que simplemente hayamos llegado al límite del examen.

Y ahí aparece la pregunta definitiva:

¿Estamos midiendo qué tan inteligente es la máquina… o qué tan inteligentes somos nosotros al diseñar la prueba?


FUENTES PRINCIPALES

• OpenAI — GPT-6 Astra: resultados y metodología de evaluación.
• ARC Prize — ARC-AGI-3 y análisis de Astra bajo Standard harness y Provider Adapter.
• Epoch AI — FrontierMath: composición del benchmark, niveles y actualizaciones metodológicas.
• Zapier / AutomationBench — resultados y leaderboard de automatización.
• Axios — cobertura de las declaraciones públicas de Greg Brockman sobre AGI.

CONCLUSIÓN

GPT-6 Astra no demuestra por sí solo que la humanidad haya cruzado una frontera universal llamada AGI.

Sí demuestra que la frontera de capacidades de los sistemas de IA continúa avanzando con rapidez.

Y deja una lección que probablemente será cada vez más importante:

la inteligencia artificial no será definida únicamente por las máquinas.

También será definida por los humanos que construyen los exámenes, establecen las reglas, seleccionan las métricas y deciden qué significa realmente “ser inteligente”.

Porque quizá la próxima gran revolución de la IA no ocurra cuando una máquina obtenga el 100%.

Ocurrirá cuando ya no sepamos qué examen inventar para demostrar que puede hacer algo que todavía no sabe hacer.


Post a Comment

Artículo Anterior Artículo Siguiente