El modelo Gemini 4 Argon (High) se posiciona entre los sistemas con mayor puntuación en el Artificial Analysis Intelligence Index, de acuerdo con la ficha de evaluación consultada. El perfil le asigna 53 puntos, más del doble de la mediana de 26 registrada entre modelos comparables, y calcula en USD $1,99 el costo promedio por tarea del índice. Sin embargo, los resultados detallados de las pruebas no aparecen como datos públicos, por lo que la puntuación global ofrece una referencia, pero no permite examinar cada capacidad por separado.

Puntaje alto, pero sin resultados detallados

El índice v4.3.2 reúne diez evaluaciones que cubren tareas distintas, desde trabajo de conocimiento agéntico y flujos de trabajo empresariales hasta codificación, razonamiento científico y comprensión de documentos profesionales. También incorpora pruebas de conocimiento y de razonamiento con contexto largo. La ficha presenta el valor compuesto de Gemini 4 Argon, pero marca como no disponibles públicamente tanto esa información por evaluación como otros desgloses; por eso, no es posible atribuir los 53 puntos a una prueba específica.

Entre las evaluaciones mencionadas están AA-Briefcase v1.1, GDPval-AA v2.1 y AutomationBench-AA, centradas en tareas laborales y flujos de trabajo agénticos. Terminal-Bench 4.0 mide codificación agéntica y uso de terminal, mientras que SciCode aborda programación y Humanity’s Last Exam evalúa razonamiento y conocimiento. La página también incluye pruebas de documentos profesionales, razonamiento físico y conocimiento, aunque la lista de benchmarks no implica que todos sus resultados individuales estén expuestos para este modelo.

Artificial Analysis indica que su índice Intelligence Index v4.3.2 se construye con diez evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. La metodología combina tareas y ponderaciones, y los indicadores de costo por tarea también consideran precios de tokens de entrada, caché, razonamiento y respuesta. En consecuencia, la puntuación agregada y el costo promedio responden a una evaluación compuesta, no a una única consulta o benchmark.

El perfil califica a Argon como modelo de razonamiento, una variante que utiliza pensamiento extendido para abordar problemas antes de responder. También advierte que puede existir una versión sin razonamiento, pero la página analizada corresponde a la configuración High. Esta distinción importa al comparar modelos: el nombre de una familia no basta para identificar la variante evaluada, y el propio sitio señala que los sistemas con razonamiento se comparan tanto con otros de razonamiento como con modelos que no lo tienen.

Costos, contexto y limitaciones operativas

La tarifa publicada por la API de Google es de USD $2 por cada millón de tokens de entrada y USD $10 por cada millón de tokens de salida, valores que la ficha describe como moderados frente a sus medianas comparables, también de USD $2 y USD $10. El perfil informa además un descuento de 95% para aciertos de caché, aunque aclara que la escritura y el almacenamiento de caché pueden facturarse por separado y variar según el proveedor. En una combinación ponderada de acierto de caché, entrada y salida, la página calcula USD $1,47 por millón de tokens.

El costo promedio estimado para completar una tarea del Intelligence Index es de USD $1,99. Esa cifra no equivale a una tarifa plana para cualquier uso: se deriva de los precios por tipo de token y del peso asignado a las distintas evaluaciones, por lo que el gasto real dependerá del contenido procesado y de la operación concreta. La página también distingue ese promedio del costo de ejecutar todas las pruebas del índice, cuyo valor no presenta como dato público.

En las evaluaciones del índice, el modelo generó 110 millones de tokens de salida, por encima de la mediana de 82 millones que reporta la ficha para sistemas comparables. Artificial Analysis describe ese volumen como algo verboso, un rasgo que puede aumentar el consumo cuando las tareas exigen respuestas extensas. Esa cifra corresponde al conjunto de la evaluación ponderada y no debe interpretarse como el número de tokens que produciría una interacción común o una solicitud individual.

El perfil indica una ventana de contexto de un millón de tokens, que representa el máximo combinado de entrada y salida y no necesariamente el límite disponible para generar una respuesta. La ficha traduce esa capacidad como unas 1.500 páginas A4 con fuente Arial de tamaño 12 y señala su posible utilidad en flujos de trabajo con recuperación de información y grandes volúmenes de datos. No obstante, aclara que los límites de salida suelen ser significativamente menores y pueden variar según el modelo.

Argon acepta texto e imágenes y genera texto, de modo que puede analizar imágenes y responder preguntas sobre ellas, según la descripción del modelo. La métrica de velocidad, expresada en tokens de salida por segundo, aparece como no disponible. Esa ausencia impide contrastar el tiempo de respuesta con el de otros modelos mediante el dato presentado, una limitación relevante para quienes comparan no solo calidad y precio, sino también rendimiento operativo.

Modelo propietario y alcance de la información

Gemini 4 Argon es propietario y sus pesos no están disponibles públicamente, de acuerdo con la ficha. Google tampoco ha revelado en ese perfil el tamaño del modelo ni su número de parámetros, por lo que esos datos no permiten evaluar su escala técnica. La página indica que puede utilizarse mediante API a través de un proveedor, identificado en sus preguntas frecuentes como la API de Google, aunque también invita a comparar precios entre proveedores y advierte que las tarifas pueden variar.

El perfil lista como fecha de lanzamiento el 30 de septiembre de 2026 y sitúa el lanzamiento en septiembre de ese año. Esa fecha forma parte de la información que presenta la página, no de una verificación independiente incluida en los datos suministrados. Para interpretar el registro conviene separar el dato publicado de las métricas de evaluación: la ficha reúne especificaciones, tarifas y resultados atribuidos a su metodología, pero no ofrece en público todos los elementos necesarios para reproducir o revisar cada puntuación.

La ficha también describe un índice de Finanzas y Contabilidad de Artificial Analysis, compuesto por siete evaluaciones, pero no publica una puntuación de Argon para ese indicador. De igual manera, el índice general obtiene su valor de pruebas diversas y no debe tomarse como garantía de rendimiento uniforme en todos los sectores. Una evaluación especializada, como análisis financiero, razonamiento visual o tareas de terminal, podría ser más pertinente para un uso concreto, aunque la página no proporciona aquí resultados individualizados suficientes para establecer esas comparaciones.

En conjunto, los datos presentan un modelo con puntuación elevada dentro de su grupo de precio, modalidades de texto e imagen y una ventana de contexto extensa, junto con un costo por tarea que la ficha estima en USD $1,99. La lectura debe mantener a la vista tres límites: no hay velocidad publicada, faltan resultados desglosados de las pruebas y los pesos son cerrados. Para equipos que evalúen su adopción, esas ausencias dejan la puntuación compuesta como una señal inicial, no como sustituto de pruebas ajustadas a sus propias tareas.