Google ha presentado Gemini 4 Argon, un modelo que no busca ser el más rápido ni el más barato, sino el más capaz de sostener tareas complejas durante periodos prolongados. Su característica más llamativa es clara: un límite de salida de 1 millón de tokens en una sola generación, frente a los 64.000 tokens de versiones anteriores.
Pero Argon no es solo una cifra. Está diseñado para trabajo cognitivo de alta exigencia: ingeniería de software, derecho, finanzas, ciberseguridad y flujos empresariales de varios pasos. Y su lanzamiento no será masivo: Google ha optado por una estrategia por fases, empezando por defensores de ciberseguridad de confianza.
A continuación, analizamos qué ofrece Argon, dónde destaca, qué límites reconoce Google y por qué su llegada al público aún depende de validación en escenarios reales.
1 millón de tokens de salida: qué significa realmente
La cifra más repetida es la de 1 millón de tokens de salida. Es importante entender que no se trata del contexto de entrada, sino de cuánto puede generar el modelo en una sola respuesta o trayectoria de tarea.
- Antes: 64.000 tokens de salida.
- Ahora: 1.000.000 de tokens de salida.
- Referencia del sector: muchos modelos frontera rondan los 128.000 tokens de salida.
Este salto permite que el modelo razone durante más tiempo sin cortarse, genere documentos extensos, migre grandes bases de código o complete investigaciones profundas en una sola ejecución. Está pensado para tareas que no caben en una respuesta breve: migraciones masivas, análisis legales complejos, automatizaciones empresariales de múltiples pasos.
Rendimiento: los números que Google destaca
Google ha publicado una batería de evaluaciones donde Argon obtiene resultados líderes. Estos son los más relevantes:
| Evaluación | Resultado |
|---|---|
| DeepSWE v1.1 (ingeniería de software) | 77,9 % |
| Vals Index (trabajo empresarial: finanzas, programación, legal, impuestos) | 1.º puesto |
| Zapier AutomationBench | 51,3 % |
| LVBench (comprensión de vídeo largo) | 91,7 % |
| CWE-bench v1 (reparación de vulnerabilidades) | 68 % (empate en 1.º puesto) |
Además, Argon lidera en Vals Finance Agent v2 y Harvey Legal Agent Benchmark, lo que refuerza su enfoque en conocimiento especializado. También se insiste en su capacidad visual: análisis de gráficos profesionales, comprensión de vídeos largos y actuación a partir de múltiples documentos.
Ya se usa dentro de Google
Argon no es solo un anuncio. Google afirma que miles de empleados ya lo utilizan en tareas diarias: depuración de código, diseño de algoritmos y migración de grandes bases de código.
Algunos casos concretos:
- Computación cuántica: Argon ayudó a optimizar el uso de recursos espacio-temporales en algoritmos cuánticos. En una prueba, mejoró un resultado de referencia publicado en un 40 % en pocos minutos.
- Optimización de memoria en centros de datos: el agente analizó datos de monitorización y aplicó mejoras que ya han liberado más de 300 TiB de memoria, con una previsión de ahorro total de entre 500 TiB y 1 PiB.
- Migración de C/C++ a Rust: participó en la migración de bibliotecas clave como re2 y libgav1, y llegó hasta el núcleo Fuchsia Zircon, con más de 800.000 líneas de código. Estos cambios siguen pasando por auditorías automáticas, revisión humana y pruebas de simulación.
- libgav1: reescribió unas 32.000 líneas de código SIMD. La nueva versión en Rust, manteniendo la misma salida de vídeo, es 2,7 veces más rápida que la versión Rust original.
Ciberseguridad: el primer campo de pruebas
Google ha puesto el foco en la ciberseguridad como uno de los primeros dominios de aplicación. Argon es capaz de descubrir, validar y reparar vulnerabilidades críticas de forma autónoma.
La compañía de seguridad Wiz ya ha utilizado Argon a través del programa Scan for Good para revisar infraestructura pública de forma gratuita. Google destaca que Argon encontró una vulnerabilidad grave en software médico usado en hospitales de todo el mundo, que podía exponer información personal sensible y que modelos frontera anteriores no habían detectado.
En pruebas internas con 20 lenguajes de programación y en pentesting de caja negra sin código fuente, Argon superó a Gemini 3.8 Flash Cyber.
Seguridad y mitigación de riesgos
Un modelo con estas capacidades exige controles proporcionales. Google afirma que Argon:
- Restringe solicitudes relacionadas con ataques informáticos y abusos de tipo químico, biológico, radiológico y nuclear.
- Aplica monitorización de activaciones internas, red teaming automatizado y evaluación humana.
- Se protege contra inyección indirecta de prompts mediante entrenamiento adversarial y pruebas automáticas.
- Cuenta con monitorización de desalineación, que sigue el razonamiento y las acciones del modelo, puede abortar tareas y aísla entornos de entrenamiento y evaluación de alto riesgo.
La letra pequeña: dudas internas y brecha con la realidad
A pesar de los buenos resultados en benchmarks, no todo es unanimidad. Bloomberg ha informado de que dentro de Google existen dudas sobre el rendimiento de Gemini 4 en tareas clave como la programación. Empleados habrían señalado que, aunque el modelo destaca en evaluaciones estandarizadas, algunas tareas de código no se completan de forma consistente en el uso real.
Esto recuerda una lección habitual en IA: las métricas no siempre reflejan la experiencia cotidiana. Argon tendrá que demostrar en escenarios reales que su capacidad de razonamiento prolongado se traduce en resultados fiables.
Disponibilidad y precios
El despliegue de Argon será escalonado:
- Fairwind Program: primeros accesos para defensores de ciberseguridad de confianza.
- Clientes de API de pago y suscriptores de Google AI Ultra.
- Apertura progresiva a desarrolladores, empresas y consumidores.
En cuanto al precio, la API de Argon arranca con:
- 2 dólares por millón de tokens de entrada.
- 10 dólares por millón de tokens de salida.
- Tokens de entrada en caché un 95 % más baratos que la entrada estándar.
Google también participa en el proceso voluntario de prepublicación promovido por el Gobierno de Estados Unidos, y los primeros probadores ayudarán a evaluar el modelo y a reforzar sus protecciones.
Conclusión
Gemini 4 Argon es una apuesta por una dimensión distinta de la carrera de IA: no solo contexto, sino capacidad de generar y sostener tareas largas. Su millón de tokens de salida, sus resultados en software, derecho, finanzas y ciberseguridad, y su uso interno en Google lo colocan como un modelo ambicioso y orientado a la empresa.
Pero su éxito final dependerá de algo más que los benchmarks: que en el trabajo real sea tan fiable como promete. La brecha entre evaluación y experiencia cotidiana sigue siendo el gran desafío. Argon ha llamado la atención; ahora toca demostrar que puede mantenerla.
Descubre más desde CIBERED
Suscríbete y recibe las últimas entradas en tu correo electrónico.


