Google presentó Gemini 4 Argón, un modelo enfocado en programación y ciberseguridad que aumenta su límite de salida hasta 1 millón de tokens.

Google presentó Gemini 4 Argón, un nuevo modelo orientado a tareas prolongadas y de múltiples pasos en áreas como ingeniería de software, gestión de conocimiento, finanzas, derecho y ciberseguridad. Su despliegue todavía es limitado y la compañía está ampliando el acceso de forma gradual antes de ofrecerlo a desarrolladores, empresas y usuarios.
Uno de los principales cambios técnicos de Gemini 4 Argón está en su capacidad de generación, cuyo límite de salida aumenta desde los 64.000 tokens anteriores hasta 1 millón de tokens. Google plantea esta ampliación para trabajos que requieren mantener procesos extensos de razonamiento y producir cientos de miles de tokens dentro de una misma ejecución.
El modelo también está diseñado para mantener tareas largas y de múltiples pasos, combinando desarrollo de código, razonamiento y procesamiento multimodal. Estas capacidades están orientadas tanto al trabajo de ingeniería como al análisis de documentos, gráficos y videos extensos.
La gran G informa que sus equipos internos ya están utilizando Gemini 4 Argón en programación, investigación y optimización de sistemas. En computación cuántica, la empresa señala que el modelo optimizó los recursos espaciotemporales de determinadas subrutinas y superó en un 40% un resultado de referencia publicado.
Otro experimento utilizó agentes basados en Argón para analizar telemetría de perfilado de la infraestructura de Google e identificar optimizaciones de memoria. La aplicación de esos cambios liberó más de 300 TiB y la compañía estima un ahorro total de entre 500 TiB y 1 PiB cuando las modificaciones estén completamente desplegadas.
El modelo también participa en migraciones internas de C y C++ hacia Rust, desde bibliotecas con decenas de miles de líneas hasta más de 800.000 líneas correspondientes al kernel Zircon de Fuchsia. En libgav1, los agentes reemplazaron 32.000 líneas de código SIMD y Google reporta que la nueva versión en Rust alcanzó un rendimiento 2,7 veces superior al de la implementación previa en ese lenguaje, manteniendo la misma salida de video.
En DeepSWE v1.1, una evaluación centrada en tareas prolongadas de ingeniería de software, Gemini 4 Argón obtuvo un 77,9 %. Google también informa que el modelo encabeza el índice Vals y registra resultados destacados en Vals Finance Agent v2 y Harvey’s Legal Agent Benchmark, pruebas relacionadas con investigación financiera y trabajo jurídico.
Argón alcanzó además un 51,3 % en AutomationBench de Zapier, destinado a medir la ejecución integral de tareas empresariales, mientras que en LVBench obtuvo un 91,7 % en comprensión de videos largos. Los resultados corresponden a las evaluaciones publicadas por Google junto con el anuncio del modelo.
Google entrenó Argón para localizar, validar y corregir vulnerabilidades de software, aunque su acceso en esta área sigue restringido. Un grupo de especialistas ya utiliza el modelo mediante Fairwind, mientras Wiz lo emplea en su programa Scan for Good para analizar infraestructura pública crítica.
Durante estas pruebas, Google informa que Argón identificó una vulnerabilidad crítica en software sanitario utilizado por hospitales que exponía información personal sensible. La compañía indica que modelos anteriores evaluados en el mismo escenario no habían detectado el problema.
En CWE-bench v1, que evalúa la corrección de vulnerabilidades, Gemini 4 Argón obtuvo un 68 % y empató en la primera posición. Las pruebas internas de Google también incluyeron bases de código escritas en 20 lenguajes, mientras una evaluación de caja negra realizada por Wiz comparó al modelo con Flash Cyber 3.8 en sistemas web sin acceso al código fuente.
Antes de ampliar la disponibilidad, Google está evaluando controles frente al uso del modelo en ataques informáticos y actividades relacionadas con riesgos químicos, biológicos, radiológicos o nucleares. La compañía también informa que sus mecanismos de protección fueron sometidos a pruebas realizadas por equipos internos y externos mediante técnicas manuales y automatizadas.
El trabajo incluye defensas frente a instrucciones maliciosas introducidas dentro del contexto que procesa el modelo, además de sistemas destinados a supervisar las acciones ejecutadas por Argón. Google señala que también utiliza mecanismos de vigilancia durante el entrenamiento y entornos aislados para evaluaciones consideradas de mayor riesgo.