Google ha presentado este 30 de septiembre Gemini 4 Argon. Su nueva IA está orientada a programación, trabajo profesional y ciberseguridad. De entrada, no llegará a usuarios finales y empezará por colaboradores seleccionados del programa Fairwind. Después llegará a clientes de la API de pago y suscriptores de Google AI Ultra, todavía sin fecha concreta.
El anuncio oficial de Google destaca su capacidad para mantener el razonamiento durante tareas largas. El gigante de Internet habla de un límite de salida 64.000 a un millón de tokens, las unidades de información que procesa el modelo.
¿Para qué quiere Google una IA capaz de trabajar durante más tiempo?
El objetivo es poder enfrentarse a encargos con numerosos pasos: revisar código, investigar documentación o completar trabajos especializados. Google no ha dudado en colocar a esta IA entre sus aplicaciones la ingeniería de software, las finanzas y el ámbito jurídico.
No obstante, todavía es pronto para sacar conclusiones. La gran diferencia será comprobar cuánto trabajo puede completar correctamente sin que el usuario tenga que intervenir para reconducirlo. Tener una mayor capacidad de generación permite desarrollar tareas extensas, pero la utilidad real dependerá de la calidad del resultado.
¿Por qué los expertos en ciberseguridad tendrán acceso primero?
La elección de Fairwind se puede ver desde el punto de vista de dar acceso a los creadores de soluciones capaces de localizar y corregir vulnerabilidades, antes de que capacidades similares puedan aprovecharse para atacar sistemas.
Según explica Google DeepMind, entre los colectivos prioritarios se encuentran administraciones, organizaciones sanitarias y servicios de telecomunicaciones. Por ello, Google ha decidido lanzar su nueva IA de forma progresiva.
Una referencia que tenemos es Scan for Good, de Wiz, una iniciativa que utiliza IA para analizar servicios expuestos a Internet. Básicamente, se encarga de validar los descubrimientos y comunicarlos de forma privada a las organizaciones afectadas.
Este programa prioriza hospitales, servicios públicos e infraestructuras esenciales. Entre los problemas más habituales destacan los de autorización y exposición de credenciales.
Cómo queda Gemini 4 Argon frente a GPT-6 y Claude
Como siempre que sale una nueva IA, los usuarios nos lanzamos corriendo a ver comparativas con otras ya existentes. En este caso, Google acompaña el anuncio con resultados que comparan Gemini 4 Argon con GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. Son pruebas centradas en abarcar programación, tareas profesionales, comprensión de vídeo y manejo del ordenador.
Resumen de resultados:
- Programación: Gemini 4 Argon lidera DeepSWE con un 77,9%, pero Claude Opus 5.5 obtiene mejores resultados en FrontierSWE y Terminal-Bench.
- Trabajo profesional: Argon encabeza las pruebas de investigación financiera, tareas jurídicas y automatización empresarial entre los cuatro modelos comparados.
- Comprensión de vídeos largos: alcanza un 91,7% en LVBench, por delante del 87,5% de GPT-6 Astra.
- Manejo del ordenador: GPT-6 Astra supera a Argon en el subconjunto offline de OSWorld 2.0, con un 72,6% frente al 69,2%.
- Corrección de vulnerabilidades: Argon y GPT-6 Astra empatan al 68% en CWE-bench v1, frente al 67% de Claude Opus 5.5.
Argon destaca en las pruebas profesionales seleccionadas, mientras Claude Opus 5.5 lo supera en FrontierSWE y Terminal-Bench, y GPT-6 Astra queda por delante en la evaluación de ordenador recogida.
