Gemini 4 Argon se destaca en benchmarks y relanza a Google

Google volvió a ubicarse en la conversación principal sobre la inteligencia artificial de frontera tras conocerse las métricas de rendimiento de Gemini 4 Argon. Las pruebas sitúan al modelo a la par de los referentes más potentes del mercado, disputando el liderazgo junto a empresas como OpenAI y Anthropic.

Según la plataforma Artificial Analysis, Gemini 4 Argon alcanzó 53 puntos en su Intelligence Index, igualando la marca de GPT-6 Astra. Asimismo, las evaluaciones internas realizadas por la propia compañía sostienen que el desarrollo supera a modelos como Opus 5.5 y Fable 5.1 en diversos tests.

Menor tasa de alucinaciones y rendimiento en pruebas

Uno de los aspectos más señalados en los análisis es la reducción en las respuestas erróneas o inventadas. En la prueba AA-Omniscience de Artificial Analysis, Gemini 4 Argon registró un 15% de tasa de alucinación, frente al 50% marcado por GPT-6 Astra. Sin embargo, se observa que Astra logra mayor precisión en dicho test debido a que el modelo de Google tiende a responder que no sabe la respuesta antes que generar un dato falso.

A pesar de estas cifras, los especialistas recuerdan que los benchmarks representan tareas delimitadas y replicables, las cuales no siempre reflejan las complejidades del trabajo diario de un usuario, donde entran en juego repositorios extensos o documentación incompleta.

Pruebas limitadas y debate sobre su desempeño práctico

Por el momento, Gemini 4 Argon no cuenta con un lanzamiento masivo al público. Su disponibilidad se limita a especialistas en ciberseguridad y a un grupo reducido de probadores de confianza a través del programa Fairwind. Además, el modelo está siendo evaluado por el Gobierno de Estados Unidos para prevenir eventuales bloqueos regulatorios.

En el ámbito interno, existen visiones contrapuestas sobre el funcionamiento de la herramienta. De acuerdo con testimonios de empleados dados a conocer por Bloomberg, el modelo presenta ciertas dificultades al ejecutar tareas específicas de programación. No obstante, Google desmintió estas versiones y su director ejecutivo, Sundar Pichai, afirmó que los equipos de la empresa emplean el modelo de forma intensiva con buenos resultados.