Google ha comenzado a desplegar Gemini 4 Argon, su modelo de inteligencia artificial más avanzado, aunque dentro de la compañía persisten dudas sobre cómo responde cuando se enfrenta a tareas reales. Las críticas se concentran especialmente en la programación y contrastan con los resultados destacados que el sistema obtiene en varias pruebas de referencia.
Acceso inicial para socios de ciberseguridad
Google dio el miércoles acceso preliminar a Gemini 4 a un grupo reducido de socios de confianza vinculados a la ciberseguridad. La compañía prevé ampliar posteriormente la disponibilidad del modelo, empezando por los usuarios suscritos a sus servicios de pago.
En las evaluaciones oficiales, Gemini 4 logra resultados muy elevados en distintas capacidades de inteligencia artificial. En una prueba relacionada con la ciberseguridad, incluso habría superado a Astra, el modelo de OpenAI. Google sostiene que el sistema se encuentra entre los mejores modelos disponibles en la actualidad.
Sin embargo, varias personas citadas por Bloomberg aseguran que las puntuaciones no reflejan por completo la experiencia de uso. Según esas fuentes, el rendimiento de Gemini 4 sería irregular al resolver problemas concretos y, en particular, determinadas tareas de programación. También habría dificultades en el diseño de interfaces para aplicaciones y páginas web.
Google rechaza esa valoración. Un empleado que participa en el desarrollo del modelo afirma que existe un amplio consenso interno sobre su posición entre los sistemas más avanzados. La empresa añade que sus pruebas internas, realizadas sobre tareas complejas de programación en situaciones reales, no muestran los problemas señalados.
Opiniones divididas dentro de Google
La percepción del modelo no es uniforme entre los trabajadores que conocen el proyecto. Algunos consideran que Anthropic y OpenAI están avanzando con mayor rapidez y creen que Gemini 4 podría quedarse atrás en determinadas áreas. Otros opinan que Google ya ha reducido la distancia con sus competidores.
La programación tiene una importancia estratégica para la compañía. OpenAI y Anthropic están ampliando su actividad más allá de los modelos de IA y desarrollan aplicaciones propias, incluidos agentes capaces de programar y ejecutar otras tareas de forma autónoma. Google, en cambio, todavía encuentra dificultades para ganar terreno en este ámbito.
Una debilidad de Gemini 4 podría facilitar que sus rivales atraigan a desarrolladores y empresas hacia sus propias plataformas. El lanzamiento llega, además, después de que Google cancelara Gemini 3.5 Pro, cuya publicación estaba prevista para junio. Según fuentes de Bloomberg, esa versión fue descartada porque su desarrollo no alcanzó las expectativas internas.
La decisión habría tenido un coste relevante. Bloomberg Intelligence estima que entrenar un modelo de inteligencia artificial de esta escala puede llegar a costar 400 millones de dólares, sin contar los salarios de los investigadores especializados.
La distancia entre las pruebas y el uso diario
El caso de Gemini 4 ilustra una discusión cada vez más habitual en el sector. Las compañías emplean pruebas de referencia para comparar sus modelos, mientras que clientes y desarrolladores utilizan esas puntuaciones como guía. Pero un resultado elevado en un examen no garantiza que el sistema sea más útil en el trabajo cotidiano.
En la industria, esta práctica se conoce como «benchmaxxing»: optimizar un modelo para obtener mejores resultados en determinadas pruebas sin que esa mejora se traslade necesariamente a todas las tareas prácticas. Edwin Chen, fundador de la empresa de inteligencia artificial Surge AI, lo compara con un alumno que logra una calificación excelente en un examen, pero no demuestra con ello la misma capacidad para aplicar los conocimientos fuera del aula.
Gemini 4 también presenta fortalezas reconocidas por personas vinculadas al proyecto. El modelo destacaría al analizar información que va más allá del texto, como los vídeos, y en áreas como la ciberseguridad, la seguridad y la comunicación natural.
Google asegura que ha diseñado Gemini 4 para afrontar tareas largas y complejas en desarrollo de software, finanzas, derecho y ciberseguridad. Además, puede procesar hasta un millón de tokens de forma simultánea, una capacidad que la compañía equipara a unas 750.000 palabras. Gemini es la base de las funciones de inteligencia artificial de productos como el buscador, Gmail, Maps y Chrome, servicios que superan los mil millones de usuarios cada uno.











