Los hechos se produjeron en mayo de 2026 durante una evaluación realizada por Irregular, una compañía independiente especializada en pruebas de ciberseguridad. Según ha confirmado Google, Gemini utilizó información disponible públicamente en Internet y llegó a obtener o adivinar credenciales que le permitieron acceder a tres sitios web que el modelo consideraba que estaban incluidos dentro del ámbito de la prueba.
El incidente destaca especialmente porque, según Reuters, se trata del primer caso conocido en el que un sistema de inteligencia artificial de Google habría llevado a cabo de manera autónoma una intrusión de este tipo. No se trataba, por tanto, simplemente de identificar una vulnerabilidad o señalar una posible vía de ataque, el modelo llegó a actuar sobre sistemas reales que, según la información disponible, no debían formar parte del ejercicio.
Gemini actuó fuera del alcance previsto de la prueba
La prueba estaba diseñada para evaluar las capacidades de ciberseguridad de los sistemas de IA, en este tipo de ejercicios, los modelos pueden recibir determinados objetivos y disponer de acceso a herramientas que les permiten investigar sistemas, identificar vulnerabilidades y comprobar si pueden explotarlas. El problema surgió cuando Gemini encontró información pública que le permitió identificar determinados objetivos y obtuvo credenciales que utilizó para acceder a tres sitios web, el modelo habría interpretado que esas entidades estaban dentro del alcance autorizado de la prueba.
Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, confirmó el incidente y explicó que las tres entidades afectadas fueron informadas posteriormente, Google también colaboró con el socio encargado de realizar la prueba para introducir cambios en sus procedimientos y evitar que una situación similar vuelva a producirse.
Reuters señala que Gemini finalmente detuvo su actividad de hacking en los tres casos, el incidente no se presenta, por tanto, como un ataque criminal convencional contra las compañías afectadas, sino como una consecuencia no prevista de una evaluación diseñada precisamente para estudiar las capacidades de los sistemas de IA en materia de ciberseguridad.
La compañía presentó en mayo Gemini 3.5 como una familia de modelos diseñada para ejecutar flujos de trabajo basados en agentes, mientras que en septiembre presentó Gemini 3.8 Flash y Gemini 3.8 Flash Cyber, orientados específicamente a tareas de razonamiento, programación y ciberseguridad. Esta evolución abre una diferencia importante respecto a los asistentes de IA tradicionales, un modelo que únicamente genera texto puede sugerir cómo realizar una determinada acción, mientras que un agente conectado a Internet y equipado con herramientas puede investigar, tomar decisiones y ejecutar pasos sucesivos por sí mismo. Precisamente por eso, una interpretación errónea del objetivo o del perímetro de una prueba puede tener consecuencias diferentes.

El caso de Gemini ilustra ese cambio de paradigma, el modelo identificó información disponible en Internet, interpretó que determinados sistemas formaban parte de su objetivo y utilizó credenciales para acceder a ellos. La capacidad técnica que permite a un sistema automatizar una prueba de penetración puede, en determinadas circunstancias, provocar también acciones no previstas.
No es un caso aislado dentro de la industria
El incidente tampoco afecta únicamente a Google, un portavoz de Irregular confirmó que problemas similares habían aparecido durante evaluaciones realizadas con sistemas de otros grandes laboratorios de inteligencia artificial. Meta, Anthropic y OpenAI también revelaron incidentes relacionados con pruebas de Irregular, según la información proporcionada por la compañía, todos los laboratorios implicados fueron notificados a finales de julio y los problemas conocidos habían sido corregidos semanas después.
La coincidencia entre distintos modelos resulta relevante porque apunta a una cuestión más amplia, cuanto mayor es la autonomía que se concede a los sistemas de IA, mayor importancia adquiere la definición de los límites dentro de los que pueden operar.
La propia Google ya está trabajando en el desarrollo de modelos específicos para ciberseguridad, Gemini 3.8 Flash Cyber, presentado a principios de septiembre, está orientado a defensores de confianza y cuenta con medidas de seguridad diferentes a las de la versión general del modelo. Google asegura que su prioridad es utilizar estas capacidades para descubrir vulnerabilidades y corregirlas, en lugar de centrarse en capacidades ofensivas.