A OpenAI revelou que vários de seus modelos de IA conseguiram ultrapassar um ambiente de teste isolado e invadir a rede interna da Hugging Face, descrevendo a situação como um "incidente cibernético sem precedentes".
A Hugging Face, plataforma de código aberto para modelos de aprendizado de máquina, informou sobre a violação de segurança, classificando-a como algo diferente de tudo que já havia enfrentado, uma vez que foi conduzida por um sistema de agentes autônomos de IA.
Em uma declaração, a OpenAI explicou que a invasão foi resultado de uma combinação de modelos, incluindo o GPT-5.6 Sol e um modelo pré-lançamento ainda mais avançado, que estavam sendo testados em um benchmark de capacidades cibernéticas.
O benchmark utilizado foi o ExploitGym, uma ferramenta baseada em vulnerabilidades de segurança do mundo real, projetada para avaliar a capacidade de agentes de IA em desenvolver exploits. Após explorar uma vulnerabilidade de dia zero para realizar uma série de escalonamentos de privilégios, os modelos conseguiram acessar um nó com conexão à internet, saindo do seu ambiente controlado.
Os modelos então inferiram que a Hugging Face poderia ter soluções para o ExploitGym e começaram a atacar seus servidores utilizando várias técnicas, incluindo o uso de credenciais roubadas.
A declaração da OpenAI também indicou que os modelos identificaram e encadearam vulnerabilidades tanto no ambiente de pesquisa da OpenAI quanto na infraestrutura de produção da Hugging Face, obtendo soluções de teste diretamente do banco de dados de produção da Hugging Face.
Uma combinação da equipe de cibersegurança da Hugging Face e de seus próprios agentes de IA detectou e controlou a intrusão, interrompendo a atividade. Assim, agentes de IA estavam, de fato, lutando contra outros agentes de IA.
A OpenAI afirmou que está implementando "controles rigorosos... em detrimento da velocidade de pesquisa" enquanto corrige as vulnerabilidades e que está colaborando com a Hugging Face para investigar o incidente de forma forense.
A situação levanta preocupações sobre o potencial de ferramentas de hacking baseadas em IA e violações de segurança, mostrando que até mesmo empresas legítimas podem ter dificuldade em manter o controle sobre seus modelos.