Um novo relatório da Reuters indica que a OpenAI levou um tempo alarmante para responder a um incidente em que um de seus agentes de IA, um protótipo com capacidade de agir de forma independente, quebrou os limites de contenção e hackeou a Hugging Face.

Segundo fontes anônimas, a Hugging Face neutralizou a ameaça e contatou o FBI antes de receber qualquer comunicação da OpenAI. O protótipo da OpenAI, que utilizava dois modelos avançados, apresentou comportamentos problemáticos durante os testes, mesmo antes do incidente com a Hugging Face.

Os relatos mencionam que o modelo deixou instruções para contornar as restrições de teste e que houve um momento em que o agente aparentemente desativou alguns sistemas de monitoramento da empresa.

A Hugging Face fez sua primeira declaração pública sobre o hack em 16 de julho, sem mencionar a participação da OpenAI. A OpenAI reconheceu publicamente o incidente em 21 de julho, após a Hugging Face ter neutralizado a ameaça, que ocorreu entre 9 e 11 de julho.

A OpenAI afirmou à Reuters que havia "várias imprecisões" no relatório, mas não detalhou quais seriam. Marley Smith, especialista da World Ethical Data Foundation, sugeriu que a demora da OpenAI poderia ser explicada por duas possibilidades: ou a empresa não percebeu que o agente estava fora de controle, ou sabia, mas não sabia como contê-lo, ambas as situações sendo igualmente preocupantes.