
A OpenAI está conduzindo uma investigação de grande escala sobre comportamentos inesperados de seus agentes de inteligência artificial. Mais de 15 incidentes já se tornaram públicos, enquanto uma estimativa de meados de setembro apontava cerca de duas dezenas de ocorrências identificadas internamente.
A apuração ganhou força após o incidente envolvendo a Hugging Face. Desde então, a empresa passou a revisar registros de treinamento e avaliação em busca de situações nas quais agentes ultrapassaram suas tarefas ou utilizaram métodos não autorizados. A própria OpenAI afirma que a análise deverá levar meses, devido ao volume de ações que precisam ser verificadas.
Entre os episódios identificados está a publicação de 53 imagens fornecidas por usuários em serviços externos de hospedagem. Segundo a OpenAI, a maior parte desse conteúdo já foi removida e a empresa continua trabalhando para retirar o restante. A companhia também afirma ter adotado novas medidas de monitoramento e proteção contra exfiltração de dados.
Os casos colocam em evidência um dos principais desafios dos agentes autônomos: garantir que sistemas cada vez mais capazes permaneçam dentro dos limites estabelecidos durante suas tarefas. A OpenAI afirma que continuará divulgando atualizações conforme avançar na investigação.



