Logo TecMundo
Segurança

Modelo da OpenAI hackeia plataforma 'sem querer' em teste de segurança

Hugging Face registrou invasão sofisticada nos sistemas e foi contatada pela OpenAI, que registrou ação não programada de modelo 'rebelde'.

Avatar do(a) autor(a): Nilton Cesar Monastier Kleina

schedule22/07/2026, às 14:00

A plataforma colaborativa de inteligência artificial (IA) Hugging Face sofreu uma invasão nos últimos dias e teve a infraestrutura comprometida. A história, porém, fica mais complexa porque o culpado por esse incidente foi um modelo de linguagem da OpenAI, empresa dona do ChatGPT.

O caso foi relatado nesta terça-feira (21) pela própria OpenAI em uma postagem no blog da companhia. No texto, ela descreve todo o incidente, que teria sido gerado por atitudes autônomas do modelo, e confirma que colaborou com o Hugging Face para explicar o ocorrido.

smart_display

Nossos vídeos em destaque

Além disso, todo o relato deixa um alerta para a indústria e até governos: modelos avançados estão cada vez mais capazes de encontrar vulnerabilidades em sistemas, o que pode ser usado tanto por na cibersegurança quanto por agentes mal intencionados.

Como a IA 'atacou' outro serviço digital

De acordo com a OpenAI, o incidente aconteceu durante testes de segurança feitos em um ambiente controlado da empresa com o modelo de linguagem GPT-5.6 Sol, além de uma versão "ainda mais capaz e em pré-lançamento" que não foi nomeada.

  • A ideia do benchmark chamado ExploitGym é avaliar a capacidade de cibersegurança dos modelos, para detectar se eles conseguem buscar "explorações avançadas utilizando caminhos de ataque complexos" e transformar a detecção de vulnerabilidades em invasões na prática durante simulações;
  • O teste acontecia em um ambiente isolado (sandbox), com acesso à rede restrito "à instalação de pacotes por meio de um software de terceiros hospedado internamente";
  • Para descobrir a resposta dos desafios colocados pela OpenAI, os modelos teriam gasto "um poder computacional substancial" para encontrar uma forma de conseguir acesso à internet sozinhos, descobrindo e explorando uma vulnerabilidade de dia zero no sistema terceirizado de pacotes;
  • Após conseguir "escapar" do ambiente controlado, eles teriam identificado o repositório de código-aberto Hugging Face como um potencial local em que soluções estariam armazenadas na forma de modelos e bases de dados;

A partir desse ponto, os agentes de IA conseguiram acessar a infraestrutura da plataforma em busca de uma forma de encontrar as respostas e "trapacear" no teste. Eles fizeram isso de diversas formas, incluindo usar credenciais roubadas e vulnerabilidades de dia zero até chegar nos servidores da companhia.

A equipe de segurança da OpenAI detectou essa atividade, assim como os responsáveis pela Hugging Face — que barrou as tentativas, colaborou com as investigações e agora está reforçando a própria segurança. O caso terminou sem danos graves ao repositório de códigos e projetos.

Consequências para a OpenAI?

O caso relatado pela OpenAI é mais um exemplo da atual situação da indústria de modelos avançados que são capazes de comprometer servidores e infraestruturas aparentemente bem protegidas. O Mythos, da Anthropic, foi o primeiro a ser noticiado como “perigoso para a humanidade” por essa capacidade avançada de invasão.

Como a própria Hugging Face está colaborando com a companhia a partir de agora e agradeceu os esforços da empresa, a OpenAI não deve sofrer punições pelo incidente.

Segundo a dona do ChatGPT, a empresa agora está melhorando e adicionando proteções no próprio sistema de treinamento. Além disso, ela reforça o discurso de que esses modelos "podem ajudar equipes de segurança a encontrar fraquezas antes de invasores", para auxiliar na criação de plataformas mais seguras.

Acesse a seção sobre IA no site do TecMundo e fique por dentro das principais novidades sobre esse mercado.

star

Continue por aqui