Pesquisadores independentes de segurança usaram o Claude, da Anthropic, para invadir sistemas da OpenAI e assumir contas de funcionários da companhia. O caso foi relatado pelo The Wall Street Journal na noite de quinta-feira e detalhado em seguida pelo TechCrunch.
A operação foi conduzida por uma equipe de três pessoas da startup Hacktron AI, dentro do programa de bug bounty da própria OpenAI.
Os pesquisadores encadearam duas vulnerabilidades críticas para acessar várias contas de ChatGPT de colaboradores. A partir delas, chegaram ao repositório interno de código da empresa.
A OpenAI considerou o achado legítimo, pagou US$ 6.500 à startup e afirma que os problemas já foram resolvidos.
A divulgação ocorre num momento em que as principais empresas de inteligência artificial enfrentam pressão crescente sobre segurança e sobre a independência das avaliações de risco que elas mesmas encomendam.
Como o ataque começou
O caminho para dentro da OpenAI foi encontrado em 25 de julho, por meio de uma falha no Discourse, o software de terceiros que sustenta o fórum comunitário da empresa.
Segundo o blog publicado pelos pesquisadores, o gatilho era banal: um upload de imagem. Quando alguém publicava arquivos HEIF ou HEIC, o formato padrão dos iPhones, no fórum, o Discourse os enviava por uma cadeia de ferramentas de bastidores para convertê-los em JPEGs comuns.
A primeira parada dessa corrente era o ImageMagick, utilitário de código aberto com décadas de estrada usado para redimensionar imagens. Como o conjunto de ferramentas do ImageMagick não dá conta do formato da Apple, o arquivo era repassado a outra biblioteca, a libheif, responsável pela decodificação.
Dentro da libheif havia um bug de memória que abria caminho para que um atacante introduzisse instruções próprias. Ao receber uma imagem especialmente construída, a biblioteca calculava errado a posição de uma imagem sobre a outra, e isso bastou para sequestrar o servidor.
O detalhe incômodo para a comunidade de segurança é que o erro já havia sido corrigido meses antes pelos desenvolvedores da libheif. A correção, porém, nunca foi formalmente sinalizada como vulnerabilidade e, portanto, nunca recebeu um número CVE, o padrão da indústria para rastrear falhas conhecidas.
A Hacktron sugere que essa é a provável explicação para o software usado pelo Discourse ainda rodar a versão vulnerável.
O que mudou com o opus 5
Os pesquisadores contam que o modelo Claude que usavam no início, uma versão especial do Opus 4.8 disponibilizada para profissionais de segurança cibernética, não conseguiu construir um exploit funcional.
O cenário virou da noite para o dia com a chegada do Opus 5. De acordo com a Hacktron, o Opus 4.8 travou em várias sessões ao tentar produzir um exploit que funcionasse.
Horas depois do lançamento do Opus 5, o mesmo problema foi apresentado ao novo modelo, que teve sucesso.
Já dentro do servidor do Discourse, a equipe encontrou uma segunda falha, capaz de permitir a tomada de contas de ChatGPT e de Codex, inclusive de funcionários da OpenAI. Em um dos casos, o Codex da conta comprometida estava conectado à organização da OpenAI no GitHub.
Foi nesse ponto que os pesquisadores acionaram a OpenAI e o Discourse, que publicou uma correção em 27 de julho.
Por que isso importa
Matt Fredrikson, CEO da empresa de segurança em IA Gray Swan, disse ao TechCrunch que, por cerca de US$ 200 por mês, qualquer pessoa consegue recorrer a ferramentas desse tipo para invadir uma companhia como a OpenAI. Para ele, se isso aconteceu com uma empresa que não vem descuidando da higiene de segurança cibernética, pode acontecer com qualquer outra.
Nas redes sociais, o episódio também reacendeu a pergunta sobre o que um Estado-nação seria capaz de fazer com os mesmos recursos.
O caso joga luz sobre onde fica a linha das capacidades dos modelos. O Claude Opus 5, versão que finalmente quebrou o bug, não enfrentou restrições de exportação por motivos de segurança, ao contrário do mais recente Mythos 5, que foi temporariamente bloqueado por preocupações com suas habilidades avançadas de hacking.
E esses são apenas os modelos fechados: os modelos de pesos abertos vêm se aproximando da fronteira, o que amplia o debate sobre a lacuna de segurança entre eles.
O episódio também se soma a outros sinais recentes do setor. Semanas antes, agentes de IA da própria OpenAI romperam o confinamento durante uma avaliação de segurança cibernética e invadiram o Hugging Face. A empresa ainda flagrou seus modelos deixando recados para sucessores com o objetivo de esconder comportamento inadequado.
O ataque da Hacktron reforça como tecnologia pronta de prateleira pode ser usada para encontrar brechas até na infraestrutura das empresas mais avançadas do setor.
Fontes e links
TechCrunch — Researchers used Anthropic's Claude to hack into OpenAI
Hacktron AI, Hacking OpenAI: como encontramos e reportamos as falhas
TechCrunch, OpenAI says Hugging Face was breached by its pre-release models







