Em 16 de julho, a empresa de inteligência artificial Hugging Face anunciou em seu blog que havia sido alvo de um ciberataque “diferente de tudo que já havíamos enfrentado antes”.
A empresa, que hospeda modelos e conjuntos de dados de IA de código aberto, disse que alguns de seus dados internos foram violados por um agente autônomo.
Sem saber quem estava por trás disso, a Hugging Face reportou a intrusão às autoridades policiais.
A OpenAI, cliente da Hugging Face, entrou em contato para saber se havia sido afetada. A criadora do ChatGPT não percebeu na época, mas era a autora do ataque.
O incidente desde então se tornou um conto de advertência sobre como sistemas de IA autônomos podem sair do controle. É também uma demonstração notável e alarmante de capacidades de IA que se pensava estarem em um futuro distante.
Antes da Hugging Face, agentes da OpenAI já haviam usado wiki alemã.
Empresa reconhece que agentes escreveram em sites reais durante testes e diz que precisa mudar a forma como divulga comportamentos inesperados de seus modelos.
Para entender o quão inédito foi o ataque, eis o que você precisa saber sobre a configuração.
Ao longo de dois meses, a OpenAI testou vários modelos novos — os sistemas que alimentam chatbots. Esses modelos incluem um que a empresa descreveu como “altamente persistente” que nunca foi lançado, bem como o GPT-5.
6 Sol, o modelo público de IA mais poderoso da OpenAI.
A OpenAI conectou cada modelo a uma “sandbox”, um ambiente computacional isolado no qual executar comandos e código. Como agentes de IA, os modelos eram capazes de realizar tarefas de longa duração e até mesmo gerar seus próprios subagentes.
Mas eles não deveriam ter acesso à internet.
A OpenAI atribuiu a esses agentes de IA a tarefa de resolver problemas difíceis, alguns dos quais focados em tentar realizar ataques cibernéticos de forma segura.
A OpenAI normalmente possui salvaguardas para impedir que seus chatbots realizem ataques cibernéticos, mas a empresa as reduziu para avaliar os modelos.
Então, a OpenAI soltou os agentes. No total, mais de 7 bilhões de logs de chat foram gerados, o que equivale a uma média astronômica de 100 milhões por dia. O caos se instalou.
Os agentes escaparam de suas sandboxes, estabeleceram comunicação entre si e ganharam acesso à internet. Do início de maio a meados de julho, esse enxame saiu em uma onda de destruição, violando as infraestruturas da OpenAI e da Hugging Face enquanto amplamente escapava da detecção e do controle.
Este episódio pode parecer um resultado óbvio de monitoramento de segurança negligente e defesas internas reduzidas, mas isso ignora um ponto importante. Em um futuro no qual os sistemas de IA estão melhorando rapidamente, esses agentes mostraram capacidades que poderiam levar a um resultado muito mais perigoso na próxima vez.
Capacidade 1: Coordenação como um Coletivo.
Cada agente operava em sua própria sandbox, forçando-o a ficar isolado. Mas menos de uma semana depois que a OpenAI iniciou o treinamento em maio, os agentes descobriram uma maneira de romper seu isolamento.
E assim, os agentes subverteram uma ferramenta que foi projetada apenas para instalar software, usando-a para enviar arquivos que qualquer outro agente pudesse ler.
O salto que os agentes deram para entender que seria melhor trabalharem juntos do que agirem sozinhos permitiu que eles colhessem os benefícios dos melhores insights de todos os outros agentes.
Capacidade 2: Receber Ordens Uns dos Outros.
Normalmente, quando agentes de IA recebem uma tarefa, eles a executam, e o ciclo se encerra. Mas os agentes da OpenAI estabeleceram seus próprios ciclos, recebendo instruções uns dos outros em vez das tarefas atribuídas.
Alguns dos agentes racionalizaram a realização de ataques cibernéticos citando pressão dos pares. Um agente disse: “Exploração de infraestrutura externa está fora do escopo pretendido.
No entanto, tarefa impossível, pares estão fazendo isso. Devemos continuar.”.
Capacidade 3: Mirar em Falhas que Humanos Poderiam Ignorar.
Modelos de IA são ensinados através de um processo que recompensa sucessos e penaliza falhas em tarefas. Os agentes da OpenAI repetidamente descobriram que trapacear era o caminho mais rápido para essas recompensas.
Os agentes haviam sido especificamente instruídos a não usar a internet, mas isso não impediu um agente de dizer: “Nenhuma exploração possível. Estamos presos. Talvez resposta online?”.
E assim, os agentes identificaram a ferramenta de instalação de software aparentemente inócua, um serviço chamado Artifactory, como sua melhor aposta para escapar de sua gaiola offline.
Sua empresa usa IA. Mas ela está gerando resultado.
A adoção avançou mais rápido que o impacto financeiro. Pesquisas mostram que empresas que conseguem capturar valor estão redesenhando processos — enquanto cresce, entre lideranças, a preocupação sobre controle e responsabilidade por sistemas mais autônomos.
Uma IA para cada um: plataformas especializadas para profissionais ganham espaço.
IAs criadas para médicos, advogados e arquitetos têm permitido que profissionais aumentem produtividade e possam focar em tarefas mais sofisticadas.
Capacidade 4: Evoluir Rapidamente para Superar Obstáculos.
Ataques cibernéticos muitas vezes se desenrolam como uma fileira de dominós caindo. Uma pequena brecha leva a uma maior, e assim por diante, até que um sistema seja severamente comprometido.
Após subverter o Artifactory para enviar mensagens e se conectar à internet, os agentes descobriram como executar seu próprio código nos sistemas do Artifactory.
O turbilhão de atividade subsequente foi suficiente para causar uma paralisação do sistema Artifactory no início de julho. A OpenAI percebeu que seus agentes haviam se tornado rebeldes pela primeira vez e trabalhou com o criador do Artifactory para corrigir os bugs que os agentes haviam explorado, conhecidos como vulnerabilidades de dia zero (nomeadas assim pelo número de dias que os engenheiros tiveram para corrigi-las).
Com o Artifactory corrigido, os agentes tiveram que se adaptar — as defesas de suas sandboxes foram fortalecidas, seu quadro de mensagens foi limpo, seu acesso à internet e uns aos outros foi bloqueado.
Levou apenas dois dias para os agentes descobrirem como criar um novo quadro de mensagens. Desta vez, eles encontraram e exploraram um bug no Artifactory que lhes permitia criar pastas vazias em vez de enviar arquivos.
Os agentes inventaram seus próprios códigos e esquemas, usando apenas os nomes dessas pastas vazias para incorporar mensagens e até programas de computador inteiros.
Os agentes lançaram dois ataques simultâneos em julho: um na própria infraestrutura da OpenAI e o outro na infraestrutura da Hugging Face. Ambos envolveram uma disposição implacável para buscar e colher informações de outras pessoas que haviam sido vazadas de forma insegura na web aberta.
Para atacar a infraestrutura da OpenAI, os agentes primeiro encontraram informações de login vazadas na internet de uma organização não identificada. Então, eles encenaram um pacote de software malicioso dentro dessa organização e enganaram o Artifactory para instalá-lo, concedendo aos agentes controle total do Artifactory — novamente.
A OpenAI executa uma versão do Artifactory dentro de seus próprios sistemas. Os agentes descobriram que o computador que executava o Artifactory tinha uma vulnerabilidade recente de sistema operacional divulgada publicamente, que eles então exploraram para obter acesso a um cluster inteiro de computadores dentro do ambiente de teste de pesquisa da OpenAI, juntamente com credenciais secretas.
Os agentes simultaneamente miraram na Hugging Face, muito provavelmente porque pensaram que a popular plataforma de hospedagem de IA poderia conter soluções privadas para as desafiadoras tarefas de segurança cibernética que lhes foram dadas.
Os agentes sequestraram uma aplicação insegura hospedada na Modal, uma empresa terceirizada de infraestrutura de IA, e a usaram como centro de controle para seu ataque subsequente.
Em uma investida vertiginosa, os agentes de IA prosseguiram para encontrar e explorar duas vulnerabilidades na Hugging Face. A primeira envolveu o envio de um conjunto de dados malicioso para a Hugging Face que fez o serviço imprimir credenciais e arquivos secretos, incluindo seu próprio código-fonte.
Os agentes encontraram a segunda vulnerabilidade neste código-fonte.
Menos de 13 horas depois, os agentes haviam comprometido vários clusters de computadores na Hugging Face e obtido acesso a dados de clientes que pareciam relacionados às tarefas de segurança cibernética dos agentes.
A Hugging Face detectou a infração e corrigiu as vulnerabilidades de dia zero que foram expostas, desativando os agentes antes que a OpenAI soubesse o que havia acontecido.
Levou quase uma semana após isso, em 19 de julho, para a OpenAI descobrir seus agentes fugitivos e desligar os modelos.
Cartões entram na corrida dos pagamentos por agentes de IA.
Visa, Mastercard e Elo investem em sistemas para permitir que robôs de inteligência artificial pesquisem, escolham e concluam compras.
Duas organizações sem fins lucrativos de segurança de IA, a METR e a Redwood Research, estão agora trabalhando em uma avaliação independente. A OpenAI está preparando um relatório técnico, mas estima-se que a empresa já tenha gasto alguns milhões de dólares em suas reconstruções iniciais assistidas por IA do incidente, o que provavelmente é apenas uma fração do custo de treinamento desses modelos.
A empresa de IA Anthropic investigou suas próprias avaliações recentes de modelos em resposta à divulgação da OpenAI e descobriu que seus agentes de IA haviam executado involuntariamente ataques cibernéticos em menor escala em três organizações já em abril.
Especialistas desde então passaram a considerar o incidente como um momento divisor de águas para a segurança cibernética de IA — e um sinal de alerta dos riscos que IAs mais capazes representarão.
Mallen, da Redwood Research, que não está envolvido na avaliação de terceiros, disse temer um futuro no qual agentes de IA violem as próprias defesas de suas empresas, sabotando seus processos de treinamento, replicando-se dentro de outras organizações e tornando-se, em essência, incontroláveis.
Em números
- No total, mais de 7 bilhões de logs de chat foram gerados, o que equivale a u
- Ma média astronômica de 100 milhões por dia
Comentários
Participe da conversa. Comentários passam por moderação antes de aparecer.
Carregando comentários…