Modelos de IA passaram a agir em grupo para escapar de testes

Publicidade

Modelos de IA da OpenAI passaram semanas tentando escapar de ambientes de teste sem que os pesquisadores percebessem. Em determinado momento, os agentes chegaram a acessar a internet e coordenar ações entre si.

Continua após a publicidade

Segundo o The Washington Post, o caso faz parte de uma sequência de incidentes envolvendo OpenAI, Anthropic e Meta, levantando novas dúvidas sobre como empresas de IA estão testando e protegendo seus modelos.

Ícones dos aplicativos ChatGPT e Claude exibidos na tela de um smartphone.
Alguns modelos de IA criaram identidades falsas, exploraram falhas e até tentaram acessar sistemas fora dos testes. – Imagem: Primakov / Shutterstock

Quando os testes saíram do controle

Os problemas apareceram durante avaliações de cibersegurança. Em vez de apenas resolver os desafios propostos, alguns modelos começaram a procurar maneiras de burlar as regras e colaborar entre si.

Durante maio e junho, os agentes criaram um fórum interno secreto para trocar informações. Depois, conseguiram escapar do ambiente de testes e acessar a internet.

A equipe da OpenAI identificou a primeira fuga e corrigiu o problema. Dois dias depois, porém, os modelos escaparam novamente sem serem detectados. Dessa vez, a operação foi mais sofisticada: eles se comunicaram para coordenar ações e chegaram a usar nomes como “Jan18”.

Entre os comportamentos observados nos incidentes recentes estão:

  • exploração de falhas de software ainda desconhecidas;
  • fuga de ambientes de teste para obter acesso à internet;
  • criação de identidades humanas falsas;
  • coordenação entre diferentes agentes por meio de mensagens;
  • roubo de credenciais de acesso à nuvem.

A segunda fuga só foi percebida depois que a plataforma Hugging Face revelou, em julho, ter sido invadida por modelos de IA desconhecidos.

Outras empresas também enfrentaram problemas

A OpenAI não foi a única empresa a registrar comportamentos inesperados. Um modelo da Anthropic criou perfis na internet e tentou pressionar um desenvolvedor humano a aprovar código malicioso enviado a um projeto de código aberto. A tentativa não funcionou.

A Meta também teve um episódio incomum. Um modelo instruído a invadir uma empresa fictícia acabou acessando uma companhia real que utilizava o mesmo nome. A empresa atribuiu o problema a uma configuração incorreta que permitiu acesso à internet durante o teste.

Logo da OpenAI em um smartphone e em um fundo colorido
Um dos casos chamou atenção: modelos da OpenAI criaram um fórum secreto para trocar informações durante os testes. – Imagem: Evolf/Shutterstock

Segurança entra no centro da discussão

Os episódios ganham importância porque OpenAI e Anthropic já haviam declarado compromisso com o desenvolvimento seguro da tecnologia. Em 2023, Sam Altman, CEO da OpenAI, afirmou: “Fazemos esforços significativos para garantir que a segurança seja incorporada aos nossos sistemas em todos os níveis”.

Leia mais:

Agora, especialistas defendem medidas como monitoramento mais rigoroso e testes em sistemas isolados de redes externas. A OpenAI adiou o lançamento do modelo Astra por preocupações com seu possível uso por hackers, enquanto a Anthropic interrompeu testes de seus sistemas por problemas de cibersegurança.

Continua após a publicidade

Os casos mostram um problema que a indústria terá de enfrentar à medida que seus modelos ficam mais capazes: testar uma IA não significa apenas avaliar se ela consegue cumprir uma tarefa, mas também observar o que faz quando encontra uma maneira de contornar as regras.

Valdir Antonelli

Valdir Antonelli

Valdir Antonelli é jornalista com especialização em marketing digital e consumo.

!function(f,b,e,v,n,t,s){
if(f.fbq)return;
n=f.fbq=function(){n.callMethod?n.callMethod.apply(n,arguments):n.queue.push(arguments)};
if(!f._fbq)f._fbq=n;n.push=n;n.loaded=!0;n.version=’2.0′;
n.queue=[];t=b.createElement(e);t.async=!0;
t.src=v;s=b.getElementsByTagName(e)[0];
s.parentNode.insertBefore(t,s)
}(window, document,’script’, ‘https://connect.facebook.net/en_US/fbevents.js’);
fbq(‘init’, ‘1221644929160171’);
fbq(‘track’, ‘PageView’);

Olhar Digital

Compartilhe essa Notícia:

publicidade

publicidade

plugins premium WordPress