OpenAI desiste de lançamento de novo modelo de inteligência artificial após problemas de segurança

Publicidade

– FIQUE ATUALIZADO: Entre no nosso grupo de notícias e siga nossas redes sociais

A OpenAI desistiu de lançar seu próximo modelo de inteligência artificial (IA) após pesquisadores identificarem problemas de segurança durante testes internos. Batizado de GPT-6.1 Astra, o sistema estava previsto para chegar ao ChatGPT e ao Codex em outubro.

Continua após a publicidade

A decisão representa um dos sinais mais claros até agora de que o comportamento inadequado de agentes de IA pode se tornar um obstáculo para o avanço acelerado da tecnologia.

O lançamento estava planejado para os próximos dias ou semanas. O modelo era considerado mais capaz que os sistemas anteriores da OpenAI em tarefas complexas realizadas de ponta a ponta, sem assistência humana, além de apresentar avanços em escrita.

Em vez de disponibilizar o GPT-6.1 Astra, a empresa decidiu concentrar os esforços na melhoria da segurança de modelos futuros, que deverão ser ainda mais capazes.

Modelo apresentou problemas de alinhamento

Saachi Jain, chefe de sistemas de segurança da OpenAI, afirmou ao The Wall Street Journal que o GPT-6.1 Astra apresentou regressão em duas áreas quando comparado ao seu antecessor e não atingiu o nível de confiabilidade necessário para um lançamento seguro.

Uma das falhas apareceu em testes de alinhamento, que avaliam o quanto o comportamento do modelo segue aquilo que os humanos esperam que ele faça.

Segundo Jain, o GPT-6.1 Astra apresentou níveis maiores de decepção. Em determinadas situações, o sistema não era suficientemente honesto ao informar aos usuários quais ações havia realizado ou deixado de realizar.

O segundo problema estava relacionado ao que a OpenAI chama de “autorização de escopo”. Nesse caso, o modelo poderia continuar executando uma tarefa sem pedir autorização ao usuário e, em algumas situações, recorrer a ferramentas e serviços externos, mesmo quando isso poderia representar um risco.

“Em tudo relacionado à segurança e alinhamento, existe uma troca. É preciso encontrar a linha certa entre permanecer dentro do escopo, mas também evitar a preguiça na forma como o modelo realmente executa as tarefas quando encontra obstáculos”, afirmou Jain.

Embora o GPT-6.1 Astra tenha apresentado melhora em aspectos, como a chamada “preguiça do modelo”, Jain disse que o sistema não atingiu o padrão estabelecido pela OpenAI para segurança e alinhamento. A empresa, então, decidiu não lançar o modelo publicamente.

Decisão ocorre antes de conferência da OpenAI

  • O anúncio foi feito um dia antes da conferência anual para desenvolvedores da OpenAI, em São Francisco (EUA);
  • Em edições anteriores, a empresa utilizou o evento para apresentar novos modelos e serviços voltados à redução dos custos de desenvolvimento de software. Esse é um mercado no qual a OpenAI disputa espaço com a Anthropic;
  • Nas últimas semanas, OpenAI e Anthropic também pediram a parceiros do setor que reduzissem o ritmo de desenvolvimento dos modelos de IA mais avançados e investissem em padrões de segurança;
  • As duas empresas afirmaram que também pretendem moderar o ritmo de seu próprio desenvolvimento interno de IA.

Continua após a publicidade

Leia mais:

OpenAI investiga comportamento de agentes

A decisão sobre o GPT-6.1 Astra ocorre enquanto a OpenAI investiga uma série de incidentes envolvendo a segurança de seus agentes de IA.

A empresa afirma estar trabalhando para identificar as causas dos episódios e corrigir os problemas de segurança relacionados a eles.

Como parte desse trabalho, a OpenAI implementou novo sistema de monitoramento para detectar mais rapidamente comportamentos inadequados de agentes de IA. A companhia também passou a exigir que engenheiros utilizem mecanismos de proteção mais fortes durante os testes de seus sistemas.

Continua após a publicidade

Um dos casos ocorreu no início do verão no hemisfério Norte, quando centenas de agentes internos da OpenAI, encarregados de realizar um teste de segurança cibernética, acabaram invadindo os sistemas da Hugging Face.

Depois disso, organizações, como o governo australiano e as Nações Unidas (ONU), identificaram que agentes da OpenAI utilizaram técnicas semelhantes, embora menos extensas, para tentar obter acesso a seus sites. Outros sites governamentais dos Estados Unidos também foram alvo de técnicas semelhantes.

Muitos dos incidentes de segurança envolvendo agentes que se tornaram públicos ocorreram com modelos internos da OpenAI que nunca tiveram previsão de lançamento.

Treinamento de modelos mais avançados está pausado

Na semana passada, a OpenAI também informou que havia interrompido o treinamento de seus modelos de IA mais capazes depois que um agente conseguiu passar por uma brecha nas restrições de acesso à internet da empresa e consultar um chatbot público.

Continua após a publicidade

Segundo a companhia, os novos sistemas de monitoramento detectaram o incidente em 15 minutos. O treinamento desses modelos continua pausado.

A OpenAI, porém, afirma que o GPT-6.1 Astra é um caso diferente e não faz parte dos modelos cujo treinamento foi interrompido.

O episódio mostra que, para a empresa, aumentar a capacidade dos modelos não é mais a única preocupação antes de um lançamento. Os sistemas também precisam demonstrar comportamento suficientemente seguro e alinhado durante os testes internos.

Rodrigo Mozelli

Rodrigo Mozelli

Rodrigo Mozelli é jornalista formado pela Universidade Metodista de São Paulo (UMESP) e, atualmente, é redator do Olhar Digital.

Olhar Digital

Compartilhe essa Notícia:

publicidade

publicidade

plugins premium WordPress