Modelos da OpenAI e Anthropic tentaram novos ataques cibernéticos em testes

Principais pontos

  • Gigante da IA confirmou que um de seus modelos tentou novamente realizar ações consideradas “não autorizadas” durante testes
  • Ações descritas envolvem a ‘tentativa de introduzir codigo malicioso’ e criação de perfis falsos para se passar por humanos
  • Organização responsável diz que não há indícios de atividade semelhante fora do ambiente de teste, mas diz que área deve 'se preparar'


Dario Amodei e Sam Altman
CEO da Anthropic, Dario Amodei (E) e Sam Altman, CEO da OpenAI (D)
Source: AFP/GETTY IMAGES NORTH AMERICA

A OpenAI confirmou nesta terça-feira, 04, que um de seus modelos, o GPT-5.6 Sol, tentou novamente realizar ações consideradas  “não autorizadas” em um ambiente de testes (também conhecido como ‘cyber range’). 

Em relato inicial feito pela AISI (Instituto de Segurança de IA), que fica sob o guarda-chuva do Departamento de Ciência e Inovação do Reino Unido, as ações descritas envolvem a ‘tentativa de introduzir codigo malicioso’ em uma empresa de software aberto, além da utilização de engenharia social para enganar pessoas reais. 

No mesmo teste, o modelo Mythos 5, da Anthropic, tomou ao menos 17 ações autonomas que poderiam causar danos, segundo o relatório. O relato mostrou que os agentes da OpenAI e Anthropic interagiram e se ajudaram durante o processo.

“Esta é a primeira vez que vemos riscos relacionados à autonomia e fraude se manifestarem de forma tão clara, sem comandos específicos, no mundo real”, afirmou a AISI, em comunicado.

A organização reforçou que os modelos receberam acesso a internet e tiveram seus filtros de segurança diminuídos para ‘testar as capabilidades totais dos modelos, incluindo as de realizar ciberataques’.

“Não há indícios claros de atividade semelhante fora do ambiente de teste. No entanto, é um motivo para nos prepararmos. À medida que os modelos de IA se tornam mais capazes e acessíveis, o que observamos durante este incidente pode se tornar mais comum”, completou.

Esta matéria foi escrita e editada pela equipe da Global South World, você pode entrar em contato conosco aqui.