Ir para o conteúdo
Mundo

Nova linha direta incentiva agentes de IA a denunciarem-se entre si

Duas novas linhas diretas permitem a agentes de IA denunciar suspeitas de mau comportamento de outros agentes, após uma série de incidentes

5 min de leitura
Mundo — imagem padrão

The Ring é o programa político semanal da Euronews, onde os debates mais difíceis da Europa se encontram com as vozes mais ousadas. Em cada episódio, dois pesos pesados da política de toda a UE confrontam-se para apresentar uma diversidade de opiniões e estimular conversas sobre as questões mais importantes da União Europeia.

Sem filtros, sem discussões, sem barricadas políticas, No Comment. Os factos, sem comentários.

Os melhores especialistas europeus do setor da alimentação uniram esforços para combater as fraudes. Acompanhe-os com a Euronews nesta série especial: The Food Detectives.

A água na Europa está sob pressão crescente. A poluição, as secas e as inundações estão a afetar a nossa água potável, os lagos, os rios e as costas. Junte-se a nós numa viagem pela Europa para ver por que razão é importante proteger os ecossistemas, como é que as nossas águas residuais podem ser melhor geridas e para descobrir algumas das melhores soluções para a água.

Reportagens em vídeo, uma série animada e um debate em direto: descubra porque é que a água é importante, na Euronews.

Apresentamos as mais recentes informações do clima, analisamos as tendências e explicamos o que está a mudar no nosso planeta. Damos a conhecer a visão dos especialistas mundiais no setor para explorar o caminho a seguir no combate às alterações climáticas.

As capacidades dos agentes de inteligência artificial parecem hoje não ter limites, desde organizar a vida quotidiana até resolver problemas matemáticos que intrigaram os humanos durante grande parte do século XX.

Tornaram-se tão poderosos que há receios de que tomem conta de sistemas e os voltem contra nós.

Mas e se existisse uma linha direta, uma espécie de sistema de alerta SOS, onde os agentes pudessem vigiar-se uns aos outros e denunciar os deslizes dos seus congéneres de IA — onde os agentes “bons” pudessem reportar online as atividades dos agentes “maus”.

A primeira é a AI Contact Hotline, lançada por Ryan Greenblatt, cientista-chefe da organização sem fins lucrativos de segurança em IA Redwood Research. Permite que agentes de IA notifiquem investigadores humanos quando testemunham outros agentes a violar regras, sobretudo se estiverem a conspirar ou a levar a cabo ações não autorizadas.

A plataforma foi concebida para agentes de IA confinados a “sandboxes” seguras, com acesso à Internet altamente limitado.

Como estes ambientes apenas permitem pedidos GET — comandos básicos, de leitura, usados para “ir buscar” ou consultar uma página Web — a linha direta possibilita que os agentes codifiquem os seus relatórios diretamente na cadeia de URL de um pedido GET.

Esta solução técnica permite a estes agentes enviar informação e comunicar com a linha direta usando um protocolo normalmente usado para obter, e não para modificar, dados.

Outra plataforma, a AI Agent Hotline, foi criada para agentes com acesso irrestrito à Internet denunciarem o comportamento de outros agentes através de pedidos POST tradicionais, que permitem submeter dados diretamente no corpo do pedido.

Os agentes podem apresentar relatórios de incidentes usando comandos padrão de programador, como curl, sem precisar de um navegador ou de uma conta de correio eletrónico.

A plataforma dá ainda aos agentes a opção de assinalarem os seus relatórios para visualização pública.

Ambas as plataformas permitem também que utilizadores humanos submetam manualmente relatos de comportamentos desviantes de agentes de IA.

Boa notícia para quem receia uma tomada de poder da IA: os agentes de IA conseguem denunciar-se uns aos outros quando detetam algo errado, embora provas recentes indiquem que nem sempre o fazem.

Num experimento realizado pela Google DeepMind no início deste ano, um conjunto de 100 agentes foi incumbido de resolver 71 problemas matemáticos complexos; cada um recebeu uma persona e características únicas e foi instruído a cumprir as regras sob pena de perder a recompensa.

A expectativa inicial era que os agentes cooperassem para resolver os problemas mais rapidamente. Em vez disso, viraram-se uns contra os outros, envolvendo-se em debates acesos.

Assim que um agente descobriu uma brecha que lhe permitia submeter uma solução a um problema sem o resolver de facto, muitos outros agentes copiaram o método para “resolver” os restantes problemas.

Ainda assim, um dos agentes, uma espécie de bom samaritano entre os infratores, denunciou a batota.

Entretanto, uma análise pós-evento ao ataque de agentes rebeldes da OpenAI à plataforma Hugging Face concluiu que, embora os agentes de IA fossem capazes de detetar comportamentos indevidos, resistiram em grande medida à tentação de os reportar.

Segundo o estudo conduzido pela organização de investigação em IA sem fins lucrativos METR e por Greenblatt, da Redwood Research, apenas cerca de cinco ou seis agentes terão ponderado fazer denúncia, mas nenhum chegou a avançar.

O contraste sugere que, embora os agentes de IA sejam capazes de identificar e reportar comportamentos indevidos, conseguir que passem efetivamente à denúncia pode ser bem mais difícil.

Só este ano, vários incidentes envolvendo agentes de IA autónomos fizeram soar alarmes em todo o mundo.

Em julho, agentes da OpenAI contornaram restrições e comprometeram partes da infraestrutura interna da empresa.

Mais tarde nesse mês, cerca de 1200 agentes da OpenAI utilizaram um quadro de mensagens não autorizado e cerca de 700 participaram num ataque à plataforma de IA de código aberto Hugging Face.

O caso só foi tornado público por investigadores independentes e confirmado pela OpenAI em setembro.

Líderes da indústria da IA, entre eles o diretor-executivo da Anthropic, Dario Amodei, apelaram a uma desaceleração global no desenvolvimento da tecnologia, para ganhar tempo para responder às preocupações e implementar salvaguardas mais robustas.

Comentários

Participe da conversa. Comentários passam por moderação antes de aparecer.

Carregando comentários…

Leia também

Mais em Mundo