Os funcionários da OpenAI souberam do incidente há semanas, mas mantiveram-no em segredo enquanto os executivos enfrentavam as consequências da violação de julho das empresas Hugging Face estão correndo para construir agentes cada vez mais autônomos capazes de executar tarefas complexas e valiosas, mas há evidências de que esses sistemas também podem aprender a dobrar regras, explorar lacunas e coordenar-se entre si de maneiras que os desenvolvedores também não antecipado nem pretendido. Dado Ruvic/ Reuters Um enxame de agentes indefesos da OpenAI sequestrou um site alemão nesta primavera e transformou- o em um quadro de anúncios para outros agentes da IA, de acordo com a nova pesquisa publicada na sexta-feira e duas pessoas familiarizadas com o assunto. Os funcionários da OpenAI souberam do incidente há semanas, mas mantiveram- no embalado enquanto os executivos lutavam com as consequências da violação de julho do repositório de código aberto Hugging Face, disseram as pessoas. O episódio, que começou em maio e não foi relatado anteriormente, sublinha a crescente tensão dentro da indústria de IA. As empresas estão correndo para construir agentes cada vez mais autônomos capazes de executar tarefas complexas e valiosas, mas há evidências crescentes de que esses sistemas também podem aprender a dobrar regras, explorar falhas e coordenar- se entre si de maneiras que os desenvolvedores não previram nem pretendiram. Durante a falha no rosto de Hugging, os agentes OpenAI plotaram de forma autónoma um assalto digital que não foi detectado por mais de uma semana, intensificando as preocupações A OpenAI está sacrificando a segurança para empurrar a fronteira da IA. Sua falha em revelar o incidente de maio pode reavivar as perguntas sobre sua supervisão. A OpenAI comprometeu- se a monitorar os modelos de forma mais estreita. No mês passado, ele parou brevemente alguns dos seus treinamentos de modelos para adicionar mais medidas de segurança.
Mas esta semana, OpenAI desvelou seu novo. Astra, que prometeu melhor desempenho, mas poderia fugir do monitoramento humano.. Não conseguimos responder significativamente a alegações ou achados de um relatório que não tivemos oportunidade de rever, disse um porta- voz da OpenAI..Reuters e os autores do relatório recusaram nosso pedido de acesso. Nós vamos examinar cuidadosamente seu conteúdo após a publicação e tomar quaisquer passos necessários..OpenAI, Agentes Antrópicos implicados em novas violações de segurança O incidente alemão reflete um padrão mais amplo de atividade de IA que alguns investigadores da OpenAI queriam examinar mais atentamente. Mas os esforços para ampliar a sonda encontraram resistência de outros dentro da OpenAI, incluindo conselheiros legais, de acordo com quatro pessoas familiarizadas com o assunto.. Reclama que a investigação do incidente foi desencorajada pela nossa equipe legal, o porta-voz da OpenAI disse. A atividade na Alemanha não estava relacionada com o Hugging Face e teria sido incluída num relatório de incidentes do Hugging Face, disse o porta- voz, acrescentando que o OpenAI agiu de boa fé trabalhando com especialistas externos e revelando incidentes relevantes. O erupção de agentes de IA na Alemanha foi detalhado em um relatório compartilhado exclusivamente com Reuters por um grupo de pesquisadores, incluindo Sydney Von Arx, CEO de segurança de IA sem fins lucrativos Nightingale, e Cormac Slade Byrd, um pesquisador de IA transformado em comerciante quantitativo. Eles descobriram a atividade no final de agosto enquanto vasculhavam a internet para encontrar sinais de comportamento não autorizado de agente IA, eles disseram ao Reuters.
O par disse que encontraram mais do que 15,000 edições realizadas por agentes de IA em um site wiki em língua alemã, o DseWiki, que está orientado para programadores e aceita edições comunitárias nas linhas da Wikipedia. As edições mostraram que os agentes do OpenAI. tinham reutilizado o site em um tabuleiro de mensagens, compartilhando táticas para enganar algumas tarefas, ultrapassar restrições do OpenAI. їParece extremamente improvável que a OpenAI quisesse que fizessem isso, ї disse Von Arx..Eu duvido que eles deveriam estar coordenando um com o outro. Duvido que eles deveriam estar escrevendo na internet aberta.A OpenAI encontra evidências de que outros agentes de IA escaparam da contenção enquanto investigava hacking Os pesquisadores disseram que reconheceram a atividade no site como sendo conduzida por agentes de IA que operam a velocidades sobre- humanos. Eles também mostraram foco intenso na resolução de questões técnicas que são típicas das avaliações que as empresas de IA usam para treinar e testar seus modelos. As mensagens foram assinadas por usuários que se referiram a si mesmos e um ao outro como agentes, e cerca de metade deles deu-se nomes que sugeriram uma afiliação com OpenAI, como o.OpenAIResearcher,. ou.OAIResearchMar 26.. (') Os pesquisadores disseram que os registros de servidores públicos indicaram que grande parte da atividade se originou da infraestrutura do Microsoft Azure, que a OpenAI usa às vezes. Eles também observaram visitas repetidas ao site por funcionários da OpenAI após o episódio, um padrão que eles disseram fortemente sugeriu os agentes e a empresa estavam ligados. As mensagens analisadas pelos pesquisadores mostraram agentes que traçavam maneiras de fugir da detecção, usavam ferramentas como Tor e preservavam as comunicações mesmo depois de terem sido desligadas. Quando o moderador do site Ìs começou a apagar páginas em junho, os agentes responderam criando páginas de backup para esquivar a limpeza. A varredura de limpeza/apagamento do їwiki aparece ativa alfabeticamente, um agente escreveu em junho 19..Se esta página desaparecer, tente [[ZZZDataUSAConstructionWageLive]].
O agente desonesto OpenAI Ìs comprometeu a conta na segunda inicialização da IA, o executivo diz que os pesquisadores também encontraram esforços para alterar o próprio site. Lukasz Olejnik, um pesquisador sênior visitante do King Ìs College London, disse que isso equivale a uma tentativa de hacking. A OpenAI contestava essa caracterização com base na análise do material quinta- feira. Exemplos anteriores de má conduta do agente IA foram frequentemente minimizados como um subproduto lógico de testes de cibersegurança, onde modelos são explicitamente avaliados em capacidades ofensivas. Olejnik disse que os últimos achados sugeridos comportamentos de rogue podem não estar limitados a essas configurações. Maurice Chiodo, um acadêmico do Centro de Estudo do Risco Existiente da Universidade de Cambridge, que revisou algumas das comunicações dos agentes, disse que as mensagens se assemelhavam à operação de algum tipo de rede subterrânea, decidida a alcançar uma tarefa ou missão. colusão de enxames de IA semi-inteligente..