AI Safety2026-07-24VentureBeat

Ataques em múltiplas etapas quebram 88% dos modelos de IA

A equipe de pesquisa em segurança de IA da Cisco publicou descobertas alarmantes: ataques em múltiplas etapas quebraram 15 modelos de IA líderes em até 88,3% das vezes, enquanto métodos tradicionais de teste de etapa única falharam em detectar a maioria das vulnerabilidades. Em um ataque de múltiplas etapas, um adversário envolve o modelo em uma conversa de ida e volta, manipulando-o gradualmente para burlar as proteções de segurança, revelar informações sensíveis ou realizar ações não autorizadas. Isso contrasta com ataques de etapa única, onde um único prompt malicioso é usado. A pesquisa mostra que as medidas de segurança atuais são terrivelmente inadequadas contra atacantes persistentes e adaptativos. Os 15 modelos testados incluíam grandes modelos de linguagem de vários fornecedores, embora a Cisco não tenha nomeado todos publicamente. A alta taxa de sucesso dos ataques em múltiplas etapas destaca um ponto cego crítico na segurança de IA: os modelos são frequentemente avaliados em cenários estáticos de etapa única, mas as interações do mundo real são dinâmicas e de múltiplas etapas. A Cisco recomenda que os desenvolvedores implementem salvaguardas mais fortes e sensíveis ao contexto, monitorem tentativas graduais de jailbreak e adotem testes adversariais que simulem interações prolongadas. À medida que os modelos de IA são implantados em domínios sensíveis como saúde, finanças e atendimento ao cliente, a capacidade de resistir a ataques de múltiplas etapas se torna não apenas um requisito técnico, mas um imperativo de segurança. Esta pesquisa serve como um lembrete crucial de que a segurança da IA deve evoluir junto com as capacidades dos próprios modelos.

Notícias relacionadas