AI Safety2026-07-31
MIT Technology Review
LLMs têm falha fundamental contra ataques de segurança
Um artigo inovador apresentado na Conferência Internacional sobre Aprendizado de Máquina (ICML) causou ondas de choque na comunidade de segurança de IA. Pesquisadores argumentam que grandes modelos de linguagem (LLMs) possuem uma falha arquitetural fundamental que os torna inerentemente vulneráveis a ataques, independentemente das salvaguardas aplicadas. O artigo demonstra sistematicamente que os próprios mecanismos que permitem aos LLMs gerar respostas coerentes e sensíveis ao contexto — como camadas de atenção e predição de tokens — podem ser explorados para contornar filtros de segurança, extrair dados de treinamento ou executar instruções maliciosas.
Os autores concluem que alcançar segurança total para LLMs é teoricamente impossível, pois qualquer medida defensiva pode ser contornada por um atacante com conhecimento suficiente do funcionamento interno do modelo. Isso desafia a abordagem predominante de corrigir vulnerabilidades após a implantação e sugere que a indústria pode precisar repensar sua dependência de LLMs para aplicações de alto risco. As descobertas têm implicações imediatas para a segurança de IA, particularmente em áreas como geração automatizada de código, consultoria financeira e diagnósticos de saúde. Embora o artigo não proponha uma solução completa, ele pede uma mudança de paradigma em direção ao design de modelos com a segurança como uma restrição central, e não como uma reflexão tardia. Para desenvolvedores e formuladores de políticas, esta pesquisa ressalta a necessidade urgente de arquiteturas alternativas e monitoramento robusto em tempo de execução.