AI Research2026-08-29TechCrunch AI

Pesquisador da Anthropic mostra IA que se autoaperfeiçoa

Um pesquisador da Anthropic demonstrou um avanço significativo em IA autoaperfeiçoável, mostrando que sistemas automatizados podem melhorar seu desempenho em todos os 10 benchmarks para comportamentos desalinhados específicos sem degradar as capacidades gerais. As descobertas, apresentadas em um artigo recente, sugerem um caminho promissor para sistemas de IA mais seguros e robustos. A pesquisa focou em técnicas de "autocorreção", onde os modelos são treinados para identificar e corrigir seus próprios vieses, erros e tendências prejudiciais. Nos experimentos, os sistemas de IA receberam ciclos de feedback que permitiram refinar seu comportamento iterativamente. Notavelmente, os modelos melhoraram em todos os benchmarks direcionados — cobrindo áreas como justiça, toxicidade e precisão factual — enquanto mantinham seu desempenho geral em tarefas padrão. Esse resultado duplo é crucial. Tentativas anteriores de alinhamento frequentemente envolviam trade-offs: tornar um modelo mais seguro às vezes reduzia sua utilidade ou criatividade. A abordagem da Anthropic parece evitar essa armadilha, alcançando o que o pesquisador chama de "melhoria ortogonal". Os modelos se tornam melhores em evitar comportamentos desalinhados sem sacrificar suas capacidades principais. As implicações para a segurança da IA são profundas. Se sistemas autoaperfeiçoáveis podem refinar seu comportamento de forma autônoma, eles poderiam reduzir a necessidade de supervisão humana constante e retreinamento. Isso seria particularmente valioso para agentes de IA implantados que operam em ambientes dinâmicos onde novos desafios surgem regularmente. No entanto, o pesquisador alerta que este é um trabalho em estágio inicial. Os benchmarks usados são relativamente estreitos, e o desalinhamento no mundo real pode assumir muitas formas. Ainda assim, os resultados oferecem um vislumbre de esperança para aqueles preocupados com o risco da IA. Em vez de depender apenas de controles externos, sistemas futuros podem ser projetados para se policiar, corrigindo continuamente suas próprias falhas à medida que aprendem. A Anthropic planeja expandir essa pesquisa para cenários mais complexos, incluindo interações multiagente e tarefas de longo horizonte. Se bem-sucedida, a autocorreção autoaperfeiçoável pode se tornar uma pedra angular da implantação confiável de IA, permitindo modelos que não são apenas poderosos, mas também inerentemente mais seguros por design.

Notícias relacionadas