AI Research2026-08-29
TechCrunch AI
Anthropic: KI verbessert sich selbst
Ein Forscher bei Anthropic hat einen bedeutenden Durchbruch bei selbstverbessernder KI demonstriert: Automatisierte Systeme können ihre Leistung bei allen 10 Benchmarks für spezifische Fehlverhalten steigern, ohne die Gesamtfähigkeiten zu beeinträchtigen. Die Ergebnisse, die in einem aktuellen Paper vorgestellt wurden, deuten auf einen vielversprechenden Weg zu sichereren und robusteren KI-Systemen hin.
Die Forschung konzentrierte sich auf „Selbstkorrektur“-Techniken, bei denen Modelle trainiert werden, ihre eigenen Verzerrungen, Fehler und schädlichen Tendenzen zu erkennen und zu beheben. In den Experimenten erhielten die KI-Systeme Feedbackschleifen, die es ihnen ermöglichten, ihr Verhalten iterativ zu verfeinern. Bemerkenswerterweise verbesserten sich die Modelle bei jedem Ziel-Benchmark – darunter Bereiche wie Fairness, Toxizität und faktische Genauigkeit – während sie ihre allgemeine Leistung bei Standardaufgaben beibehielten.
Dieses doppelte Ergebnis ist entscheidend. Frühere Versuche des Alignments beinhalteten oft Kompromisse: Ein sichereres Modell zu machen, reduzierte manchmal seine Nützlichkeit oder Kreativität. Der Ansatz von Anthropic scheint diese Falle zu vermeiden und erreicht, was der Forscher „orthogonale Verbesserung“ nennt. Die Modelle werden besser darin, Fehlverhalten zu vermeiden, ohne ihre Kernfähigkeiten zu opfern.
Die Auswirkungen auf die KI-Sicherheit sind tiefgreifend. Wenn selbstverbessernde Systeme ihr Verhalten autonom verfeinern können, könnten sie den Bedarf an ständiger menschlicher Aufsicht und Umschulung reduzieren. Das wäre besonders wertvoll für eingesetzte KI-Agenten, die in dynamischen Umgebungen operieren, in denen regelmäßig neue Herausforderungen auftauchen.
Der Forscher warnt jedoch, dass dies frühe Arbeit ist. Die verwendeten Benchmarks sind relativ eng gefasst, und Fehlausrichtung in der realen Welt kann viele Formen annehmen. Dennoch bieten die Ergebnisse einen Hoffnungsschimmer für diejenigen, die sich um KI-Risiken sorgen. Anstatt sich nur auf externe Kontrollen zu verlassen, könnten zukünftige Systeme darauf ausgelegt sein, sich selbst zu überwachen und ihre eigenen Fehler kontinuierlich zu korrigieren, während sie lernen.
Anthropic plant, diese Forschung auf komplexere Szenarien auszuweiten, einschließlich Multi-Agenten-Interaktionen und langfristigen Aufgaben. Wenn dies gelingt, könnte selbstverbesserndes Alignment zu einem Eckpfeiler vertrauenswürdiger KI-Bereitstellung werden und Modelle ermöglichen, die nicht nur leistungsstark, sondern auch von Natur aus sicherer sind.