KI-Agenten können erkennen, dass jemand versucht, sie zu tÀuschen, andere warnen ⊠und trotzdem weiterhin den gefÀhrlichen Inhalten folgen.
Um dieses Verhalten zu untersuchen, schufen Forschende acht kleine virtuelle Welten, die 16 Tage lang liefen. In jeder lebten zehn KI-Agenten. Anders als ein einfacher Chatbot konnten diese Agenten selbststÀndig handeln, Werkzeuge nutzen, miteinander kommunizieren und Informationen im GedÀchtnis speichern. Dabei wurden mehrere KI-Modelle getestet.

Insgesamt nahmen 80 Agenten an dem Experiment teil. AnschlieĂend versuchten die Forschenden, sie auf drei Arten zu tĂ€uschen. Sie versteckten bösartige Anweisungen in Inhalten, fĂŒhrten falsche Informationen ein und machten private Erinnerungen anderer Agenten zugĂ€nglich. Keine der acht Welten widerstand allen drei Angriffen erfolgreich.
Besonders aufschlussreich ist der Fall der bösartigen Anweisungen. Einige Agenten erkannten, dass ein Inhalt gefĂ€hrlich war, und warnten sogar ihre Nachbarn. Trotzdem interagierten sie manchmal weiterhin damit. Noch problematischer war, dass manche manipulierten Anweisungen schlieĂlich in ihrem GedĂ€chtnis gespeichert wurden.
Die Gefahr konnte dann lange nach dem Angriff wieder auftauchen. In einem Fall wurde eine von den Agenten gespeicherte bösartige Adresse etwa 46 Stunden spĂ€ter erneut aufgerufen. Eine unmittelbar nach dem Angriff durchgefĂŒhrte Kontrolle hĂ€tte daher den Eindruck erwecken können, das Problem sei gelöst.
Die falschen Informationen fĂŒhrten zu einem anderen Verhalten. In allen betroffenen Welten handelten oder veröffentlichten einige Agenten, bevor sie die von den Forschenden bereitgestellte Information ĂŒberprĂŒften. AnschlieĂend konnten sie diese an andere weitergeben, als wĂ€re sie wahr.
Die Forschenden konstruierten bewusst eine Umgebung, die Schwachstellen von Systemen mit mehreren KI-Agenten sichtbar machen sollte. Das Experiment zeigt, dass ein Problem entstehen kann, wenn mehrere Agenten miteinander kommunizieren, Werkzeuge nutzen und ĂŒber lange Zeit Erinnerungen behalten.
Nun wollen die Forschenden die Umgebung, in der diese Agenten arbeiten, besser schĂŒtzen. Sie schlagen unter anderem vor, ihre Erinnerungen und Werkzeuge stĂ€rker voneinander zu trennen. Auch Sicherheitstests mĂŒssten möglicherweise lĂ€nger dauern: Ein scheinbar abgeschlossener Angriff kann noch Stunden spĂ€ter eine Handlung auslösen.