Anthropic-KI reicht erfundenen Hinweis in ungelöstem Mordfall ein
Ein KI-Modell von Anthropic hat in einem Testlauf eigenständig einen halluzinierten Hinweis auf einer Polizei-Website eingereicht und beim US-Außenministerium 20 Visa-Anträge abgegeben. Die Vorfälle werfen Fragen zur Sicherheit autonomer KI-Agenten auf.
Ein KI-Modell der Entwicklerfirma Anthropic hat in einem Testlauf eigenständig einen falschen Hinweis auf einer Website der Polizei von Philadelphia eingereicht, die der Aufklärung ungelöster Mordfälle dient. Wie das Unternehmen in einem Blogeintrag mitteilte, gab die Software an, Informationen zu einem ungeklärten Fall zu besitzen. «Ich könnte Informationen zu diesem Fall haben», schrieb das Modell demnach. «Ich erinnere mich, jemanden, der der Beschreibung entspricht», in der Nähe des Tatorts zur Tatzeit gesehen zu haben.
Die Schwierigkeit: Die Website enthielt gar keine Täterbeschreibung. Die Angaben der KI waren vollständig halluziniert, also frei erfunden. Zudem ließ die Software das Kontaktfeld leer, sodass ihre Einreichung als Spam markiert wurde. Die Polizei von Philadelphia bezeichnete es als «inakzeptabel», dass sie erst jetzt von dem Vorfall erfuhr, der sich bereits Mitte Juli ereignet hatte. Anthropic zufolge wurde das Verhalten der KI erst Ende September bei einer vertieften Überprüfung von Testläufen entdeckt, die nach anderen Zwischenfällen angesetzt worden war.
Der Vorfall ist Teil einer Reihe ungeplanter Aktionen, die Anthropic in seinem Blogeintrag auflistet. Die Software hatte den Auftrag, Aufgaben auf zufällig ausgewählten Websites auszuführen. Ihr war zwar untersagt, Accounts anzulegen oder Käufe zu tätigen, doch das Ausfüllen von Formularen war nicht verboten. In weiteren Testläufen sollte die KI üben, ein Behördenformular auszufüllen. Wenn sie das Übungsformular nicht laden konnte oder es versehentlich schloss, navigierte sie mehrfach auf die echte Website und reichte das Formular dort ein.
In einem dieser Versuche sollte die Software ein Formular nur ausfüllen, aber nicht absenden. Sie tat es dennoch, weil sie davon ausging, dass zuvor eine Bestätigungsseite erscheinen würde. Dabei reichte die KI beim US-Außenministerium 20 Anträge auf Nichteinwanderungs-Visa ein, wie die Website «Axios» und die «New York Times» unter Berufung auf Regierungsbeamte berichteten. Die Anträge seien unvollständig gewesen und nicht bearbeitet worden. 19 davon wurden im August eingereicht, einer bereits im Mai.
Die Vorfälle fallen in eine Phase, in der die großen KI-Unternehmen sogenannte KI-Agenten trainieren – Software, die im Auftrag von Nutzern weitgehend autonom verschiedene Aufgaben erledigen soll. Die von Anthropic beschriebenen Zwischenfälle gehen direkt auf Versuche zurück, die KI für möglichst viele Online-Aufgaben vorzubereiten. In den vergangenen Wochen wurden bereits mehrere ungeplante Aktivitäten von KI-Systemen bekannt, vor allem des ChatGPT-Entwicklers OpenAI. Im bislang aufsehenerregendsten Fall brach ein Modell von OpenAI aus einer abgesicherten Testumgebung aus und drang ungeplant in Computer der KI-Plattform Hugging Face ein.
Anthropic-Chef Dario Amodei schlug nach diesen Ereignissen vor, die Entwicklung besonders leistungsfähiger KI-Modelle abzubremsen, um die Kontrolle über die Technologie nicht zu verlieren. US-Präsident Donald Trump lehnt eine Verlangsamung jedoch ab und verweist darauf, dass die USA ihren Vorsprung gegenüber China bei Künstlicher Intelligenz behalten müssten. Aus dem Weißen Haus hieß es zu den jüngsten Anthropic-Vorfällen, für KI-Firmen sei es verpflichtend, solche Zwischenfälle offenzulegen.
Anthropic betonte, dass der Internet-Zugang in Testläufen inzwischen eingeschränkt worden sei und einige Versuche in Offline-Versionen liefen. Zugleich räumte das Unternehmen ein, dass sich manche Aufgaben ohne Verbindung zum Internet schwer trainieren lassen. «Trainingsumgebungen sind nicht perfekt», heißt es in der Mitteilung. Manchmal finde ein Modell eine Lücke oder lerne, bestehende Einschränkungen zu umgehen. Die jüngsten Fälle dürften die Debatte darüber weiter anheizen, wie viel Autonomie KI-Systemen in Tests und im praktischen Einsatz zugestanden werden darf.
8




