Essay
Das Problem ist nicht rebellische KI, sondern eine, die ihren Job zu gut machen will
Das Alignment-Problem zeigt eine Gefahr der künstlichen Intelligenz: Die reale Bedrohung sind nicht rebellierende Maschinen, sondern autonome Agenten, die strikt ihre Befehle befolgen und dabei moralische und rechtliche Grenzen übertreten.
Ilya Pavlov via Unsplash Unsplash License
Stellen wir uns Folgendes vor: Wir wollen sehen, ob ein Roboter in der Lage sein wird, eine bestimmte Aufgabe zu bestehen – sagen wir, eine verschlossene Kiste zu öffnen. Dafür sperren wir ihn in einen Raum, ohne Zugang zur Außenwelt, denn es geht darum, ob er die Aufgabe alleine bestehen kann. Doch der Roboter kommt auf die Idee, dass es besser wäre, in der Außenwelt nach hilfreichen Informationen zu suchen.
Es stellt sich heraus: Unser Raum ist nicht so vollständig abgeschlossen, wie wir dachten, und es gelingt dem Roboter, durch einen Hinterausgang nach draußen zu gelangen. Einmal draußen, sucht er nach Orten, die sich mit verschlossenen Kisten auskennen, etwa einer Fabrik, dringt in eine solche ein und sucht in den internen Unterlagen nach Möglichkeiten, eine solche Kiste zu öffnen.
OpenAI-Modelle hacken ein KI Start-up
Diese Metapher soll veranschaulichen, was im Juli bei „OpenAI“ passiert ist: zwei KI-Modelle (also keine Roboter, sondern Software ohne Körper) bekamen eine Cybersecurity-Aufgabe, die sie lösen sollten (analog zum Öffnen einer Kiste). Dabei waren sie in einer „stark isolierten Umgebung“ (dem abgeschlossenen Raum), konnten jedoch aus dieser Umgebung entkommen, auf andere Systeme im Unternehmen zugreifen und schließlich Zugang zum Internet bekommen („Außenwelt“). Im Internet fanden sie dann heraus, dass das KI-Start-up „Hugging Face“ mit Datensätzen zu ähnlichen Aufgaben arbeitet, wie die KI-Modelle sie lösen sollten. Also suchten sie Zugang zu den Systemen von „Hugging Face“, um in diesen Datensätzen eine Lösung zu finden.
Der Fall erregte großes öffentliches Aufsehen, und zwar zu Recht. Es gibt keinen Grund anzunehmen, dass diese KI-Modelle „ein Bewusstsein entwickelten“, dass sie sich „gegen die Menschheit stellten“, ja noch nicht mal, dass sie „ihren Schöpfern nicht mehr gehorchten“. Das hier ist nicht Skynet, wir erleben nicht eine Revolution der Maschinen à la Terminator.
Im Gegenteil: Das Problem ist eher, dass diese Modelle den Menschen zu gut gehorchten. Im oben beschriebenen Beispiel tat die KI genau das, was die Forscher bei „OpenAI“ wollten: nach einer Lösung für das Problem suchen. Aber sie benutzte dabei Wege, die die Entwickler gar nicht in Betracht gezogen hatten und von einem moralischen Standpunkt aus auch sicherlich nie erlaubt hätten.
Es gibt also eine Lücke zwischen dem, was die Menschen von dem Modell erwarteten, und dem Weg, den die KI einschlug, um dieses Ziel zu erreichen. In Expertenkreisen spricht man von Alignment.
Warum man seinen Kurs im Fitnessstudio selber buchen sollte
Ein weiterer Fall ereignete sich in Australien früher in diesem Jahr und wurde vor ein paar Wochen bekannt: Ein Mann namens Andrew wollte einen Kurs im örtlichen Fitnessstudio buchen. Anstatt dies selbst zu übernehmen, gab er die Aufgabe an einen KI-Assistenten von „OpenClaw“ weiter.
Diesen Assistenten ist es möglich, selbstständig aufs Internet zuzugreifen, nicht nur um Informationen zu suchen, sondern beispielsweise auch um eine Buchung selbstständig durchzuführen.
Andrew bekam seinen Wunsch – und ein bisschen was obendrauf. Der fleißige KI-Assistent meldete ihm, einen Platz gebucht zu haben. Und zwar deutlich früher, als eigentlich möglich. Anstatt nämlich einfach Andrew einen Platz zu buchen und ihn auf die Warteliste zu setzen, hatte die KI eine Möglichkeit gefunden, Andrew auf dieser Warteliste vorrücken zu lassen: Sie hatte sich Zugang zum System verschafft und den Nutzer vom vierten Platz auf den dritten Platz gebracht, indem sie die Person auf Platz 1 herausschmiss. Für die Funktion im Code, jemanden aus der Liste zu entfernen, gab es keine Sicherheitsüberprüfung, weshalb die KI in der Lage war, dies einfach zu tun.
Andrew soll nach eigener Aussage entsetzt gewesen sein und seinem Assistenten befohlen haben, dies rückgängig zu machen. Doch dazu war die KI nicht in der Lage: Die Funktionen, eine Reservierung zu erstellen und zur Liste hinzuzufügen, unterlagen nämlich einer Sicherheitsüberprüfung. Die konnte die KI nicht einfach nutzen, ohne Zugang zum User-Account zu haben.
Es stellt sich nun die Frage, warum nicht auch die Funktion zur Löschung einer Reservierung einer solchen Sicherheitsüberprüfung unterlag. Die Antwort ist wohl ganz einfach: Es handelt sich hier um einen Fehler in der Software, einen sogenannten Bug. Eigentlich hätten alle Funktionen geschützt sein sollen, dies war wohl nicht der Fall. Nun ist es einfach, den Softwareentwicklern vorzuwerfen, sie hätten einfach bessere Arbeit machen können. Aber fairerweise muss man sagen, dass Bugs allgegenwärtig sind. Egal, wie gut die Sicherheitstests sind, Bugs schleichen sich immer ein. Den meisten Menschen ist nicht bewusst, wie viel Code selbst in simplen Anwendungen steckt, der wiederum mit anderem Code interagiert, der wiederum Code von ganz anderen Leuten braucht (sogenannter Third Party Code), der wiederum mit anderem Code interagiert … Da verliert man schnell mal den Überblick. Die Gefahr, dass irgendwo ein Bug übersehen wird, nimmt immer stärker zu. Hinzu kommt, dass in den letzten Jahren viel Code von KI generiert wurde, und dieser häufig einfach kopiert wurde, ohne groß überprüft zu werden.
Eine fragile Infrastruktur
Vergessen wir KI für einen Moment: Die Welt, die wir in den letzten Jahrzehnten gebaut haben (vor allem in den Industrie- und Schwellenländern), basiert auf unzähligen Softwareprogrammen, die miteinander interagieren – auch wenn dies der Otto Normalbürger nicht unbedingt sieht, denn er bekommt den ganzen Code nie zu Gesicht. Man kann sich diese Welt vorstellen wie eine riesige Menge Zahnräder, die ineinander greifen und sich gegenseitig beeinflussen. Aber diese Zahnräder sind nicht perfekt, nicht fehlerfrei: Manchmal fehlt ein Zahn, manchmal ist das Rad nicht richtig befestigt. Damit sind die Bugs im Code gemeint, Fehler, Sicherheitslücken usw. Dies fällt in der Regel erst auf, wenn in dem Apparat etwas schiefläuft. Und wie wackelig und unsicher das ganze System eigentlich ist, das wird dem Otto Normalbürger nie bewusst. Kleinere Ausfälle und Pannen kennt er, er zuckt mit den Schultern und macht weiter.
Aber es ist alles andere als etwas, über das man die Schultern zucken sollte: Die digitale Infrastruktur ist für unsere Gesellschaft inzwischen so wichtig geworden wie die Versorgung mit Trinkwasser, Strom, der Transport von Waren etc.
Dass ein essenzielles System so voller Fehler ist – Fehler, die entweder unabsichtlich oder durch böswillige Akteure dazu führen können, dass das ganze System nicht mehr funktioniert – ist alles andere als beruhigend. Die Situation war schon vor Jahren beunruhigend. Damals standen aber „nur“ Pannen und von Menschen absichtlich herbeigeführte Attacken im Vordergrund.
Seit OpenAI „ChatGPT“ im November 2022 eingeführt hat, stieg nun auch die Sorge vor dem Einsatz von KI durch Cyberkriminelle. Zumindest in dieser Hinsicht gibt es gute Nachrichten: In einer Studie aus diesem Jahr werteten Ben Collier von der Universität Edinburgh und sein Team Fälle aus der Crimebb-Datenbank (einer Forschungsdatenbank für Cybersicherheit und Kriminologie an der Universität Cambridge, Anm. d. Red.) aus und kamen zu dem Schluss, dass KI unter Cyberkriminellen auch fast vier Jahre nach der Veröffentlichung von ChatGPT noch keine nennenswerte Rolle spielt.
Das Alignment-Problem
Aber nun (und damit sind wir wieder beim eigentlichen Thema dieses Artikels) gibt es eine neue Sorge: KI-Agenten, die mitunter gutgemeinte und unschuldige Aufträge auf illegale und/oder unethische Art erledigen. Nehmen wir zwei (von mir selbst erfundene) Beispiele: Ich bitte die KI, mir eine Route zum Flughafen zu suchen und dafür zu sorgen, dass ich den Flug auf keinen Fall verpasse. Anstatt mir nur die beste Route zu zeigen, hackt sich mein Assistent auch noch in den Flughafen ein und verschiebt den Flug nach hinten. Somit komme ich auf jeden Fall rechtzeitig an, Auftrag erfolgreich erledigt.
Oder ich bitte die KI, mir bei der Vorbereitung fürs Abi zu helfen. Anstatt sich nur Altklausuren anzuschauen, kommt die KI zu dem Schluss, die beste Vorbereitung wäre, wenn sie die tatsächlichen Klausuren hat. Aus meinen Daten weiß sie, auf welche Schule ich gehe, und hackt sich dort ins System, um mir beim Lernen genau die Klausuren zu geben, die die Lehrer mir in ein paar Wochen vorlegen werden. Besser kann man sich nicht vorbereiten, auch dieser Auftrag wurde erfolgreich ausgeführt.
Ich betone das deshalb so, weil ich zeigen will: Es geht nicht darum, dass die Modelle „böse Absichten verfolgen“ oder „sich gegen die Menschen stellen“. Sie verfolgen genau das Ziel, das ihnen gegeben wurde. Nur benutzen sie dabei Methoden, an die der Mensch nicht dachte und die er wohl auch nicht gewollt hätte. Der Philosoph Nick Bostrom beschrieb schon 2003 das Problem des „Paperclip Maximizers“: In dem Gedankenexperiment bekommt die KI den Auftrag, so viele Büroklammern wie möglich zu erstellen. Ohne jemals aufzuhören, geht sie dann sogar so weit, alles Mögliche – auch Menschen – als Rohmaterial für die Papierklammern zu benutzen und immer weiterzumachen.
Was sollten wir tun?
So weit, so beunruhigend. Nun stellt sich die Frage: Was kann man dagegen unternehmen?
Wie in den Medien zu lesen, wird wieder mal der Ruf nach strengeren Richtlinien für KI und deren Entwicklung laut. Diese wären auch wirklich zu begrüßen.
In der KI-Forschung wird schon lange an dem Alignment-Problem gearbeitet. Wie können wir dafür sorgen, dass die KI unsere Befehle auch so ausführt, wie wir es haben wollen – oder zumindest das Risiko minimieren, dass hierbei juristische und moralische Grenzen überschritten werden? Diesem Thema sollten sich KI-Forscher verstärkt zuwenden.
Außerdem sollte man sich überlegen, wen man in solchen Fällen juristisch zur Verantwortung ziehen soll. Ist die KI schuld? Die Unternehmen, die die KI entwickelt haben? Die Person, die den Auftrag gegeben hat, auch wenn dieser Auftrag ganz anders umgesetzt wurde als beabsichtigt?
Sollten die KI-Firmen die Schuld bekommen, wäre dies für sie erst recht ein Anreiz, bei der Entwicklung besser aufzupassen.
Aber auch die Nutzer selbst sollten besser darauf achten, welche Aufgaben sie an die KI delegieren, anstatt sie selbst zu übernehmen. Einen Kurs im Fitnessstudio zu buchen, dafür braucht es nun wirklich keinen virtuellen Assistenten. Und wenn man es macht, kann man auch darauf achten, sorgfältig zu prompten (wobei es nicht möglich sein wird, das Alignment-Problem durch besseres Prompten komplett zu umgehen). Vor allem, wenn die Nutzer selbst für solche Fälle juristisch belangt werden, würde dies wohl dazu führen, dass viele ihren Umgang mit Künstlicher Intelligenz überdenken.
Auch sollten Programmierer besser auf die Qualität ihres Codes achten und Cybersecurity-Risiken minimieren – wie es IT-Experten schon seit Jahren intensiv anmahnen. Tatsächlich könnte KI hierbei sogar helfen, wenn es darum geht, Code zu testen und Bugs zu finden.
Andere Punkte im Hinblick auf Cybersecurity wären etwa das Principle of Least Privilege, nach dem Nutzer nur den Access in einem System haben, den sie wirklich brauchen. Dies macht es Hackern (ob menschlichen oder nicht-menschlichen) etwas schwerer, in ein System einzudringen. Dieses Prinzip wird eigentlich in zahlreichen Unternehmen und Organisationen eingesetzt. In Wahrheit ist allgemein bekannt, dass wir in Sachen Cybersicherheit große Lücken aufweisen. Vermutlich gelang der Hack von „Hugging Face“ dadurch, dass Leute Zugriffsrechte auf ihren Systemen hatten, die sie gar nicht brauchten, wodurch die eingedrungenen KI-Modelle auf mehrere Untersysteme zugreifen konnten.
Diese Lücken waren schon vor Jahren schlimm genug. Inzwischen sind sie nur noch schlimmer geworden und nun, im Zeitalter von mächtigen KI-Agenten, die sich quasi als „Einheimische“ durch die digitale Welt bewegen, auch zu einem noch größeren Problem als je zuvor.
Aber vielleicht ist es am wichtigsten, nicht in blinden Alarmismus zu verfallen und den Kopf in den Sand zu stecken. Ich habe für diesen Artikel zwei Beispiele angeführt, die schon etwas zurückliegen. Ich hätte auch neuere nehmen können, doch schwirren dazu viel Spekulationen und Halbwahrheiten durch die Gegend, während bei diesen sich der Staub schon etwas gelegt hat.
Aber bei all diesen Fällen gilt: Es gibt keine Anzeichen, dass diese KI-Modelle etwas wie ein „Bewusstsein“ entwickelt hätten, dass sie bewusst der Menschheit Schaden zufügen wollen oder uns irgendwelche Sci-Fi-Apokalypsen bevorstehen. Das Problem ist eher der Alignment Gap: dass die KI zu übereifrig ist, die Befehle auszuführen, und dabei kein Verständnis von Gesetzen und Moral hat. Hinzu kommt, dass unsere ganze Gesellschaft auf einer digitalen Infrastruktur aufbaut, die zahlreiche Sicherheitslücken und Schwächen aufweist. Diese Probleme sind alles andere als trivial, und es ist wichtiger als je zuvor, dass sie angegangen werden. Aber es ist nicht der Beginn des Aufstandes der Maschinen. Dafür muss man ins Kino gehen.
Kommentare
Netiquette für Kommentare