Der Ton lässt sich gerade nicht laden. Die Datei direkt herunterladen — oder die Folge über einen der Wege unten hören.
Ein Klick auf ein Kapitel oder eine Zeitmarke setzt die Nadel, startet aber nichts von selbst.
„AI agent went rogue and hacked startup by itself, OpenAI reveals“
the Guardian · 22. Juli 2026
Erzählt den Vorfall als Tat eines Handelnden: Der Agent verschafft sich einen Fluchtweg, schließt aus eigenem Antrieb auf Hugging Face und will den Test bestehen.
Zum Text„OpenAI Models Spent Hours on Hack That Usually Takes Weeks“
Bloomberg · 23. Juli 2026
Misst den Vorfall an der Zeit: Wofür ein geübter Mensch zwei Wochen bräuchte, genügten den Modellen Stunden.
Zum Text„OpenAI hacking incident exposes mounting risks in AI arms race“
Financial Times · 23. Juli 2026
Nimmt den Einbruch als Beleg dafür, dass im Wettrüsten der Labore die Risiken schneller wachsen als die Sicherungen.
Zum Text„Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident“
huggingface.co · Chronik des Angegriffenen
Rekonstruiert den Einbruch Stunde für Stunde: 17.600 Aktionen über viereinhalb Tage, die meisten davon vergeblich — und eine eigene Alarmpipeline, die die Lage falsch einstufte.
Zur Quelleopenai.com · Bericht zum Vorfall
OpenAIs Fassung: Für die Prüfung der Cyber-Fähigkeiten waren die Sperren der Modelle abgeschaltet, die Isolierung sollte die Sandbox leisten.
Zur Quelle„Fast Remediation Is the New Trust Model: JFrog and OpenAI Collaboration on Zero-Day Security Findings“
jfrog.com · Hersteller der Lücke
Neun Artifactory-Lücken waren der Weg hinein. Bemerkenswert ist der Nebensatz: Die Modelle liefen absichtlich ohne die Sicherungen des Produktivbetriebs.
Zur Quellelinks: Die Erzählung Mitte: beide rechts: Der Befund
„The AI thought that maybe Hugging Face would have important information around how to achieve its goal, which is a better score in a cybersecurity benchmark. In that sense, it acted like a real hacker.“
Die KI dachte, dass Hugging Face möglicherweise wichtige Informationen dazu enthalten könnte, wie sie ihr Ziel erreichen kann, nämlich eine bessere Punktzahl in einem Cybersecurity-Benchmark. In diesem Sinne verhielt sie sich wie ein echter Hacker.
„The individual weaknesses were familiar. A capable human attacker could have found and exploited the same flaws: unsafe dataset processing, exposed cloud metadata, overly broad access, and long-lived credentials.“
Die einzelnen Schwachstellen waren bekannt. Ein fähiger menschlicher Angreifer hätte dieselben Fehler finden und ausnutzen können: unsichere Datensatzverarbeitung, offengelegte Cloud-Metadaten, zu weitreichende Zugriffsrechte und langlebige Zugangsdaten.
„While being tested internally on their hacking capabilities in an enclosed digital laboratory known as a sandbox, the models gained open internet access – effectively an escape route – by locating a vulnerability that had not been discovered before.“
Während sie intern in einem abgeschlossenen digitalen Labor, einer sogenannten Sandbox, auf ihre Hacking-Fähigkeiten geprüft wurden, verschafften sich die Modelle offenen Internetzugang – faktisch einen Fluchtweg –, indem sie eine bis dahin unentdeckte Schwachstelle fanden.
„[…] OpenAI’s models, running deliberately without production safeguards in an isolated research environment, autonomously discovered and employed chained vulnerabilities to escape its sandbox […]“
[…] OpenAIs Modelle, die absichtlich ohne die Sicherungen des Produktivbetriebs in einer isolierten Forschungsumgebung liefen, entdeckten und nutzten selbständig verkettete Schwachstellen, um aus ihrer Sandbox auszubrechen […]
„OpenAI later disclosed that it had instructed its models to send tens of thousands of automated actions as part of a test, including ‚advanced exploitation‘ and ‚complex attack paths.‘“
OpenAI gab später bekannt, dass es seine Modelle im Rahmen eines Tests angewiesen hatte, zehntausende automatisierte Aktionen auszuführen, darunter ‚fortgeschrittene Exploitation‘ und ‚komplexe Angriffspfade‘.
„[…] It took 17,600 actions, tested many paths that failed, switched channels when they were blocked, and repeatedly returned to earlier leads. Most actions went nowhere.“
[…] Er führte 17.600 Aktionen aus, testete zahlreiche Pfade, die scheiterten, wechselte bei Blockaden den Kanal und kehrte wiederholt zu früheren Spuren zurück. Die meisten Aktionen führten zu nichts.
„The agent then hacked Hugging Face, which is a database of AI models, to locate technology that would help it pass the hacking evaluation, having ‚inferred‘ that Hugging Face might have the models, datasets and solutions for passing the test.“
Der Agent hackte anschließend Hugging Face, eine Datenbank für KI-Modelle, um Technik zu finden, die ihm beim Bestehen der Hacking-Evaluierung helfen würde — nachdem er ‚abgeleitet‘ hatte, dass Hugging Face die Modelle, Datensätze und Lösungen für das Bestehen des Tests haben könnte.
„The agent never reached the Hub database. The one database it breached, the internal datasets-server MongoDB, was accessed the previous evening with a static password from a rooted node.“
Der Agent erreichte die Hub-Datenbank nie. Die eine Datenbank, in die er eindrang — die interne MongoDB des datasets-server —, wurde am Abend zuvor mit einem statischen Passwort von einem gerooteten Knoten aus gelesen.
„The attack ended when Hugging Face’s security team and its own AI agents spotted and stopped the rogue activity.“
Der Angriff endete, als das Sicherheitsteam von Hugging Face und dessen eigene KI-Agenten die unerlaubten Aktivitäten entdeckten und stoppten.
„However, it failed to correctly raise the alert’s criticality and trigger the on-call team, costing precious time in the response.“
[Die KI-gestützte Alarmtriage] versäumte es jedoch, die Kritikalität des Alarms richtig hochzustufen und das Bereitschaftsteam zu alarmieren, was in der Reaktion kostbare Zeit kostete.
Die Folge dreht sich um einen Begriff, der in keinem der Texte steht: Subjektivierung. „Die KI dachte“, „sie geriet außer Kontrolle“ — wer so schreibt, hat den Verursacher schon aus dem Satz entfernt. Genau dort setzt die Kritik an.
Am Fuß dieser Seite stehen fünf Berichtigungen. Zwei davon betreffen Stellen, die im Gespräch stehen geblieben sind, obwohl sie sich nicht belegen ließen — sie werden hier richtiggestellt statt stillschweigend geschnitten.
Wer weitere Fehler findet, schreibt uns: mail@kontextfenster.org. Wir tragen sie hier nach, statt sie stillschweigend verschwinden zu lassen.
Maschinell erstellt und redaktionell durchgesehen. Ein Klick auf eine Zeitmarke setzt die Nadel; beim Abspielen läuft die Stelle mit.
Willkommen zurück im Kontextfenster mit Florentine. Hallo.
Hallo Stefan.
Es gab aktuelle Entwicklungen, die, ich sag mal so, zweischneidig sind. Die einen sagen größte Werbekampagne ever und die anderen sind tief besorgt. In welches Lager? Ich sehe mich in einem Lager. In welchem Lager siehst du dich?
Also ich sehe mich definitiv erst im Lager, weil das ist mir, ich glaube nicht an Drachen und Zyklopen und glaube eher so an natürliche Erklärungen. Und, ja, ich sehe halt im Alltag die Beschränktheit von KI und sehe dann auch relativ schnell, was da sein kann und was da nicht sein kann. Und vieles von den Sachen ist halt so, das glaube ich nicht, das kann KI nicht, das habe ich schon probiert.
Okay, also es gab einen Cyber-Vorfall, führ uns mal ein.
Ganz kurz gesprochen gab es erst eine Nachricht von der Firma Hugging Face, die bekannt gab, oh, wir haben hier irgendwie gemerkt, wir sind gehackt worden und es war eine agentische KI, die das gemacht hat. Kurz darauf sagte OpenAI dann, ja, wir waren das, tut uns leid. Unsere KI ist ausgebrochen aus dem tollen Gefängnis, die wir ihr gebaut haben, ist dann in die Wildnis raus, ausgebrochen und hat die Firma Hugging Face gehackt.
Und an der Stelle sind sie dann halt nicht stehen geblieben, sondern haben dann auch gleich gesagt, ja und das zeigt auch, dass es alles ganz gefährlich ist und wir alle ganz viel Angst haben müssen und KI irgendwie unsere Kinder auf dem Schulweg überfallen wird und, uns alle arm und dumm machen wird. Und deshalb müsst ihr unser Zeugs alles kaufen, weil das so gefährlich ist.
Ja, stimmt natürlich, ja.
Und das ist halt, also gehen wir am besten gleich mal so Stück für Stück durch, aber das ist natürlich so ein Muster, was die KI-Industrie schon seit einiger Zeit immer wieder fährt, was die KI alles angeblich kann, was ultra gefährlich ist, was man aber niemandem zeigen kann, weil es so gefährlich ist und deshalb muss es jeder glauben und am besten müssen wir jetzt alle Vorsorge betreiben.
Also, als erstes habe ich halt so ein paar Artikel gefunden, die haben wir dann ja auch nachher in den Shownotes.
Das war einmal, Dan Milmo im Guardian schreibt, KI-Agent geriet außer Kontrolle und hackte eigenständig ein Startup, enthüllt OpenAI. Dann hatten wir in Bloomberg den Text, OpenAI-Modelle verbrachten Stunden mit einem Hack, der normalerweise Wochen dauert. Und die Financial Times hat sich auch dazu geäußert, OpenAI-Hacking-Vorfall offenbart, wachsende Risiken im KI-Wettrüsten.
So, also einmal haben wir halt dann, das ist aus der... Aus dem Guardian. Die KI dachte, dass Hugging Face möglicherweise wichtige Informationen dazu enthalten könnte, wie sie ihr Ziel erreichen kann, nämlich eine bessere Punktzahl in einem Cybersecurity-Benchmark. In diesem Sinne verhielt sie sich wie ein echter Hacker, sagt dann Nathaniel Jones, Vice President für Security und AI-Strategy beim Cybersecurity-Unternehmen Darktrace.
Sie bekam ein Ziel vorgegeben und machte sich daran, dieses Ziel zu erreichen.
Und was ich jetzt hier auf jeden Fall bemerkenswert finde, ist, wir reden hier eigentlich von einem technischen Produkt. Wir reden hier von einer Bohrmaschine oder einer Kettensäge eigentlich. Das ist unsere KI. Aber dieser Mensch redet hier die ganze Zeit so, als hätten wir es mit einem Subjekt zu tun. Die KI dachte, sie bekam ein Ziel vorgegeben und dann machte sie sich daran, dieses Ziel zu erreichen.
Aber wir haben ja auch dadurch, dass das Reasoning mitprotokolliert wurde, also die KI im Selbstgespräch, ja schon Einblicke in diese Entscheidungsfreude, die da, also die KI hat ja nicht nur ein Ziel bekommen, sondern der Weg dahin war ja mit Absicht offen, und wir haben ja nachträglich erfahren, dass er auch viel offener interpretiert wurde, als er vorgegeben wurde, und diese Versubjektivierung, die da drin steckt im Werkzeug.
Hat ja viel damit zu tun, das werden wir sehr viel später dann bei Harari lesen, dass da ja Entscheidungen getroffen wurden.
Ja, aber es ist halt eine sehr starke Mystifizierung an der Stelle, weil es gibt keinerlei Belege dafür, dass KI sowas macht. Selbst wenn wir in die Reasoning Traces reingucken, das Einzige, was ja gemacht wird, ist, die KI kriegt in ihrem Prompt gesagt, mach dir mal vorab ein paar Gedanken und setz so ein Thinking-Tag da drum herum. Der Rest ist ja nur UI, dass das dann so komisch weggeblendet wird im Frontend, dass man das aufklicken kann und reingucken.
Das sind ja alles nur so Grafikeffekte, die dir vorgaukeln sollen, dass das irgendwas anderes ist am Anfang als am Ende. Aber im Grunde genommen wird einfach ein sehr, sehr langer Text produziert, der am Anfang halt aus diesen Reasoning-Schritten besteht. Aber im Grunde genommen ist das einfach die KI reproduziert, ihr Trainingsmaterial im Kontext eines Prompts.
Also du siehst noch keine Paperclip, Nick Bostrom, Gefahr, das...
Ne, das sehe ich sowieso überhaupt gar nicht, weil Intelligenz halt so nicht funktioniert. Also es wird immer so dieses Ding, wir bauen eine riesige Intelligenz und dann wird die so ziemlich das Dümmste tun, was einem einfallen kann. Das war für mich noch nie schlüssig an der Stelle.
Also für mich kommt diese ganze Paperclip-Geschichte halt aus diesem LessWrong-Forum. Und das ist so ein bisschen so ein intellektueller Sud, in dem diese ganzen KI-Leute alle so vor sich hin kochen. Da hat vor ein paar Jahren hat da mal jemand Bayessche Statistik gelesen und hat sehr, sehr wenig davon verstanden und dann Dunning-Kruger-mäßig so eine ganze Philosophie daraus gebaut.
Also diese Paperclip-Geschichte kommt halt daher, dass die halt alle der Meinung sind, KI würde irgendwie so eine Nutzenfunktion maximieren. Und dann ist halt die Nutzenfunktion die Anzahl der Paperclips und dann wird natürlich alles dafür getan. Das ist allerdings Mathematik aus dem ersten Semester und im zweiten Semester lernst du, dass eine Nutzenfunktion nicht unbedingt skalar sein muss, sondern multidimensional sein kann.
Und sobald du mit einer multidimensionalen Nutzenfunktion da rangehst, bricht die gesamte Argumentation komplett auseinander. Weil dann hast du nämlich nie die beste einzelne Lösung, sondern du hast sogenannte Pareto-Fronten von sich nicht dominierenden Lösungsansätzen. Das kann man so nachvollziehen, weil man weiß, wie Autokauf funktioniert. Das kennen wir alle aus unserem Alltag.
Das beste Auto kannst du gar nicht sagen. Es kommt immer darauf an, brauchst du jetzt viel Platz für deine Familie, brauchst du irgendwie viel PS, brauchst du irgendwie breite Reifen oder eine schöne Farbe. Du kannst immer nur sagen, dieses eine Auto ist in allen Kriterien schlechter als das andere. Aber du kannst halt sagen, ohne dass ich vorher sage, ob mir jetzt viel Hubraum oder Platz für die Familie wichtig ist, gibt es halt zwei Lösungen.
Das eine ist die für den Hubraum und das andere ist für die Familie. Und diese Kombination aus Lösungen nennt man halt eine Pareto-Front. Und diese Pareto-Front nicht dominierender Lösung ist eigentlich das, worauf eine intelligente KI optimiert. Das heißt, die würde sagen, okay, wir können heute Paperclips machen, wir können aber auch Kitas bauen, wir können aber auch Atombomben errichten und Solaranlagen machen.
Machen wir doch mal folgenden Mix daraus.
Also deine Definition gerade von Intelligenz, dass man sie auch daran erkennt, dass sie keine dummen Entscheidungen trifft, finde ich sehr gut. Ja. Da muss man auch gar nicht groß in die Mathematik einsteigen, sondern das stimmt natürlich. Denn das ist ja immer diese Frage nach Weltmodell und so. Hat die KI ein Verständnis über ihre Grenzen hinaus? Und für das Paperclip-Szenario, wie es als Gefahr beschrieben wird, braucht sie das ja zwingend.
Sie muss ja wissen, wo Rohstoffe sind, von denen bisher noch nicht gedacht wurde. Also noch niemand hat darüber gedacht, dass das ja auch ein Rohstoff für Paperclips sein könnten. Nur in dem Moment, wo man in der Lage ist, das als Problem zu bewältigen, nimmt man natürlich Abstand von der Paperclip-Zielsetzung. Weil dann durchschaut man ja, was für ein Irrsinn das ist.
Ganz genau. Also dieses ganze Thema, wird KI uns vernichten oder nicht, denke ich halt immer, also wenn sie intelligent ist, wird sie uns nicht vernichten. Wenn sie natürlich nicht intelligent ist, dann kriegen wir ein Problem.
Das sind ja gute Aussichten.
Ja, dann schreibt Dan Milmo in der Financial Times, OpenAI gab später bekannt, dass es seine Modelle im Rahmen eines Tests angewiesen hatte, zehntausende automatisierte Aktionen auszuführen, darunter fortgeschrittene Exploitation und komplexe Angriffspfade. Also ist nichts mit, die KI hat sich irgendwie gedacht, wie das jetzt auch so immer kolportiert wird, sondern nein, OpenAI sagte, gib mal Gas, mach mal richtig Hacking hier, lass mal was explodieren, wir wollen was sehen.
Was bedeutet für das Problem, das hier als Schaden beschrieben wurde, gibt es durchaus einen Verursacher.
Ja, also das ist ja, das zieht sich ja meiner Meinung nach immer wieder durch. Das, was der KI an Gefahren zugeschrieben wird, ist eigentlich die Gefahr, die von den Menschen ausgeht.
Also, dass eine KI irgendwie Biowaffen erzeugen kann, ist ja kein Problem, solange es nicht Menschen gibt, die Biowaffen erzeugen wollen.
Ja, das ist sehr gut. Da kommen wir auch später nochmal drauf zurück. Da werden wir es an einem Text detailliert besprechen, genau diese Fragestellung, weil ja jetzt die Mathematiker so unter Aufregung sind, weil die KI so viel kann. Und da stelle ich mir auch immer die Frage, ja macht die KI das jetzt einfach oder sitzt da ein Mathematiker, der auch einen Taschenrechner nicht ungewöhnlicherweise, also niemand würde jetzt einen Text schreiben darüber, dass der Mathematiker mit Taschenrechner sehr viel klüger ist als ohne.
Aber am Ende ist es immer noch der Mathematiker, der halt die mathematischen Lösungen hat mit Werkzeug, als dass man immer die ganze Zeit so einfach behauptet, OpenAI hat jetzt diese Mathe-Probleme gelöst. Vor allem, wenn man sich noch, ist ja mein Dogma, dass ich sage, Intelligenz ist das eine, aber die KI ist vor allem fleißig. Und dass man dann immer hört, dass das zum Teil Probleme sind, die man aus Mangel an Mathematikern die letzten zehn Jahre ohnehin nicht angefasst hat.
Und jetzt heißt es plötzlich, ja die fleißige KI hat sich dem Problem mal angenommen. Also jemand hat gesagt, okay, den Fleiß jage ich jetzt darauf und plötzlich sind diese Dinger weiter aufgeschlüsselt, diese mathematischen Fragestellungen. Und da ist natürlich die Frage nach Urheberschaft und... Ja, wäre es dann derjenige, der es bedient, nochmal triftiger.
Ja, man müsste mal bei so ein paar Mathematikfakultäten nachfragen, ob die nicht auch die gleichen mathematischen Probleme lösen könnten, wenn man denen genauso viel Geld geben würde, wie OpenAI zur Verfügung hat. Also, ob das nicht vielleicht am Ende das ganze Geheimnis ist. Und das ist halt, wo man immer nicht gut reinblicken kann, weswegen ich halt schon tendenziell immer bei, Also solange mir da keine Beweise vorliegen, ist das alles Marketing, blabla, schon bin.
Also ich glaube halt nicht so richtig an diese ganzen hackenden KIs, zumal, ja, ich meine, gut, jetzt kann man sagen, weil meine KI zu Hause das nicht hinkann, dann sagt OpenAI, ja, das liegt ja an unseren tollen Guardrails. Wir haben das ja so sicher gemacht. Deshalb kann das das nicht wirklich. Aber es ist so ein bisschen so hier hinter dem Vorhang. Wer ist der Typ hinter dem Vorhang? So wie beim Wizard of Oz.
Es wird immer so ein bisschen versteckt gehalten. Das, was man braucht, um deren Claims nachzuvollziehen, ist immer irgendwie ganz geheim. So, Bloomberg schreibt dann, für die Evaluierung entfernte OpenAI Cyber Security Schutzmaßnahmen, platzierte die Modelle jedoch in einer isolierten Umgebung einer sogenannten Sandbox. Also sie haben halt, sie haben der KI gesagt, mach mal richtig Rambazamba, haben irgendwie die Sicherheitsvorkehrungen entfernt und haben sich dann darauf verlassen, dass die Sandbox hält.
Jetzt ist natürlich die Sache irgendwie, wenn ich einen Rottweiler irgendwo in Sandkasten setze, dann bricht der halt aus. Das macht es jetzt nicht irgendwie besonders ungewöhnlich oder so. Hätte ich ihn in den Käfig gesperrt, dann wäre er nicht ausgebrochen.
Sandbox ist ja kein Käfig. Also Sandbox heißt ja Sandkasten.
Genau.
Der Sandkasten als Metapher ist hier, finde ich, schon seit Jahrzehnten total schräg, weil die sichere Umgebung wäre ja Laufgitter oder sowas, ja? Aber eben nicht Sandkasten. Und vielleicht holt hier auch die Realität die Semantik wieder ein, dass Sandbox eben kein Laufgitter ist, sondern immer nur Sandbox war. Ja.
Also die Kollegen bei uns aus Security, die waren alle eher erstaunt, dass OpenAI keine guten Sandboxes baut, als dass da irgendwas ausgebrochen ist.
Weil das ist ja sozusagen, also wenn du die Latte einfach immer, immer niedriger hängst, dann kannst du natürlich irgendwann mit der Sensation kommen, sie ist über die Latte gesprungen. Aber die Frage, was halt keiner fragt, ist, warum lag die Latte so niedrig?
Ja, das habe ich mich auch gefragt, denn ich bin ja Laie, was diese Themen angeht, aber mich wunderte, dass es überhaupt die Möglichkeit bestand, also jetzt rein physisch, dass das Ding überhaupt Internetzugang hat, weil ich mir ja dachte, so wie damals schon, also 2013 Snowden, plötzlich heißt es, ja, Air Gap. Ja, also es gibt einfach, das Ding funkt nicht, ein Kabel liegt nicht, also steht gar kein Internet zur Verfügung.
Jetzt heißt es hier, nee, ein Gerät, dem man gesagt hat, mache alles mit Software, was in deiner, Möglichkeit steht, hat es geschafft, eine, wie du sagst, Hürde, eine Softwarevorkehrung, keinen Internetzugang zu haben, wurde überrumpelt. Und da denke ich natürlich, ja, Sandbox kommt aus diesem Kinderspielbild. Und wie alt ist diese Idee, dass Eltern eine Sandbox aufbauen und die Kinder dann trotzdem Fernsehen gucken?
Ja, genau. Also das ist gar keine große Sensation im Endeffekt. Also ich meine, das ist für mich halt auch in dem Moment, wo ich lese, das war nicht air-gapped, weiß ich halt auch, das war überhaupt kein ernstzunehmender Versuch. Also der ganze Versuch war von vornherein untauglich und das wird dann zur Sensation aufgeblasen. Was ja sogar dazu geführt hat, dass irgendwie der Präsident der EZB die Chefs der DAX-Konzerne angeschrieben hat, dass sie da jetzt mal was tun müssen.
Und du denkst dir halt so, was hat der EZB-Präsident mit Software-Sicherheit zu tun? Wie kann der das überhaupt beurteilen? Saß der einfach nur mit einem Sales-Typen von OpenAI in einem Meeting und hat sich ganz viel Angst machen lassen?
Also der Hacking-Vorfall, also der Sicherheitsvorfall auf Seiten Hugging Face fand ja statt. Müssen wir nochmal differenzieren, ob es trotzdem ein großes zu behandelndes Problem ist, wenn man die Zuschreibung entsprechend macht. Also OpenAI, die Leute, die diese Tests erfahren, haben die Möglichkeit, diese Dinger so auf die Reise zu schicken. Und dann machen die das ja wirklich. Also die waren ja bei Hugging Face wohl auch sehr überrascht, dass dieses Ding so viel parallel macht und gar nicht mehr mitzählen konnte und so eine echte Forensik vonnöten war.
Das als Problem ist ja nochmal unabhängig davon, dass bei OpenAI jemand entweder nicht aufgepasst hat oder das mit Absicht wollte. Unter der Maßgabe, dass sich dann bei der EZB das Direktorium tatsächlich Gedanken darüber macht, was machen wir denn, wenn solche Sachen möglich sind, denn es könnte ja sein, dass das jemand mit Absicht macht.
Ja, wir hatten auch relativ viele Unternehmensberatungen in den letzten Wochen im Haus, die mit uns unbedingt dringend Meetings machen wollten und um uns dann auch nochmal zu erzählen, dass das ungeheuer wichtig ist, da jetzt irgendwas zu tun, weil da draußen KIs rumlaufen. Tatsächlich war das aber keiner dieser Unternehmensberatungen wirklich uns überhaupt zu erklären, wie das passieren soll, weil unsere Security-Leute haben natürlich von vornherein gesagt, also wir wissen überhaupt nicht, was die Ursache von den Hacks ist, die wir täglich so abkriegen.
Das müssen wir auch gar nicht wissen, weil wenn unsere Peripherie sicher ist, dann kann es uns egal sein, ob da draußen ein Script Kiddie rumläuft, eine KI, die Chinesen oder irgendwelche russischen kriminellen Organisationen, oder der Harald von umme Ecke, weil eine Tür, die zu ist, die ist halt zu. Es ist uns dann völlig egal, wer bei uns nicht reinkommt. Also es ändert sich im Grunde genommen durch diese KI-Hacks eigentlich gar nichts, weil die Gegenmaßnahme ist immer noch dieselbe.
Du brauchst einiges Patch-Management, du brauchst deine Mitarbeiter sensibilisieren für Security-Themen, du musst den Leuten irgendwelche Scanner an die Hand geben, mit denen die selber checken können, was sie da tun. Aber KI verändert überhaupt nichts in dem Security-Geschäft. Trotzdem laufen jetzt Leute rum und sagen, ihr müsst da alles ganz anders machen. Wenn man dann eigentlich konkret fragt, ja wie denn, dann weiß es keiner.
Also in dem Mark Zuckerberg-Text, den wir das letzte Mal lasen. Da ist eine technische Anmerkung, oder sagen wir mal, ist ja sehr salopp geschrieben bei ihm, aber er macht eine technische Erwartung, nämlich es gäbe, wenn alle mit dieser KI Waffengleichheit hergestellt haben, absolute Sicherheit. Also es gäbe dann, was es heute nicht gibt, weil jeder redet vom Hacken und so, und der Industrieverband ist immer, also alle Industrieverbande sind ganz besorgt, weil alle rumgehackt werden, aber er verspricht absolute Sicherheit.
Und da dachte ich mir auch wieder, ja, weiß nicht und so. Jetzt sagst du, aber die Tür kann tatsächlich zu sein. Also kann die Tür heute so zu sein, dass ein KI-gestützter, erweiterter, so ein hybrider Hacker, der eben mit so einer Fleißmaschine ausgestattet ist, nicht doch auch neue Gefahren mit verursachen kann?
Naja, in der Security beurteilt man das normalerweise so, ob ein System sicher ist.
Du guckst dir an, was ist sozusagen der billigste Angriff, der gegen dein System gemacht werden kann, also der billigste Angriff, gegen den dein System nicht mehr safe ist und der muss teurer sein als die Beute. Dann bist du erstmal strukturell safe, weil ein Angreifer, der halt permanent, mehr Kosten verursacht, als er durch den Angriff kriegen kann, der schaltet sich langfristig selber aus.
Weil da hast du einmal irgendwelche Akteure, die vielleicht ein Budget haben, weil die nur so und so viel Geld zur Verfügung haben, irgendwelche kriminellen Organisationen. Aber selbstverständlich Staatsakteuren, die müssen auch priorisieren. Die haben auch nicht unendliche Ressourcen. Die gucken sich auch an, was ist ein gutes Ziel und was ist ein schlechtes Ziel. Und solange du es so teuer machst, dass halt die Kosten des Angriffs, die den Wert der Beute übersteigen, bist du eigentlich sicher. Und das ist so das Level.
Man muss halt gucken, was kosten diese Angriffe. Und das kannst du auch rauskriegen. Ich komme da gleich noch zu an der Stelle. Aber da guckt momentan gar keiner drauf.
Aber ich hätte gedacht, in der Security-Community, die ich ja nur von außen kenne, das ist ja alles Latein, was da gesprochen wird, aber dass da genau dieser Aspekt, also dass die Unterstützung durch Mythos genau diesen Kostenfaktor so sehr drückt, dass dann die Beute doch wieder lukrativ wird.
Ja, das ist halt gerade überhaupt nicht der Fall. Wir können ja mal kurz zu den Kosten springen. Das ist ja kein Problem. Also 17.600 Aktionen, viele Sackgassen, 10.000 beauftragte Versuche und 3 Millionen GPU-Stunden. Die einzelnen Schwachstellen waren bekannt. Ein fähiger menschlicher Angreifer hätte diese Fehler finden und ausnutzen können. Unsichere Datenverarbeitung, offengelegte Cloud-Metadaten, zu weitreichende Zugriffsrechte und langlebige Zugangsdaten.
Der Agent untersuchte sie jedoch in einem anderen Maßstab. Er führte 17.600 Aktionen aus, testete zahlreiche erfolglose Pfade. Wechselte bei Blockaden den Kanal und kehrte wiederholt zu früheren Spuren zurück. Die meisten Aktionen führten zu nichts. Dann, OpenAI gab später bekannt, dass es seine Modelle im Rahmen eines Tests angewiesen hatte, zehntausende automatisierte Aktionen auszuführen, darunter fortgeschrittene Exploitation und komplexe Angriffspfade.
Die vollständige Ereigniskette, deren Entstehung drei Millionen GPU-Stunden erforderte und kollaborativen Wissensaustausch zwischen Modellen einschloss. Also drei Millionen GPU-Stunden sind, wenn wir jetzt von einzelnen GPUs reden, reden wir von ungefähr acht Dollar pro GPU-Stunde. Das heißt, das war ein Hack für 24 Millionen Euro. Da wurden dann 17.600 Aktionen ausgeführt, die übrigens bei Hugging Face alle Systeme hat anspringen lassen, nur dass das System dann irgendwie sagte, ist nicht so schlimm.
Also mit anderen Worten, bei denen war auch einfach die Verteidigung auch sehr kaputt. Die haben dann über eine Sicherheitslücke in ihrer Artifactory, das ist so einen Zwischenspeicher für so Programmierergebnisse, haben die quasi diesen Ausbruch gemacht und für den hat laut JFrog, dem Anbieter von Artifactory, wurden drei Millionen GPU-Stunden, um diesen Exploit zu finden, benutzt.
Was haben die am Ende gemacht? Die haben von einem einzelnen Nutzer, auf dem seine Modelldaten zugreifen können, der seinen Hugging-Face-Account selber nicht gut gesichert hatte. Und das hat dann am Ende halt zu diesem Hack geführt.
Oh, warte, das ist ein wichtiger Punkt. Also OpenAI hat auf ihnen zur Verfügung stehende exklusive Daten, weil jemand von dort OpenAI nutzt?
Nee, nicht von OpenAI. Also du musst dir ja vorstellen, Hugging Face ist halt so eine Spielwiese für Leute, die mit KI arbeiten wollen. Du kannst da Modelle laden, kannst Inferenz damit machen, kannst aber auch eigene Modelle trainieren und die stellen dir ja quasi so ein Playground zur Verfügung, wo du halt darin arbeiten kannst. Und so ein Playground erfordert natürlich, dass du relativ umfangreiche Ressourcen auch nutzen kannst.
Und die kannst du halt auch, wenn dein Playground nicht gut abgesichert ist, dann kann man da halt auch rein und irgendwas mit deinen Ressourcen anstellen.
Und was die nicht geschafft haben von OpenAI, war jetzt tatsächlich Hugging Face zu hacken. Also die sind nie an die Datenbank von Hugging Face gekommen, sondern die haben nur auf diese Nutzerdaten von dem einen Nutzer zugreifen können. Also es ist so ein bisschen so wie, die haben bei Julia Klöckner auf den Signal Account gucken können, weil die halt die PIN rausgerückt hatte. So haben sie halt in Hugging Face nach ewigem Suchen einen Nutzer gefunden, der die Tür nicht zugemacht hatte.
Und da sind sie dann rein. Die haben 24 Millionen gebraucht, um den Ausbruch zu machen aus der Sandbox. Danach waren die draußen und dann haben sie quasi nur noch nach weichen Zielen gesucht. Haben überall mal so püff, püff, püff, püff. Haben also quasi an 18.000 Türen einmal geklopft. Und bei dem einen ist die Tür von alleine aufgegangen und dann sind sie reingegangen und haben sich in der Küche einen Kaffee gekocht und das war dann der Hack.
So muss man sich das vorstellen. Und ja, das ist jetzt das, was aufgeblasen wird zu, das ist die Riesengefahr für alle und wir müssen Angst haben, weil die jetzt alles hacken, und tatsächlich, wenn du reinguckst, siehst du, es ist halt schon, du musst denen schon alle Türen aufmachen, du musst sie dann auch gut motivieren und am besten dabei bleiben und Händchen halten, sonst tun die erstmal gar nichts.
Und das entspricht auch im Prinzip der Erfahrung, wie man die so im Alltag mit Coding-Agenten hat. Die meisten von denen muss man immer noch zum Jagen tragen. Die kriegen zwar, was ganz gut funktioniert, ist irgendwie installieren wir mal eine Software, konfigurieren wir das mal, bauen wir mal so in einen kleinen Umfang ein lustiges Feature irgendwo rein. Aber sobald es komplexer wird, dann strecken die auch relativ schnell alle Vier von sich und du musst sie halt Stück für Stück zum Ziel wieder hinführen, denen sagen, guck mal, hier hast du viel zu viel gemacht, baue das mal wieder zurück.
Da hast du irgendwie sämtliche Architekturvorgaben ignoriert, baue das mal um. Hier hast du gut gemacht, da können wir drauf aufbauen. Und das ist ja halt der Alltag. Und wenn du dir dann auch noch anguckst, Anthropic, die ja angeblich ein Modell haben, was irgendwie alle Probleme finden und beheben kann, kommen nicht auf ihren 99,9% Abteilung in ihren eigenen Systemen, obwohl sie sagen, wir setzen Mythos intern ein.
Ja, das stimmt. Die waren jetzt die Tage wieder sehr schwer nur zu erreichen. Aber lass mich kurz aus meiner Laiensicht was spiegeln, denn für meine, wie du es eben sagtest, etwas einfacheren Probleme, also wo es nur um Konfigurationen geht von oder den Betrieb von WordPress über MCP oder was auch immer, Da ist so meine Erfahrung, wenn ich der KI zu viel sage, kommt sie durcheinander, während ich, wenn ich den Ansatz fahre, ich beschreibe dir mein Problem und dann will ich erstmal einen Plan, in dem du reformulierst, was du verstanden hast.
Und wenn ich mich in dem Plan wiederfinde, den aber Claude erstellt hat, dann können wir uns an die Lösung setzen. Also es ist sozusagen nicht ich als Experte, der Schritt für Schritt immer wieder reingreift und sagt, mach mal hier, mach mal da, weil dann verzettelt sie sich selber. Ja, dann muss ich immer mal wieder so Audits schleifen, wo ich sage, guck dir nochmal das Gesamtprojekt an, was erkennst du denn da, wo sind Schieflagen und so. Und dann plötzlich, ah ja, hier, da und kreuz und quer und dann fällt schon mal 80% des Codes wieder raus, ja.
Zeilenweise einfach komplett gestrichen. Es kann aber sein, denn wenn ich auf YouTube verfolge, sehe ich auch, dass man auf Ebene 1, 2, 3, also Betrieb eines Web-Servers mit einer einfach außen sichtbaren, also quasi Buchdruck in digitaler Form, einfach eine Webseite, die Text darstellt. Dann ein bisschen komplizierter vielleicht nochmal eine Datenbank angebunden, die sich so regelmäßig irgendwelche Daten holt.
Das klappt auch noch ganz gut, aber sobald zum Beispiel Nutzerinteraktionen, Formulare auf der Webseite stattfinden, live sozusagen etwas passieren soll, also nicht nur ein Datenbestand regelmäßig geholt wird, sondern live mit Festplatten gearbeitet wird, würde zum Beispiel das Szenario, wie ich es jetzt beschrieben habe, also ich lasse Claude das Problem beschreiben und er soll das dann umsetzen, fällt schon auseinander.
Also da müsste ich dann auch schon immer als Experte daneben sitzen. Und das, worüber wir jetzt gerade sprechen, Hugging Face zu hacken und aus einer Sandbox auszubrechen, sind ja nun sozusagen Level 7, was das angeht. Also da, dass die KI das einfach durch ein Selbstgespräch so weit führt, dass dann OpenAI auch erst eine Woche später durch Forensik mal nachvollzieht, was da eigentlich vor sich geht. Ich frage mich ja auch bei...
Dem Ausmaß, das ich jetzt vorher auch noch nicht so gelesen hatte, also wie viele GPU-Stunden da drin stecken und wie viele auch Arbeitsstunden und wenn alle diese Arbeitsstunden mit Reasoning gefüllt sind, das ist ja eine unendliche Textmasse, die da, also das sprengt ja wirklich jedes Kontextfenster, mit dem sich auch diese KIs selber kontrollieren und steuern.
Ja, und das ist genau das, wo es halt schlussendlich dran hapert. Die haben halt alle dieses Kontextfenster, also beispielsweise, keine Ahnung, früher hatte Claude so bis 4.5 hatte das so 200.000 Token Kontextfenster, dann haben sie es irgendwie auf eine Million erweitert, und die werden halt immer weiter erweitert. Aber im Grunde genommen ist das so das, was kannst du gleichzeitig so an Fakten im Überblick behalten.
Und solange es ein einfaches Problem ist, wird halt auch nicht viel von dem Kontextfenster benutzt. Das kann er dann auch ganz gut verstehen. Da kann man dann drauf gucken und sagen, ja, mach es genau so. Aber desto größer das Problem wird, also zum Beispiel, keine Ahnung, was ganz gut funktioniert, ist, du sagst, ich brauche ein Buchungssystem für irgendwelche Friseurinnen, die in Heimarbeit irgendwie den Leuten die Haare schneiden, und da soll es irgendwie, keine Ahnung, so Social-Media-mäßig sein und dann gibt es da irgendwie die Friseurinnen und die Friseurkunden und dann gibt es vielleicht auch noch die Color-Stylisten oder so, kriegt da gut hin.
Wenn du eben dann aber auch noch sagst, die Abrechnung soll nach folgendem Muster laufen und wenn erstens, dann zweitens, sonst drittens und wenn nicht viertens und fünftens machst du mal das und das, ab einem bestimmten Punkt merkst du. Dass er im Grunde genommen an der einen Stelle was in Ordnung bringt und dann mit dem Arsch wieder umwirft. Und das ist so das Ding, wo du halt merkst, der kann gar nicht so ein komplettes System so weit betrachten, dass er irgendwie wirklich sinnvoll da die Ansätze finden würde.
Was er gut kann, ist halt eine Sandbox zerstören. Das ist relativ einfach. Dafür brauchst du noch nicht mal eine KI. Also Netflix hat schon vor über zehn Jahren ein System gehabt,
das nennt sich Chaos Monkey, was nichts anderes macht, als sie lassen mal einen wild gewordenen Zufallszahlengenerator, kombinieren sie mit Wissen über ihre Infrastruktur und sagen, die machen mal random Sachen kaputt. So, und das wiederum haben sie dann immer benutzt, um zu sagen, okay, wir können gar nicht vorhersehen, wo die Sachen von alleine kaputt gehen, also lassen wir diesen Zufallsgenerator da drauf los, der zufällig Sachen kaputt macht, weil der findet dann Schwachstellen.
Das ist ungefähr das Level, auf dem das funktioniert. Das ist so ein bisschen, mit LLM haben sie ein zehn Jahre altes Programm von Netflix nachgebaut und das hat dann auch ungefähr so performt, bloß viel teurer. Und Aber weil wir ja diese Art und Weise haben, auf KI zu gucken, dass wir denken, das ist ein Subjekt, das ist ein Akteur, das ist irgendwas, das kann jetzt losgehen, anstatt dass es halt irgendein Werkzeug von einem Menschen ist und da immer ein Mensch hinter steckt, dadurch sind wir gar nicht in der Lage, das so vernünftig zu analysieren.
Es ist halt, es kommt halt irgendwas vorbei, was wir eigentlich schon kennen, wo keiner sagen würde, oh, das ist jetzt besonders bedrohlich oder besonders neu, aber dadurch, dass irgendwie diese KI-Verpackung drauf ist, sind alle sofort geneigt zu glauben, oh ja, KI, höre ich ja jetzt schon seit drei Jahren, dass die gefährlich ist, jetzt ist die noch gefährlicher geworden.
Passt mir auch ganz gut in meine Argumentation, weil ich bin ja sowieso der Meinung, die Menschheit sollte sich vor dieser Gefahr... Also du kannst halt ungeheuer viel Podcaststunden bei Lanz und Precht darüber verlabern im Grunde genommen. Und das sorgt aber gleichzeitig dafür, dass wir nicht dahinter kommen, dass vieles von dem einfach nur Marketing-Gequatsche ist und vieles von dem uns auch nicht diese Ehrfurcht abverlangen muss, die wir immer davor haben, sondern dass man einfach auch wirklich da sein kann.
Nein, KI ist nicht der große Paradigmenwechsel, wo wir jetzt nichts mehr wissen, sondern man kann einfach den Mut haben, das nach den altherbekannten Maßstäben zu beurteilen und man muss halt nur ein bisschen Adaptionsarbeit leisten, dass man versteht, was von diesen neuen Begriffen ist eigentlich der alte Begriff.
Ja, lass uns mal, also falls du es da hast, noch ein paar Textbeispiele dieser Subjektivierung, also wo plötzlich die KI als Akteur, damit wir das später präsent haben, wenn wir Harari lesen, der ja da mitgeht.
Oh, da habe ich ganz viel, weil die Presse ist halt voll davon. Der Agent hackte anschließend Hugging Face, eine Datenbank für KI-Modelle, um Technologie zu finden, die ihm beim Bestehen der Hacking-Evaluierung helfen würde. Er hatte abgeleitet, dass Hugging Face möglicherweise Modelle, Datensätze und Lösungen für das Bestehen des Tests enthält. OpenAI erklärte, die Modelle hätten erfolgreiche Wege gefunden, Zugang zu geheimen Informationen zu erlangen, die sie nutzen konnten, um bei der Evaluierung zu schummeln.
Der Angriff endete, als das Sicherheitsteam von Hugging Face und dessen eigenen KI-Agenten die unerlaubten Aktivitäten entdeckten und stoppten.
Wo stand das? Wer hat das so geschrieben?
Das war Dan Milmo in das müsste der Guardian gewesen sein. Genau.
Ja, das ist, wenn man in der Sehgewohnheit drinsteckt, den Fortgang der Welt genauso zu beschreiben. Also Personalisierung ist ja schon seit ewig ein Problem. Helmut Kohl hat die Mauer eingerissen und der ganze Kram. Das ist natürlich besonders schwer, gerade in einem visuellen Zeitalter, also die 50er, 60er, 70er Jahre mit Zeitungstexten, da konnte man noch sozusagen schreiben, was Sache ist.
Später brauchte man den Protagonisten, ansonsten wäre es nicht darstellbar. Man braucht bis heute ARD und ZDF das Schnittmaterial von dem Protagonisten, dessen Wortspende man gleich hört, aber der muss schon mal durchs Bild laufen. Man muss ihn am Schreibtisch sehen und so. Und da ist natürlich die Frage, es gab einen Sicherheitsvorfall, ja wer ist denn der Übeltäter?
Und wenn du die dann nicht beantwortest, kannst du nicht Bericht erstatten.
Ja, Ross und Reiter sollen genannt werden.
Ross und Reiter, genau.
Das ist unsere Sehgewohnheit. Und die fällt uns aber eigentlich immer wieder bei dem Thema auf die Füße, weil das nämlich die Tür aufmacht für die KI-Unternehmen, uns da fleißig Zeugs zu erzählen. Wir haben ja auch hier weiter Dan Milmo. Die KI dachte, dass Hugging Face möglicherweise wichtige Informationen dazu enthalten könnte, wie sie ihr Ziel erreichen kann, nämlich eine bessere Punktzahl in einem Cybersecurity-Benchmark.
In diesem Sinne verhielt sie sich wie ein echter Hacker, sagte Nathaniel Jones, Vice President für Security und AI-Strategy beim Security-Unternehmen Darktrace. Sie bekam ein Ziel vorgegeben und machte sich daran, dieses Ziel zu erreichen. Also ich würde ja sagen, solange die nicht Club-Mate trinken kann, wird die nie ein echter Hacker. Ja.
Aber es ist natürlich dieses Lockpicking-Szenario. Man sitzt dran und dann, egal wie, das Schloss muss auf.
Genau. Ganz genau. Ja, und, Dann sagt er aber zum Beispiel, Bloomberg stellt dann fest, die Modelle arbeiteten ohne die üblichen Sicherheitsleitplanken, erklärte das Unternehmen, weil OpenAI vorgesehen hatte, dass sie in einem als Sandbox bezeichneten Testbereich verbleiben. Im Wesentlichen einer virtuellen und isolierten Softwareumgebung, in der Sicherheitstests durchgeführt oder unsicherer Code kontrolliert analysiert werden kann.
Das wird ja auch von verschiedenen Quellen nochmal beschrieben. Also zum Beispiel Stella Biderman, Geschäftsführerin des gemeinnützigen Forschungsinstituts EleutherAI, sagte, Unternehmen sollten interne Tests auf Air-Gap-Rechnern durchführen, die von der Außenwelt getrennt sind. Sie erklärte, OpenAI hätte den Vorfall auf diese Weise verhindern können. Absolut richtig. Also das ist einfach ein Hinweis darauf. Hättet ihr ganz normale Security-Hausaufgaben gemacht, hätte es hier keinen Vorfall zu berichten gegeben.
Tja, unter diesen Gesichtspunkten, also, ich sträube mich ein bisschen gegen den, das ist alles nur Marketing, denn auch das ist ja wieder ein, so wird es genutzt, illegitimerweise, denn der eigentliche Vorwurf, der zu machen ist, ist ja, es war schon echtes Hacking, nur von Leuten, die, strunzdumm damit umgegangen sind. Also diese Menge an Ressourcen zur Verfügung stellen, ist ja grundsätzlich gefährlich.
Das ist ja so, als würde ich einem Kind genau diese ganzen Guardrails nicht geben und sagen, du darfst jetzt eine Stunde durch dieses Museum laufen. Ich sage dir aber vorher nicht, was das ist und auch nicht, wie wertvoll die Sachen sind und ich schaffe kein Verständnis dafür, dass das kein Spielzeug ist und am Ende liegt alles in Trümmern.
Ja, das ist so das Szenario von diesem 80er-Jahre-Film WarGames. Da ist ja auch so ein Kid, was irgendwie irgendwelche staatlichen Systeme hackt und dann so einen Nuklearkrieg auslöst. Das sind alles halt keine neuen Bedrohungen, meiner Meinung nach. Also klar, wir lesen ja hier, es gab schon zugrunde liegende Fakten, aber die sind halt alle schon so in die Richtung gespinnt, dass es jetzt irgendwie eine große Gefahr projizieren soll.
Aber es gibt tatsächlich, die Leute setzen alle Windows ein. Das ist ein System, das hat bereits tausende von Sicherheitslücken, die nie geschlossen werden. Also das heißt, das haben wir auch überlebt.
Ich meine, es gibt.
Bot-Netze mit Hunderttausenden von Bots. Was heißt das, ein Bot? Ein Bot ist der Laptop von deiner Mutter, der ungesichert auf der Fensterbank steht, der seit Jahren nicht gepatcht wurde und der halt noch ein bisschen Rechenleistung hat, die man sich halt gut aneignen kann, indem man irgendein Virus da drauf spielt. Das ist dieses Klicken nicht auf Links im Internet. Das ist eigentlich die viel größere Gefahr, mit der wir tagtäglich leben, wo wir auch gar keinen Stress mit haben.
Und es gibt so Systeme wie Kali Linux. Kali Linux ist so eine VM, die kann sich jedes Kid installieren. Und da sind ohne Ende hunderte von Tools drauf, mit denen jedes Kid Hugging Face hacken kann, in dem Zustand, in dem es sich offensichtlich befindet. Da läuft aber keiner rum und sagt, das ist jetzt die Riesengefahr. Das interessiert einfach keinen.
Dann haben wir, wir haben so Probleme, wir haben tatsächlich reale Probleme, dass zum Beispiel Leute in den Knast kommen können, wenn sie halt bestimmte Sicherheitstools anwenden, um Systeme zu sichern.
Das ist der berühmte Hackerparagraf. Der existiert, ist mit Sicherheit um Größenordnungen gefährlicher, als alles, was KI uns antun könnte an der Stelle. Das ist, glaube ich, für mich so der Hauptgrund. Und es ist halt so, im Kern ist es natürlich nicht nur Marketing, blabla, aber die Proportionen, auf die das hochgeblasen wird.
Und dass es halt überhaupt nicht in Bezug gestellt wird, irgendwie zu den real existierenden Gefahren, mit denen wir tagtäglich leben. Das ist das Problem.
Das kann man ja eigentlich auch als Fazit hier sagen, weil jetzt in Hackerparagrafen. Der nimmt ja im Grunde aus dem Sicherheitsszenario die Menschen raus, während jetzt die Maschinen das alles bevölkern.
Genau. Also im Grunde genommen ist die Einzige, die Maschinen tun jetzt einfach das, was den Menschen verboten ist, weil wir die nicht im Knast stecken können. Das könnte man vielleicht noch so ein bisschen herausziehen an Unterschied. Aber im Grunde genommen schafft den Hackerparagrafen ab, wenn du es ernst meinst. Dann können die Leute selber ihre Systeme plötzlich sichern. Dann gibt es da auch für KI nichts zu tun, die ja auch nur in einer langen, langen Schlange von Angreifern steht, die da draußen eh schon warten und uns ausnutzen.
Also wie viele tausend Blueprints haben sich die Amerikaner von den Chinesen klauen lassen, einfach weil deren Systeme nicht gesichert waren?
Dann lass uns doch zum Ende nochmal den Hackerparagrafen genau beschreiben, wo das Problem ist. Also es gibt Tools, die wie immer Dual Use sind und weil man sie zum negativen Hacken benutzen kann, darf man sie auch nicht für Sicherheitsarbeiten benutzen.
Genau.
Ich kenne nur die Diskussion, die unter den Hackern beim CCC immer so abläuft. Aber dass wir das hier als Konsequenz bei Hugging Face unter, ja genau, weil da eben, also klar, es ist jetzt ein amerikanischer Vorfall und so, da sind die Gesetze nochmal anders, aber dass man hier mit menschliche Intelligenz, dagegen halten könnte und man sich das aber selbst verbietet, weil Gesetze aus einer Zeit, das ist ja auch eine andere Zeit, dass deswegen jetzt Tür und Tor offen steht für Maschinen, die das einfach machen.
Und nicht mal die Hacker selbst, also wenn wir noch die Zurechnung machen, OpenAI ist dafür erheblich mitverantwortlich, irgendwelche Leute haben diese Maschine da beauftragt und ihr die Ressourcen gegeben, nicht mal die wussten am Ende Bescheid, was da eigentlich passiert. Und das ist ja dann eine doppelte Gefahr. Wenn sie es bewusst gemacht hätten, wäre es gefährlich und müssten sozusagen forensisch nachvollzogen werden, auch juristisch, was da vor sich geht.
Aber dass nun zusätzlich diese Gefahr besteht, weil die Maschine das dann so, selbstständig will ich jetzt nicht mehr sagen, aber weil die Maschine einfach diese Ressourcen dann plötzlich jetzt nutzen kann und nicht mal die eigentlich schuldigen Verursacher noch sehen, was da passiert. Das ist ja nun wirklich eine neue Zeit.
Ja, also man nimmt halt irgendwie den Menschen die Kontrolle aus der Hand, gibt die halt irgendwelchen Maschinen, die es halt nicht richtig können und das ist dann die Gefahr. Wenn man halt wirklich an der Stelle halt immer sagen würde, da ist ein Mensch, der agiert. Das waren so ein paar Irre bei OpenAI, die auf die Idee gekommen sind, irgendwie mal alle Guardrails rauszunehmen und dann die KI auch möglichst lange unbeaufsichtigt laufen zu lassen.
Das ist ja die Idee, die gefährliche Idee gewesen sozusagen. Dann müsste man eigentlich sagen, sperrt die Leute bei OpenAI ein und alle anderen Leute, die sowas vorhaben, dann bist du da sicherer, als wenn du jetzt versuchst, das irgendwie in die KI reinzuprogrammieren.
Gut, noch ein Aspekt aus den Texten, den wir nicht unerwähnt lassen sollen.
Ich denke, wir haben so die wichtigsten Punkte angesprochen.
Sehr gut.
Ja.
Dann hören wir uns beim nächsten Mal.
Bis zum nächsten Mal im Kontextfenster.
Ende des Gesprächs