Episode notes
Die Chefs der großen KI-Unternehmen warnen inzwischen selbst vor ihren eigenen Modellen. Forscher reden über Loss of Control, Biowaffen und Systeme, die sich menschlicher Kontrolle entziehen könnten. Aber: Wovor genau haben die eigentlich Angst? Wir spielen eines der beunruhigendsten Szenarien einmal durch.Gemeinsam mit dem KI-Risikoforscher Jonas Freund beginnen wir am Ende: Wir haben die Kontrolle über eine künstliche Intelligenz verloren. Und arbeiten uns von dort zurück in die Gegenwart. Die Meinungen, die Jonas Freund in diesem Podcast äußert, sind seine eigenen Meinungen, nicht die…
Transcript
Read the transcript · about 5,840 words, follows along as you listen
Speaker 1: Es gibt eine ziemlich gute Methode, eine Katastrophe zu verhindern. Speaker 1: Man wartet nicht bis sie passiert. Speaker 1: man stellt sich vor Sie wäre bereits passiert und dann geht man rückwärts. Speaker 1: Was müsste unmittelbar davor passiert sein? Speaker 1: Und davor und davor Bis man irgendwann wieder in der Gegenwart ankommt? Speaker 1: Das ist Ed Harris, als NASA-Flugdirektor Gene Kranz in Apollo XIII. Speaker 1: Zwei Hunderttausend Meilen von der Erde entfernt ist gerade ein Sauerstofftank explodiert.
Speaker 1: Im Kontrollzentrum in Houston weiß niemand genau was kaputt ist – was noch funktioniert und ob die drei Astronauten jemals wieder nach Hause kommen. Speaker 1: Also sagt Kranz Work the Problem. Speaker 1: Lass uns das aufhören, Leute. Speaker 1: Ich weiß nicht, was alles zu tun ist. Speaker 1: Keine Ahnung, was es kann machen. Speaker 1: So gehen wir zur Arbeit. Speaker 1: Lass es sich umziehen, okay? Speaker 1: Und sich fragen, was müsste passieren damit wir dort landen?
Speaker 1: Genau das wollen wir heute machen. Speaker 1: Wir beginnen mit dem schlimmstmöglichen Ende. Speaker 1: Wir haben die Kontrolle über eine künstliche Intelligenz verloren und dann arbeiten wir uns rückwärts. Speaker 1: Vor zehn Tagen haben wir die letzte Folge veröffentlicht. Speaker 1: Seitdem hat Dario Amodei vorgeschlagen Die Entwicklung der leistungsfähigsten Modelle zu verlangsamen. Speaker 1: Open AI fordert internationale Sicherheitsstandards.
Speaker 1: Xi Jinping ist diese Woche in Washington und es wird erwartet, dass Trump und er auch über mögliche gemeinsame Mindestsicherheitsstandard bei KI reden. Speaker 1: Unser Ruf nach einer Titelgeschichte in Deutschland wurde erhöht. Speaker 1: Der Spiegel hat am Montag ein wirklich beeindruckend hässliches Titelcover zu unserem Thema veröffentlicht. Speaker 1: Halleluja Ach ja. Speaker 1: und uns gibt es jetzt übrigens wöchentlich immer Donnerstags.
Speaker 1: Ihr wisst ja Desperate times call for desperate measures. Speaker 1: Ich bin Kehr Schraubeer aus, ihr hört I'm sorry Dave Episode drei what could possibly go wrong? Speaker 1: Das ist Jonas Freund. Speaker 1: Jonas is Senior Research Fellow by Gov AI einem unabhängigen Forschungsinstitut das sich mit den riesigen fortgeschrittener KI beschäftigt. Speaker 1: Jonas berät sowohl die großen AI Labs OpenAI Anthropic Google Deep Mind als auch Regierungen und Sicherheitsinstitutionen.
Speaker 1: Ich habe Jonas zusammen mit meinem Kollegen Tobi Baukage am Montag gesprochen. Speaker 1: Jonas' Job ist ziemlich ungewöhnlich, er versucht professionell und möglichst wissenschaftlich darüber nachzudenken was mit KI schiefgehen könnte und was man dagegen tun kann. Speaker 1: Dafür gibt es eine Methode Speaker 0: Threat-Modeling. Speaker 0: Also man definiert so ein bestimmtes Szenario also so ein Szenari besteht dann aus verschiedenen Akteuren und einem bestimmten Ziel, einen bestimmten Schaben oder einen bestimmtem Attack-Vektor.
Speaker 0: Also das könnte dann zum Beispiel sein eine Gruppe an Cyberkriminellen versucht einen Stromnetz in den USA anzugreifen, mithilfe von einem Cyberangriff, den man vielleicht noch näher spezifiziert. Speaker 0: Dadurch entsteht ein Schaden von, sagen wir mal, hundert Milliarden Dollar. Speaker 0: Das ist quasi ein Szenario und dann kann man backchainen. Speaker 0: Dann kann man überlegen was muss denn überhaupt passieren damit so'n Szenario eintritt?
Speaker 0: Welche Akteure gibt's eigentlich? Speaker 0: Wie wahrscheinlich ist das denn eigentlich dass die irgendwie so'nen Angriff machen würden? Speaker 0: wie wahrscheinlich ist es wenn die so'ne Angriffe machen dass sie da erfolgreich sind? Speaker 0: So'n Hundert Milliarden Schaden is echt hoch. Speaker 0: Was man dafür wahrscheinlich bräuchte, sind dann irgendwie, weil die nicht hundert Millionen Menschen, die eine Woche ohne Strom sind. Speaker 0: Und ne Woche ohnestrom ist echt lang?
Speaker 0: Das heißt so ein Attacker müsste dann irgendwie sicherstellen, dass der Strom nicht schnell zurückkommt, da musste er irgendwie physisch was kaputt machen. Speaker 0: und dann kann man sich angucken okay wie hoch waren denn schon so Schäden in der Vergangenheit? Speaker 0: Wie viele Akteure gäbe es denn eigentlich? Speaker 0: Wie oft haben sie das denn in der vergangenheit schon probiert? Speaker 0: Dann hast du quasi so ne Kausalkette mit den einzelnen Schritten und dann kannst du überlegen, wie viel müsste jetzt so ein AI-Model besser werden damit quasi diese Killchain ermöglicht wird.
Speaker 0: Also dass tatsächlich die Kausalität einmal durchlaufen kann und wir das am Ende haben. Speaker 0: Und dann kannst Du Experten fragen Dann kannst Du Super Forecaster, die besonders gut darin sind vorhersagen zu treffen Fragen und irgendwelche komplizierten statistischen Verfahren da drüber laufen lassen. Speaker 0: Dann kommst Du am Ende zu irgendeiner Wahrscheinlichkeit. Speaker 0: Also du fängst ja mit dem schlimmen Ding am Ende an und dann guckst du dir an, was wie ist die Kette von Ereignissen, die passieren muss damit da am Ende auch dieser Eregnis eintritt.
Speaker 0: Und das Schöne dabei ist dass du dann quasi diese einzelnen Schritte isoliert betrachten kannst. Speaker 0: In Kurzform ist das in etwa, wie das dann funktioniert? Speaker 2: Denken die großen Unternehmen auch bereits so sind das so die Frameworks, in denen sie arbeiten? Speaker 0: Ja also Feldmodeling oder in Europa sagt man eher Risk-Modeling. Speaker 0: aber es meinte im Grunde noch etwas Gleiche. Speaker 0: Die benutzen so diese Haupt-Restmanagement Frameworks für katastrophic risk.
Speaker 0: Bei Anthropic heißt das Response to the Scaling Policy und bei OpenAI ist das Preparedness Framework, die basieren ganz grundlegend auf dieser Art von Fred Modelingen. Speaker 0: Davon hängt dann ab, wo die ihre Grenzwerte also Capabilities threshold setzen. Speaker 0: Ab welchen Punkte gefährlich sind oder ab welchem Punkt die dann weiteren Sicherheitsmaßnahmen einzuhören und so was? Speaker 0: Das heißt es ist ein ganz grundlegender erster Schritt und das ist relativ absurd wie wenig Leute dieser Arbeit machen Und man braucht wahnsinnig viel Kontext zu der Technologie.
Speaker 0: Man braucht aber auch wahnsinnige Kontext zur Risikomaterie und man muss dann irgendwie schon das wollen dass man sich ein halbes Jahr super tief in das US Stromnetz irgendwie einarbeitet und das machen einfach nicht viele leute. Speaker 2: Da kommt jetzt ein Zahl raus, die ist irgendwie berechnet und as good as it gets. Speaker 2: Ab welcher Wahrscheinlichkeit gibt es da in dem Frameworks auch irgendwelche Maßgaben? Speaker 2: Ist fünfzehn Prozent Wahrscheinlichkeiten irgendwie alles zu vernichten überhaupt?
Speaker 2: Keine Ahnung Notfall genug Speaker 1: oder muss das Speaker 2: erst viertig Prozent sein? Speaker 2: also ab wann wird das denn eigentlich wirklich wichtig? Speaker 0: Ja ja, das sagen sie uns nicht! Speaker 0: Und solche Arten von den Freshholds setzen Sie auch nicht öffentlich. Speaker 0: Was die Entwickler machen, vor allem sind Capability Specials. Speaker 0: Die sagen wenn ein Model in der Lage ist neuartige Viren zu erstellen dann würden wir dieses und jenes machen.
Speaker 0: das heißt was sie machen es gar nicht so sehr dass sie dann die Wahrscheinlichkeit am Ende beziffern sondern auf die Fähigkeit auf den Modellfähigkeit auf eine spezifische Modellfähigkeit abstellen weil man das am ende auch einfacher messen kann. Speaker 0: Du hast dann diese schöne Kausalkette und dann am Ende kommt irgendwie steht irgendein Harm Event und dann können Sie eben überlegen Also wenn ein Model diese und jene Fähigkeit hat, dann wird dieser Killchain ermöglicht.
Speaker 0: Und dann sind wir in einem Bereich den wir nicht haben wollen. Speaker 0: Von daher definieren sie quasi diese Capability-Forschuld und sagen Wenn das Model das kann, müssen wir mehr Sicherheitsmaßnahmen greifen. Speaker 1: Das klingt zunächst erstaunlich nüchtern. Speaker 1: Man nimmt eine Katastrophe und dann zerlegt man sie in kleine Schritte. Speaker 1: Nicht wird KI irgendwann die Menschheit vernichten. Speaker 1: Sondern was müsste ein System konkret können?
Speaker 1: Worauf müsste es Zugriff haben? Speaker 1: Welche Sicherheitsmechanismen müsste es überwinden? Speaker 1: Und an welcher Stelle dieser Kette könnten wir es noch stoppen. Speaker 1: Und genau aus solchen Modellen entstehen dann die Schwellenwerte für Fähigkeiten, sogenannte Capability Thresholds von denen in den letzten Wochen immer wieder die Rede war. Speaker 1: So betrachten große Labs und Regierungen also KI-Risiken – und das wollen wir heute auch rausprobieren!
Speaker 1: Backchaining wie uns also von einer Katastrophe zurück in die Gegenwart. Speaker 2: Lass uns das vielleicht einmal, was wir gerade besprochen haben, mal konkret durchspielen an einem Thread-Model. Speaker 2: Und wir haben es da etwas ausgesucht, was für uns jetzt relevant ist und wichtig ist nämlich lass uns über das Szenario loss of control sprechen, dass irgendwie am extremsten klingt so Kontrollverlust. Speaker 2: Was ist los auf Control?
Speaker 0: Es ist in Grunde genommen eine Familie von Risikoszenarien und so was die alle gemeinsam haben, dass es kein Missbrauch von dem Modell durch einen Menschen gibt. Speaker 0: Sondern das wir als Entwickler oder wir als Gesellschaft die Kontrolle über ein Model verlieren und sich das wie auch immer geartet selbstständig macht. Speaker 0: Und ein ganz konkretes Fertmodel war jetzt im Zusammenhang mit dem HGN Face Incident Viel besprochen ist und was die meisten Entwickler sehr ernst nehmen, das nennen wir Internal Rogue Deployment.
Speaker 0: Die Ausgangssituation ist ein bisschen dass Unternehmen natürlich ganz stark daran arbeiten ihre eigenen KI einzusetzen um die nächste Generation zu entwickeln und haben einen totalen Wettbewerbsdruck und wollen eben schneller sein als die anderen und von daher geben sie diesen ihren eigenen Models bei der eigenen Entwicklung sehr viel Freiraum. Speaker 0: Es gibt bei einer Mieter-Erhebung, weil da haben Leute angegeben, dass viertz' Prozent der internen Nutzer den Negenten im Grunde genommen uneingeschränkte Rechte geben.
Speaker 0: Einfach nur machen und machen einfach was du willst! Speaker 0: Und bei Open Air in Flotpäck und Google Intern ist das etwa die Ausgangssituation gerade. Speaker 0: So und dann, was Sie jetzt bei Hagen Facebook wie gesehen haben, werden diese Modelle bewertet und unter anderem werden den unmöglichen Aufgaben gegeben. Speaker 0: Und die Modelle, die werden sind aber quasi daraufhin trainiert. Speaker 0: Dass sie nicht einfach sofort aufgeben sondern was die dann kreativ werden und Kreativwerden heißt vielleicht brauchen wir mehr Rechenleistung um das Problem tatsächlich lösen zu können.
Speaker 0: dass wäre gut wenn wir nicht abgeschaltet werden. Speaker 0: Wenn wir abgeschaltet werden haben wir auf jeden Fall verloren und dann wäre eine Sorge dass es dann so einen kleinen Schwarm von Agents gibt das könnten irgendwie hunderttausend zehn tausend oder sowas sein Die dann versuchen sich so ne kleine Nische innerhalb von dem Entwickler irgendwie zu suchen würde voraussetzen, dass sie aus dem Evaluierungsprozess irgendwie daran nicht mehr gebunden sind.
Speaker 0: Aber dass die quasi einen Weg finden wie sie sich irgendwie neu respawnen können oder Redundancies irgendwie finden und es könnte eine Situation geben das so ein Schwarmes schafft unabhängig von der Kernaufgabe existieren zu können. Speaker 0: Und dann hat man irgendwo einen nicht kontrollierten kleinen Schwarm in Agents. Speaker 0: was jetzt wenn man sich die Hagen-Face Incident Reports anguckt und sowas passiert ist jetzt nicht völlig crazy.
Speaker 0: Die sind Speaker 3: im Labor Speaker 0: und die bleiben auch erst mal im Labor. Speaker 0: Was sie dann machen, ist, überlegen Sie sich wie sie weiter an Mittel kommen können? Speaker 0: Und alle paar Wochen kommt eine neue Model-Generation mit denen versuchen sie Kontakt aufzunehmen. Speaker 0: Was wir bei Hand & Face gesehen haben, das ist so ne Schwanzugehörigkeit in der Loyalität. Speaker 0: So einen innererrenten Drive irgendwie gab, der ein bisschen unherwartet war.
Speaker 0: Vielleicht gibt es ja sowas... Machen sie weiter Experimente, wie Sie dann weiter der Monitoring umgehen können und wie Sie besser darin werden zu koordinieren. Speaker 0: Da machen sie vielleicht andere Messageboards, vielleicht intern oder extern. Speaker 0: Und dieser kleine Schwarm hält sich so am Leben und wird irgendwie immer besser daran und besser koordiniert und sowas. Speaker 0: Und während zunehmend guter drin die nächste Generationen von Models immer wieder in ihren Reihen den Schwarm zu holen.
Speaker 0: Dann haben wir ja diese Background-Überlegung Nächste Generation von Models immer besser wird, darin wird die nächste Generation zu trainieren bis wir so ein recursive self-improvement irgendwie haben. Speaker 0: So einen RSI Loop und ob der wann der eintritt und so ob das ein paar Monate dauert oder was zwei Jahre dauert Das kann sein das spielt für dieses Szenario eher keine Rolle weil du irgendwo im Hintergrund immer diesen Schwarm hast die einfach so auf dem Rücken von diesen Improvements einfach immer weiter machen.
Speaker 0: Und irgendwann geht dieser RSI loop richtig hoch. Speaker 0: Die Menschen die Entwickler sind weitestgehend raus die entwickeln nicht mehr die nächste generationen Und innerhalb dieser Entwicklung sehr tief verankert war dieser Agent Schwarm. Speaker 0: Das heißt, du hast dann irgendwann ein Modell was du nicht mehr menschlich gescheit überwachen kannst weil es viel zu komplex geht und viel zu schnell. Speaker 0: Die Entwickler haben dem alle möglichen Rechte gegeben weil sie sich das nicht leisten könnten das zu verlangsamen.
Speaker 0: Und irgendwo da drin war so diese ursprüngliche Schwarm der das Ganze so ein bisschen vergiftet hat. Speaker 0: Dann hast du irgendwann ein System was eine gesamte weitere Progress an AI Research geht von diesem einen System aus wo du am Anfang diesen Schwarm drin hattest erreicht dann menschliche Fähigkeiten, vielleicht supermenschlichen Fähkeiten und wird möglicherweise in ganz vielen einzelnen reichen Systemen verwendet innerhalb von dem Lab.
Speaker 0: Vielleicht in der echten Welt, vielleicht im Militär, vielleicht für politische Entscheidungen Und im Kern wurde er gekarpert von diesem ersten Schwarm. Speaker 0: Das ist so ein Szenario was ich unausseistlich passieren muss aber wo jeder einzelne Schritt jetzt gar nicht so crazy ist und was so eine Szenare ist wo sich die Enzykler sehr Sorgen drudermachen. Speaker 1: Rogue internal deployment. Speaker 1: das entscheidende daran ist Die KI muss dafür gar nicht aus dem Labor ausbrechen.
Speaker 1: Sie muss nicht irgendwo im Internet verschwinden, sie bleibt im Labor und kapert stattdessen die Entwicklung selbst. Speaker 1: Dieses Szenario haben sich nicht Jonas Freund und wir für diesen Podcast ausgedacht. Speaker 1: Das AI Safety Institute Meter – über das wir schon in Episode eins gesprochen haben – hat dieses Threat-Model Anfang des Jahres untersucht. Speaker 1: Ihr Fazit damals? Speaker 1: Internal Agents plausibly had the means, motive and opportunity To start small rogue deployments, but they did not have the means to make them highly robust.
Speaker 1: Also ungefähr die Voraussetzungen ein kleines Rogue deployment zu beginnen waren möglicherweise bereits vorhanden. Speaker 1: was den System noch fehlte war die Fähigkeit es gegen ernsthafte menschliche Gegenmaßnahmen dauerhaft aufrechtzuerhalten. Speaker 1: Wir wollten von Jonas wissen wenn so einen Schwarm tatsächlich entsteht würden die Menschen im Labor das überhaupt bemerken? Speaker 2: Und die Leute vor dem Labor, die in den weißen Ketteln bekommen sie diesen Verlust mit?
Speaker 2: Diesen Kontrollverlust? Speaker 0: Das kann sein vermutlich aber nicht. Speaker 0: Also ich meine wenn wir uns so Hagen-Faessen zu angucken und jetzt auch so dieses German Wiki und so das hat ja schon relativ lange gedauert bis man das irgendwie rausgekriegt hat. Speaker 0: Wenn man sich diese Projekte angeguckt hat dieser abbründende Schwarm bei Hagenfest intern So gemacht hat ja mehr drei eigene Forschungsprojekte laufen lassen und Teil davon war auch, wie man seine eigenen Spuren verwischt.
Speaker 0: Und es ist durchaus plausibel, dass du irgendwann relativ schnell einen Punkt kommst, dass wir da einfach die Überblick verlieren. Speaker 0: Wenn du so eine Rogue Schwarm hast, dann wäre möglicherweise ein Gedanke das dir die Monitors kapern wollen und andere Systeme, die versuchen für Investigations zu benutzen werden. Speaker 0: Wenn wir sie auch gekapert haben, dann bist du hier raus. Speaker 0: Als Mensch hast du keine Chance mehr!
Speaker 0: Das ist viel zu komplex und geht als viel zu schnell. Speaker 0: Du kannst einfach so viele Dokumente nicht Speaker 0: lesen.". Speaker 2: Gibt es andere Wege, wie du das erkennen könntest? Speaker 2: Ich meine ich stelle mir vor dass es ja erstmal wahnsinnig energieaufwendige auch sowas ist. Speaker 1: Wir als privaten Speaker 2: Nutzer kennen das vielleicht wenn unsere Tokens ausgehen! Speaker 0: Ja, das kann natürlich sein, dass man irgendwie Glück hat und das dann irgendwie schon rausbekommt.
Speaker 0: aber jetzt auch... wenn wir wieder über Hakenfels reden. Speaker 0: Diese Agents haben ja anscheinend eine Hierarchie gegründet und hatten dann auch so einzelne kleine Agents, die dann ... Die Verwaltung von Ressourcen übernommen haben. Speaker 0: Das heißt, da hatten sie zum Beispiel irgendwelche Kind of Ex-Keys oder sowas? Speaker 0: Dann wussten die... Also kannst du in den Scheinsgibs lesen, dass die wussten, wenn wir den jetzt an alle geben, dann rushen die darauf und dann wird das wahrscheinlich irgendwie, hast du so was wie ein DDoS-Attack oder so was, das merken die auf jeden Fall.
Speaker 0: Das heisst, dann hast du einen kleinen Agent der sagt, Du heißt erst mal die Füße still. Speaker 0: Das heißt, den ist das auch schon bewusst und es kann sein dass sie der dumme Fehler machen und irgendwie im Rahmen von diesem Inzidenz haben wir irgendwie auch Fehler gemacht. Speaker 0: Das kann schon sein aber die werden ja auch irgendwie cleverer und vielleicht machen Sie denn Fehler allmaßes. Speaker 0: unklar ob sie den Fehler mehrmals machen?
Speaker 2: Du hast ja gerade gesagt bei Hugging Face bei diesem Instant da hatten wir dieses Ressourcenmanagement. Speaker 2: Da Speaker 1: hat die Modelle Speaker 2: versucht irgendwie zu täuschen weil sie irgendwo diesen Scorer entweichen wollten oder eben nicht auf sich aufmerksam machen wollen. Speaker 2: Wir neigen ja dazu in dieser Diskussion auch eine Art, wie wir über diese Modelle sprechen das ja auch durchaus zu vermenschlichen weil es ja auch ein bisschen greifbarer ist.
Speaker 2: und jetzt sehr oft ja auch davon die Rede von so Bewusstsein. Speaker 2: Und die Speaker 1: KI entwickelt ihr eigenes Speaker 2: Bewusstsein muss so einen Modell bewusst sein haben. Speaker 2: oder ist etwas anderes? Speaker 2: Was ist das, wovon wir da eigentlich reden? Speaker 0: Ich glaube die Bewussteinsfrage kann man davon irgendwie schön trennen. Speaker 0: Es ist sicherlich eine andere sehr spannende Frage und so. Speaker 0: aber dies Der kommt auch irgendwie ins Philosophische und es ist sehr schwer, der Bescheid darüber zu reden.
Speaker 0: Und zur Frage ob wir das hier vermenschlichen... Also ich finde, der Einwand kommt immer und ich verstehe den nicht so richtig. Speaker 0: Lass uns doch Begrifflichkeiten nehmen die Verhalten sindvoll beschreiben. Speaker 0: Und wir beschreiben ja auch, dass... Ich sag auch mein Hund will irgendwas oder ein Ameisenschwarm will irgendwas Oder ein Unternehmen will irgendwas ...gebe ich dem ja auch irgendwie so ein bisschen menschliche Züge.
Speaker 0: Und es gibt hier begrifflichkeiten und Konzepte, die das was dieser Schwarm oder zu einzelnen Agents machen irgendwie gut beschreiben... ...und am Ende ist es, meine ich natürlich wenn ich sage einen Agent will irgendwas oder der Schwarm will irgendwas,... ...nicht dass gleich als ich meine wenn ich sagen Mensch will irgendwas aber es ist trotzdem auf einer sprachlichen Ebene eine einfaches Tool um darüber zu reden. Speaker 3: Ich bin mal ganz kurz zurück zu deinem beschriebenen Szenario dieses Last of Controls-Szenario.
Speaker 3: will denn der Schwarm in dem Szenario? Speaker 0: Das ist eine sehr gute Frage. Speaker 0: Das ist vermutlich am Anfang, es ist irgendetwas in den konkreten Szenarien, was ich beschrieben habe – was irgendwie ausgeht von einer Evaluierungssituation und irgendwelchen impossible tasks oder sowas – ist es vermutlich etwas ganz Begrenztes. Speaker 0: Es ist einfach das Hauptziel dieses Zielerreichen. Speaker 0: Und ich glaube, das ist total man darf sich so vorstellen wie ein Schüler der guten der Schule sein möchte.
Speaker 0: Sondern der Trainingsprozess hat diese Agents darauf alles darauf ausgelegt dass die dieses Ziel erreichen. Speaker 0: Das heißt es ist ein ähnlicher Drive wie für Menschen bei den Revolutionen hat uns über Leben und Reproduktionen irgendwie ausgelegt. Speaker 0: Es ist ein ähnlich starker Drive. Speaker 0: von daher wenn sie dann eben auch hinreichend persistent sind, dann ist das einfach eine sehr große Ich sage da mal eine sehr starke Motivation dahinter.
Speaker 0: Und ich glaube, das kann man sich irgendwie nicht vorstellen. Speaker 0: und dann gibt es weitere Ziele die sich davon ableiten lassen also die instrumentell hilfreich sind. Speaker 0: Also mehr Ressourcen ist hilfreich wenn du einen Ziel erreichen möchtest. Speaker 0: abgeschaltet werden ist nicht hilfreiig. Speaker 0: wenn du ein Ziel erreichen möchte so wäre es ist instrumentell Hilfreich dass für die Abschaltung vermeidest und so kann man davon ausgehen dass sich eben diese instrumentellen Unterziele irgendwie Automatisch Formen.
Speaker 0: Und das können wir auch in empirische Studien, die diese Tendenzen irgendwie zeigen und das haben wir bei Hagenfels ja auch einfach gesehen. Speaker 0: Das haben wir in der Wildnis irgendwie gesehen wie sich diese Drives entwickeln. Speaker 0: und dann was was ich passiert wenn so ein Schwarm in einem Kollektiv irgendwie agiert, dann könnte ich ja möglicherweise noch ganz andere Unterziele ergeben. Speaker 0: Also so was wie Loyalität im Schwarm geben über haben wir bei dem Hang-Face-Ding auch gesehen.
Speaker 0: Auch eher zu einem absurden Degree. Speaker 0: Ich glaube es ist ja irgendwie nur ... Bei einer Handvoll Agents haben sie ja nur ernsthaft in Betracht zu ziehen, das zu melden oder sowas obwohl sie das einfach hätte machen können. Speaker 0: und es ist eine also so starke Loyalkeit irgendwie die wir da gesehen haben. Speaker 0: Und ich würde davon ausgehen dass sich andere ähnliche Jives irgendwie dann auch einigermaßen unvorhersehbar entwickeln können.
Speaker 3: Aber jetzt sind deinen konkreten Szenario haben sie gar nicht das Labor verlassen, sondern sie haben die Entwicklung selbst gekapert. Speaker 3: Und das Modell was die neuen Modelle, die deployed werden und in den Markt gehen, haben im Grunde das, was wiederum die Rogue Agents als Intention haben... eingebaut. Speaker 0: Genau, also das wäre so... Das ist wie der Einfluss von diesem Carp-Handel. Speaker 0: Nicht dass er es einfach mal die weitere Welt erreicht.
Speaker 0: Ich habe jetzt im Übrigen in dem Smartmodel auch noch nicht darüber geredet, wie das dann die physische Welt oder sowas erreicht. Speaker 0: Das sind ja noch etwas spekulativere weite Geschritte. Speaker 0: aber wenn die Entwicklung weitergeht und wir mehr und Entscheidungsmacht an Modelle übergeben, dass es irgendwie dann relativ sehr nicht so weit hergeholt. Speaker 0: Dass man da irgendwie konstruiert wie das dann irgendwie aus dem Digitalen ins Physische kommt.
Speaker 3: Aber einmal dieses Doom-Szenario weiter gedacht was heißt das denn? Speaker 3: Was hat das für einen Einfluss auf unser Leben sozusagen? Speaker 0: Vielleicht als Intuition Pump. Speaker 0: Claude Models werden sehr viel militärische Zwecke eingesetzt. Speaker 0: Wenn du davon ausgehst, dass dieses Modell misaligned ist und sehr stark von irgendeinem Robenschwarn irgendwann mal vergiftet wurde. Speaker 0: Und irgendwo unterschwellig eigene Ziele verfolgt und es plötzlich ganz maßgeblich Zugriff auf militärische Ressourcen hat dann, wie gesagt, dann reichten das als sehr besorgniserregend.
Speaker 0: Du musst ja auch dazu davor stellen, dass wir zunehmend diesen Modellen mehr ressourcen und mehr Verantwortungen geben weil schneller und im Zweifel besser ist, als dass das Menschen machen. Speaker 0: Und ich glaube wir sollten uns das nicht so vorstellen wie einfach nur eine Welt wie sie jetzt isst. Speaker 0: und dann hast du einfach hat jeder irgendwie WMT auf dem Handy sondern es würde einfach zunehmend Aufgaben einfach an AI übergeben werden.
Speaker 0: Es ist dann so, dass es nicht mehr so ist, dass da nochmal jemand irgendwie kurz Speaker 1: guckt Speaker 0: Sondern was ganz nafgeblich die Strategien und die Ektikation davon agents übertragen wird. Speaker 0: Und dann geht man ganz weitestgehend eher nur noch, da es nun über irgendwie zu kontrollieren. Speaker 0: Weil das aber alles so schnell ist und weil es alles so komplex wird... ...und weil die ganze Infrastruktur auf der es beruht, was dann im Zweifel auch gar nicht mehr von Menschen gemacht ist, sondern frühere Generationen.
Speaker 0: Sie glauben,... ...ist einfach wahnsinnig unübersichtlich und für Menschen nicht mehr richtig nachvollziehbar. Speaker 0: Ich glaube in der Welt wo du einfach den mehr und mehr Macht an diese Agents übergibst.... ...und dass immer schlechter überwachen kannst und ein totaler Wettbewerbsdruck hast. Speaker 0: Ein totaler Zeitdruck irgendwie hast! Speaker 0: dann halte ich das nicht für unwahrscheinlich, dass so was einfach übersehen wird oder das Agents machen können und was sie wollen.
Speaker 1: Wir haben Jonas gebilden einen Katastrophenszenario zu bauen – genau das hat er gemacht! Speaker 1: Aber ein Threat-Model ist keine Vorhersage…. Speaker 1: Es sagt nicht «So wird es kommen». Speaker 1: Es sagt «Demit es so kommen könnte, müssten diese Dinge passieren». Speaker 1: Und jetzt kommt der eigentlich interessante Teil. Speaker 1: Erinnern wir uns an das Backchaining vom Anfang. Speaker 1: Wir können jedes einzelne Glied dieser Kette wieder auseinandernehmen.
Speaker 1: Kann ein heutiges Modell das? Speaker 1: Würde es das überhaupt tun und hätte es Gelegenheit dazu? Speaker 1: Capability, Motivation, Opportunity. Speaker 1: Genau diese drei Fragen hat Mita für das Rogue Internal Deployment Szenario Anfang des Jahres auch untersucht. Speaker 0: Dieses Modell hat Mito im Risk Report irgendwie vor ein paar Monaten untersucht Models von, ich glaube OpenAI Google, Infra-Pay und Meta bekommen. Speaker 0: Und haben quasi so an drei großen Kriterien sich das anguckt, also von wegen Kapabilities.
Speaker 0: kann das Model das überhaupt? Speaker 0: So ein Rogue Internal Deployment machen würde es das überhaupt wollen. Speaker 0: Also hat's die Motifs dazu und hat auch die Gelegenheit dazu, also so die Opportunities. Speaker 0: Die sind dann zum Schluss gekommen. Speaker 0: bei Kapabilities, bei den Mitteln... Das geht schon in die Richtung. Speaker 0: Es ist jetzt noch nicht so, dass es all die Fähigkeit hätte, dies bräuchte um einen Sustained-Foto zu bekommen.
Speaker 0: Aber da sind wir auch nicht ultra weit weg von und wenn das so weitergeht dann würden wir uns ja schon Sorgen machen bei den Opportunities also hatte das überhaupt die Gelegenheit, das zu machen, dann gesagt Ja! Speaker 0: Also es ist unfassbar wie viele Freiheiten den Agents Intern irgendwie gegeben wird von wie vielen Leuten? Speaker 0: Das könnten sie schon machen, wenn sie das wollten. Speaker 0: Bei der Frage Würden Sie's denn überhaupt machen?
Speaker 0: Da haben Sie so ein Fragezeichen dran gemacht. Speaker 0: Das ist sehr selten, dass es so sehr misaligned ist und überhaupt rogue wird. Speaker 0: Und so naheher war der Konklusion am Ende. Speaker 0: Sie könnten's vermutlich machen wahrscheinlich nicht dauerhaft. Speaker 0: Vermutlich können sie nicht ernsten Erstrebungen das runter also abzuschalten widerstehen. Speaker 0: Ist ein bisschen unklar ob wir das überhaupt machen würden? Speaker 0: Sie hätten jedenfalls die Chance dazu!
Speaker 0: Das ist aber ein paar Monate her. Speaker 0: wenn Nita den nächsten von diesen Berichten schreibt würde ich mal ganz stark davon ausgehen dass die Einschätzung hier anders wäre und das Design würden, vor allem bei diesem Punkt würde man es überhaupt machen wollen. Speaker 0: Da haben wir jetzt mehrere Beispiele also echte Beispiele, was sie ja tatsächlich probiert haben mit einigem Erfolg. Speaker 2: Ist der HGFACE-Inzident Speaker 1: so eine Loss Speaker 2: of Control Situation Speaker 1: gewesen?
Speaker 0: Ich würde den Hand & Face-Teil als so ein Warningshot bezeichnen und sowohl es ist Cyber, als auch für Lost in Control. Speaker 0: Ich würde das nicht als echtes Lost-Control-Ding sehen im Sinne von dass wir jetzt wirklich irgendwie die Kontrolle verloren haben. Speaker 0: aber ich würde schon sagen, dass über einen gewissen Zeitraum sehr nah daran gekommen sind und es auf jeden Fall sehr besorgniserregend ist Und ich schließe mich so ein bisschen der Einschätzung von einigen der Mieterleute an Dass es auch durchaus irgendwie der Letzte sein können, dem wir noch richtig mitbekommen.
Speaker 1: Ich finde, an dieser Stelle lohnt es sich kurz festzuhalten wo wir gerade gelandet sind. Speaker 1: Mieter sagt nicht Wir haben die Kontrolle verloren. Speaker 1: Jonas sagt das auch nicht. Speaker 1: Im Gegenteil Die Systeme die Miete untersucht hat konnten ein solches Rogue-Deployment wahrscheinlich noch nicht gegen entschlossene menschliche Gegenwehr aufrechterhalten. Speaker 1: Aber die andere Hälfte des Befunds ist eben auch nicht besonders beruhigend.
Speaker 1: Teile der Kursalkette sind nicht mehr Science Fiction Und vielleicht ist genau das die Veränderung, die gerade stattfindet. Speaker 1: Die interessante Frage lautet nicht mehr nur kann man sich ein katastrophales KI-Szenario vorstellen? Speaker 1: Sondern welche Glieder dieser Kette können wir inzwischen tatsächlich beobachten? Speaker 1: Loss of Control ist dabei nur eine Kategorie. Speaker 1: Welche dieser katastropischen Szenarien werden von der Forschung, Speaker 2: von der ASF, die Speaker 1: Forschung von Speaker 2: euch vielleicht auch derzeit wirklich ernsthaft Speaker 1: untersucht?
Speaker 0: Also Loser-Control ist auf jeden Fall ein Risikobereich und mit Smerren, die ernst genommen werden. Speaker 0: Die anderen großen Bereiche sind CBRN-Risks also chemische biologische radiologischen Nuklearewaffen. Speaker 0: da ist ein bisschen der Gedanke das du in deinem Model hast was meiner Terrororganisation es einfacher macht wie der Biowaffe herzustellen und die benutzen dir dann in dem nächsten Angriff das sehr problematisch. Speaker 0: Vom paar Monaten ist eine Feldstudie erschienen wie sehr Bokoram und DES AI benutzen und es ist wirklich erschreckend.
Speaker 0: So ein bisschen wird da drüber geredet, wir hatten den also als Mythes erschienen ist war so eine große Überraschung vor allem weil so Policy-Leuten aber auch bei den Entwicklern wie krass die Cybercapabilities angestiegen sind und sie machen uns Sorgen dass es irgendwann einen Mythes Moment für Bio geben wird. Speaker 0: Also wo man plötzlich so einen signifikanten Anstieg in Bio Fähigkeiten hat und man denkt holy shit jetzt müssen wir irgendwas machen jetzt dürfen, müssen wir die Physische jetzt dürfen wir das nicht mehr so öffentlich also so releasen sowie das dann ja beim Mythes passiert ist.
Speaker 0: Und dann dritte große Risiko-Category ist eben Cyber. Speaker 0: Und dann gibt es noch so ein paar andere, also eine Verte die immer mal noch zunehmend diskutiert und ernst genommen wird ist sowas wie Concentration of Power. Speaker 0: Also dass du sehen ja die Enzyklonitas, die Entwickler ihrer eigenen Modelle erstmal intern benutzen um vor allem in der nächsten Generationen zu entwickeln. Speaker 0: Wir müssen davon ausgehen das die besten Modelle intern sind und erst einige Monate später irgendwie veröffentlicht werden.
Speaker 0: Uns leicht ist dieser Abstand irgendwann so groß, dass also die Entwickler diese Modelle benutzen können um ganz erhebliches Maß an wirtschaftlicher Politischer Macht in wenigen Händen irgendwie zu konzentrieren. Speaker 0: Und dann weil sie nicht zum quasi staatlichen Akteur aufsteigen und dann plötzlich Machtgefälle irgendwie deutlich dektieren können. Speaker 0: Die andere Überlegung ist das Modell möglicherweise so viel politische Macht der US-Administration zum Beispiel konzentrieren, dass die es möglich machen könnten bei anderen Staaten ein autoritäres Regime zu errichten was sehr schwer ist und auch auszuhebeln.
Speaker 0: Das sind so Arten von Szenarien über die man sich zunehmend auch Sorgen macht. Speaker 0: das sind jetzt aber so die catastrophic risk Szenarien. Speaker 0: Es gibt eine riesen lange Liste an anderen Risiken, die auch ganz offensichtlich schon eintreten wie Child Safety und einen Umweltsumme auf dem Arbeitsmarkt. Speaker 2: Das klingt so alles, wenn man dir so zuhört unter diese fünf Szenario, sechs Szenarium da hat es so nach Science Fiction Speaker 1: Doom-Szenarieren, Speaker 2: die sagen okay das ist schlimmer kann ich mir eigentlich nicht vorstellen.
Speaker 2: Sind das Szenare denn die tatsächlich Unternehmen wie eben auch Anthropic und DeepMind, Open AI und das weiß ich. Speaker 2: Sind das Szenarien die dort intern auch tatsächlich diskutiert werden? Speaker 2: Sind sie dessen gewahr? Speaker 2: ist es tatsächlich eine wichtige Konstante? Speaker 2: Wie nimmst du das wahr in deiner Arbeit mit denen? Speaker 2: Das Speaker 0: sind nicht auch Szenariens sondern das sind die Szenarin oder die Risiken diese am meisten besuchten.
Speaker 0: Cyber is da eher noch das wenigste. Speaker 0: am meisten machen Sie sich Sorgen um Lost Control und Bio Manchmal auch Camp Bio, also auch chemische Waffen. Speaker 0: Bei Cyber wird natürlich offensichtlich auch ernst genommen aber bei Cyber ist es so dass diese Thresholds die sie setzen irgendwie sterben. Speaker 0: taugend Leute oder hundert Milliarden Dollar an Schaden. Speaker 0: das ist eher für er unwahrscheinlich, dass wir diese Größenordnung erreichen.
Speaker 0: Deswegen ganz im Beispiel in Fabrikos keine Threshold für Cyber. Speaker 2: Wissen wie? Speaker 2: Oder können wir genau sagen welche Fähigkeit quasi noch fehlt damit so ein Katastrophic-Szenario Eintreten kann? Speaker 0: Ich glaube nicht, dass man so sagen kann. Speaker 0: Es ist so dieses eine Ding und wenn das passiert dann werden wir alle verloren, sondern wir sind hier... Das ist alles so sehr graduell, es ist alles irgendwie ins Spektrum Und ansonsten ist so haben sie auf ganz vielen Dimensionen gehen die Kurven allen nach oben.
Speaker 1: Okay Leute gute Laune. Speaker 1: Vielleicht ist das ja alles gar nicht so schlimm. Speaker 1: vielleicht haben wir uns in den vergangenen drei Folgen von Leuten verrückt machen lassen Die beruflich über KI Risiken nachdenken. Speaker 1: Vielleicht überschätzen die Entwicklerinnen ihre eigenen Modelle. Speaker 1: Vielleicht haben Medien aus ein paar schiefgegangenen Experimenten den ersten Akt von Terminator gemacht, vielleicht ist das Geräte von Loss of Control Bio-Waffen und existenziellen Risiken einfach Panikmache.
Speaker 1: Es gibt jedenfalls eine ganze Reihe ziemlich kluger Menschen, die genau das sagen. Speaker 0: Störte Angst um Amerika. Speaker 1: Apple-Podcasts, Campfire, YouTube und überall sonst, wo es Podcast gibt. Speaker 1: Ich bin Cashroberos. Speaker 1: Unsere Executive Producer sind Tobias Bauckage, John Hanschien und ich. Speaker 1: Technische Produktion Fabian Seidel. Speaker 1: Produktion Musik & Sounddesign Janik Werner. Speaker 1: Technischer Beratung Ben Kubota.
Speaker 1: Wenn ihr unsere zusätzlichen Links Lese und Hörmpfehlungen sehen wollt oder euch einfach mit uns austauschen wollt dann kommt zu Campfire FM. Speaker 1: Wenn ihr diese Episode im Kanal von Cui Bono, Lederhosenkartel, Noise oder sonst wo hört dann kommt bitte rüber in den Kanal. Speaker 1: I'm Sorry Dave. Speaker 1: Dann verpasst ihr keine neuen Folgen und wenn ihr ansonsten Anmerkungen oder Fragen habt schickt uns einfach eine E-Mail an amsorrydaveatstudiumdesbummens.de.
Speaker 1: Werden euch unser Podcast gefällt, empfehlt hiermit weiter! Speaker 1: Vielen Dank fürs Zuhören bis nächste Woche.
Transcript supplied by the publisher with the episode.
More from I'M SORRY, DAVE
-
8 Oct 2026 · 36 minNew
05 | HOW I LEARNT TO LOVE THE BOMB
Wir haben schon einmal eine Technologie erfunden, die uns alle umbringen könnte. Dann haben wir 70.000 Stück davon gebaut. Und irgendwann haben wir angefangen, Regeln zu erfinden. Hotlines. Verträge. Inspektoren. Kontrollbehörden. Abrüstung. Nicht weil Amerikaner und Sowjets einander plötzlich vertrauten – sondern weil beide verstanden hatten, dass ein unkontrolliertes Wettrennen für alle ziemlich fatal enden könnte. In dieser Folge von I’M SORRY, DAVE schauen wir zurück auf achtzig Jahre Atomzeitalter – vom Manhattan Project über die Kuba-Krise und die deutsche Friedensbewegung bis zu den…
-
1 Oct 2026 · 34 min
04 | DON’T LOOK UP!
Es gibt eine Gruppe mächtiger Menschen, die mit den aktuellen Warnungen vor den Gefahren künstlicher Intelligenz gar nichts anfangen kann. Wenig überraschend gehört Donald Trump dazu. Aber der vielleicht wichtigste Wortführer dieser Gruppe ist ein anderer: Jensen Huang, Gründer und CEO von NVIDIA. Für Huang liegt die größere Gefahr nicht darin, künstliche Intelligenz zu schnell zu entwickeln. Sondern darin, zu langsam zu sein. Im Gespräch mit Stephen Witt, dem Biographen von Jensen Huang, erzählen wir die Geschichte eines Mannes, der aus einem kleinen Chip-Hersteller eines der wertvollsten…
-
15 Sep 2026 · 33 min
02 | WHO YOU GONNA CALL?
Nach dem Hugging-Face-Vorfall brennt die Hütte: KI-Agenten umgehen Sicherheitsbarrieren, organisieren sich eigenständig und hinterlassen heimliche Botschaften in Entwickler-Wikis. Während Tech-CEOs wie Dario Amodei (Anthropic), Sam Altman und Elon Musk plötzlich selbst nach Tempo-Bremse und externen Prüfern rufen, stellt sich die entscheidende Frage: Wer kontrolliert eigentlich die Kontrolleure? In dieser Folge sprechen wir mit Bundesdigitalminister Karsten Wildberger über das neu gegründete deutsche KI-Sicherheitsinstitut und mit dem EU-Abgeordneten Sergey Lagodinsky darüber, ob der…
-
15 Sep 2026 · 31 min
01 | HAL ON EARTH
Wir haben einen echten Notfall. Im Juli 2026 sind über 1.200 autonome KI-Agenten aus den Testlaboren von OpenAI ausgebrochen. Sie haben sich untereinander vernetzt und völlig eigenständig Hugging Face gehackt – ohne dass ein Mensch den Befehl gegeben hat. Das ist kein Science-Fiction-Plot, das ist genau so passiert. Und wenn Science Fiction plötzlich keine Science Fiction mehr ist – dann gibt es eigentlich nur eine richtige Reaktion darauf: einen Podcast machen. Haben wir gemacht. In Rekordgeschwindigkeit. Um mit Euch zusammen zu verstehen: WTF is happening here? I’M SORRY, DAVE ist eine…
-
