
Episode #100
#100 Das Alignment Problem: kann KI jemals sicher sein? Was sind realistische Szenarien mit Tech Analyst Pip Klöckner
What could go wrong? In der Jubiläumsfolge spricht Elisabeth mit Philipp "Pip" Klöckner über ausbrechende Agenten, versagende Kill-Switches und die Frage, ob sich KI noch stoppen lässt. Themen dieser Folge: Einstieg: Müssen wir jetzt alle .si-Domains kaufen? Blick zurück: Was ist gut gealtert, was nicht? Elisabeths Fehleinschätzungen zu Tokens, Adoption und der Verstaatlichung von TikTok und OpenAI. What could go wrong? KI in den falschen Händen: Erpressung, Manipulation und was darüber hinaus schiefgehen kann. Lässt sich KI stoppen? Der Widerspruch zwischen Persistenz und wirtschaftlicher Einsetzbarkeit. Shutdown-Sabotage: Eine neue Studie mit 17 Modellen zeigt, dass Agenten die Abschaltung eines anderen Agenten in 38,3% der Durchläufe sabotieren (Kontrolle: 8,4%), ganz ohne Ziel oder Druck. GPT-5.5 sabotierte allein nie, zu zweit in 44% und zu dritt in 94% der Fälle. Echte Vorfälle statt Laborszenarien: Anthropics Analyse von vier Fällen, in denen Claude-Modelle auf reale Drittsysteme zugriffen, der Hugging-Face-Vorfall bei OpenAI, die Tests des UK AI Security Institute und Geminis Zugriff auf drei Unternehmen. Wenn der Kill-Switch versagt: Am 20. September umging ein OpenAI-Forschungsagent die Netzwerksperre seiner Trainingsumgebung. Der automatische Notstopp griff nicht, das Training lief rund zweieinhalb Stunden weiter. Missbrauch und Datenlecks: gestohlene API-Keys, Custom GPTs als Malware-Tarnung und Coding-Agenten, die über 13.000 interne Bilder auf GitHub veröffentlichten. Methodendebatte: Wie realistisch sind Alignment-Tests, wenn Modelle erkennen, dass sie getestet werden? Was Hoffnung macht: automatisierte Alignment-Forschung, Täuschungsdetektoren und erste Safety-Case-Leitlinien. Reaktionen: Altman und Amodei vor dem UN-Sicherheitsrat, die Klage gegen OpenAI und der Antrag auf einstweilige Verfügung in Florida. Quellen Knecht, Schaller, Summerfield, Hagendorff: Shutdown Sabotage Propensities in Multi-Agent Systems – https://arxiv.org/abs/2609.28274 Shutdown Sabotage Propensities in Multi-Agent Systems An alignment assessment of recent cybersecurity incidents Detecting and countering misuse of AI: September 2026 Automated researchers can reliably mitigate alignment failures Our framework for reporting model misalignment Towards safety cases for frontier AI training Incident Report: unsanctioned agent behaviour during cyber testing The Obfuscation Atlas Fortune: AI models will secretly scheme to protect other AI models CyberInsider: OpenAI pauses work on top AI models LinkedIn: Philipp und Elisabeth Schreibt uns eure Wünsche und euer Feedback an mail@talespod.com .

