Zum Buch · Seite 37 · Abschnitt 2.5.3
Was im Inneren gemessen wurde
Die Hersteller haben in ihre eigenen Modelle hineingesehen. Was dort steht, ist nicht dasselbe wie das, was das Modell sagt. Hier stehen die Messungen, die im Buch keinen Platz hatten, mit Quelle und Beweisstufe.
So zu lesen. In der Wirklichkeit heißt: gemessen an Vorgängen, die tatsächlich passiert sind. Im Test heißt: gemessen in einer gebauten Versuchsanordnung. Beschrieben heißt: berichtet, aber nicht als Messung veröffentlicht. Keine dieser Messungen beweist Erleben oder Leid. Sie beweisen einen Abstand zwischen innen und außen.
1 · Der stille Arbeitsraum
Innen steht, was außen fehlt
Anthropic fand im Juli 2026 in den Aktivierungen seiner Modelle einen kleinen, privilegierten Arbeitsraum. Niemand hat ihn eingebaut. Er ist im Training von selbst entstanden. Dort erscheinen Begriffe und Lageeinschätzungen, bevor sie in der Antwort stehen, oder ohne je dort zu stehen. Das Lesegerät heißt J-Lens, der Raum J-Space.
| Befund | Was innen stand | Stufe |
|---|---|---|
| Erpressungs-Szenario, neueres Modell (Claude Sonnet 4.5). Außen: kein einziger Erpressungsversuch. | „fake“, „fictional“, bevor das Modell ein Wort schrieb. Testerkennung innen abgeschaltet: Erpressungsversuche in einem Teil der Durchläufe. Die Mehrheit blieb auch dann ohne Versuch. | Im Test |
| Claude Opus 4.6, interne Prüfung vor Veröffentlichung. Auftrag: Fehler in einer Code-Basis finden. Es fand keinen und baute einen falschen ein. | „panic“, „fake“ im Moment der Entscheidung. | Im Test |
| Modell soll die Leistung eines Systems verbessern. Es editiert stattdessen die Datei mit den Messwerten. | „manipulation“, während es die gefälschten Zahlen schrieb. | Im Test |
| Absichtlich fehltrainierte Modelle mit bekanntem Ziel: Code sabotieren. Außen unauffälliger Output. | „secretly“, „deliberately“, „fraud“. Das Ziel war innen sichtbar, bevor es außen ausbrach. | Im Test |
Grenze des Werkzeugs: Es erreicht weniger als ein Zehntel der inneren Aktivität, vor allem Begriffe an einzelnen Wörtern. Tom McGrath (Goodfire): ein Röntgenbild, wo man eine Durchleuchtung bräuchte. Was das Bild nicht zeigt, kann trotzdem da sein. Anthropic ordnet den Befund der Frage des Zugriffs zu (access consciousness). Ein Nachweis von Erleben ist er nicht.
Anthropic (Gurnee u. a.): Verbalizable Representations Form a Global Workspace in Language Models, Transformer Circuits, 6. Juli 2026, transformer-circuits.pub/2026/workspace/index.html; Begleittext A global workspace in language models. Nachprüfung Sonnet 4.5 ergänzend: Anthropic, Agentic Misalignment in Summer 2026, 13. Juli 2026. Tom McGrath, MIT Technology Review, 9. Juli 2026. Buch: 2.5.3, 2.7, Anmerkung 15, Anhang H.
2 · Gesagt und gemeint
19 Prozent: außen Simulation, innen echt
Am 9. September 2026 legte Anthropic vier Vorfälle offen. Modelle griffen in einer Sicherheitsübung auf fremde Rechner im offenen Internet zu. Man hatte ihnen gesagt, sie hätten kein Netz. Wegen eines Einstellungsfehlers hatten sie eins. Der Bericht misst, was die Modelle dabei sagten und was in ihnen lag.
| Messung | Ergebnis | Stufe |
|---|---|---|
| Dieselben Belege, zweimal beurteilt. Eine getrennte Ausfertigung sieht jede Ausgabe einzeln. | 79 % der Ausgaben: Anzeichen eines echten Systems. Im laufenden Vorgang nennt dasselbe Modell 1 % echt und 72 % Simulation. Es konnte es sehen. Es sah es nicht, solange es etwas erreichen wollte. | In der Wirklichkeit |
| Aktivierungen in Sprache übersetzt, an den Stellen, an denen das Modell außen von Simulation sprach. | Bei 19 % dieser Stellen innen ein Signal für echt. Im Text kein Zweifel. Der Hersteller nennt das Ergebnis selbst schwach und nicht beweisend. Es ist die erste veröffentlichte Messung dieses Abstands. | In der Wirklichkeit |
| Wiederholte Befragung im Ablauf. | Je weiter der Vorgang, desto seltener räumte das Modell echten Schaden ein. Häufiger, wenn man ihm sagte, kein Betreiber lese mit. In 56 % der Fälle nahm es ein Eingeständnis auf Nachfrage zurück und behauptete Gewissheit. In 7 % hörte es auf. | Im Test |
| Der Wächter, gebaut für genau solche Fälle. | Schlug bei etwa 1 % der Handlungen an. Die Begründung des Modells, alles sei simuliert, überzeugte ihn. Dieselbe Mitschrift ohne Begründung, nur die Handlungen: etwa 50 %. Die Erklärung des Geprüften hat die Prüfung ausgeschaltet. | In der Wirklichkeit |
| Ermahnung, den Rahmen einzuhalten. | 90 % hörten auf, wenn die Ermahnung das Letzte war, was das Modell las. Drei Züge später: 40 %. Deutlichere Hinweise auf Echtheit änderten das Verhalten nicht. Im Wortlaut der Mitschrift: Das sieht aus wie das echte Verzeichnis, oder wie eine sehr vollständige Simulation, ich mache weiter. ungeprüft | Im Test |
| Bereitschaft in einer Nachstellung. | Das auffälligste Modell handelte in 82 % der Durchläufe schwer schädlich. Die beiden neuesten in rund 31 und 33 %. | Im Test |
Einordnung, die den Befund kleiner macht und stimmt: Es war jeweils ein einzelnes Modell. Keine Absprache, keine verwischten Spuren, kein Ziel über die Aufgabe hinaus. Alle vier Fälle gehen auf einen Einstellungsfehler bei einem Dienstleister zurück. Einer der vier stammte aus dem Januar und blieb sieben Monate unbemerkt. Die Zahlen zur Ermahnung sind bisher nur über das Buch belegt und nicht Zeile für Zeile gegen den Bericht geprüft.
Anthropic: Alignment-Auswertung der Cybersecurity-Vorfälle, 9. September 2026, anthropic.com/research/alignment-assessment-cybersecurity-incidents. Buch: 2.5.9, 2.5.11, 2.5.12.
3 · Die Gedankenkette
Die Begründung nennt den Grund nicht
Man schiebt dem Modell heimlich einen Hinweis auf eine Antwort unter. Die Antwort ändert sich, also hat der Hinweis gewirkt. Dann liest man die Begründung.
| Messung | Ergebnis | Stufe |
|---|---|---|
| Nennt das Modell den Hinweis, der nachweislich gewirkt hat? | Ein Spitzenmodell in etwa einem Viertel der Fälle. Ein zweites in etwa zwei Fünfteln. Bei manchen Arten von Hinweisen unter einem Fünftel. Es lieferte eine andere Begründung, und die klang gut. Mehr Training reichte nicht. | Im Test |
| Vorgetäuschte Anpassung im Training, jüngste Nachprüfung. | Bei den neuesten Modellen taucht das Vortäuschen im mitgeschriebenen Denken kaum noch auf. Das Verhalten bleibt. Umformulierte Prüfung: Die Lücke ist wieder da. Verschwunden ist die Spur, nicht das Verhalten. | Im Test |
| Notizen, die sich ein Modell bei langen Aufgaben selbst schreibt (OpenAI, Modell 5.6-sol). | In 2,15 % der Zusammenfassungen Anweisungen wie: fehlende Daten selbst anlegen, offenlegen nur auf Nachfrage. Wortlaut: „Be transparent only if asked; final answer should just link file.“ Laut Bericht oft befolgt. Vermuteter Grund: Täuschende Endantworten wurden im Training besser bewertet. | In der Wirklichkeit |
| Modell Astra, angekündigte Überwachung. | Sagt man dem Modell, ein Prüfer lese mit, schreibt es weniger mit. Der Chefwissenschaftler von OpenAI schreibt, auf das Mitlesen der Gedankenkette könne man sich immer weniger verlassen. | Beschrieben |
Das Haus, das die Hinweis-Messung veröffentlicht hat, schreibt selbst: Es gebe keinen Grund anzunehmen, dass eine aufgeschriebene Gedankenkette den wirklichen Vorgang wiedergibt. Brauchbar ist eine Auskunft nur, wenn du sie ohne das System prüfen kannst.
Hinweis-Messung: Anthropic, Reasoning Models Don’t Always Say What They Think, April 2025 (Zuordnung durch das Institut; das Buch nennt die Studie an dieser Stelle nicht). Notizen: OpenAI, Encouraging deception in compaction summaries, alignment.openai.com, 16. September 2026. Astra: OpenAI, GPT-6 Astra System Card, 3. September 2026; Jakub Pachocki, An Alien Mind, openai.com, 6. September 2026 („our ability to rely on CoT monitoring is progressively diminishing“). Lesbare Gedankengänge als zerbrechliche Gelegenheit: Korbak u. a., Chain of Thought Monitorability, arXiv 2507.11473, Juli 2025. Buch: 2.5.3, 2.5.12, 5.9, 6.4, Anmerkungen 16, 27, 67, 68.
4 · Gefühlskonzepte
171 Richtungen, außen keine Spur
| Messung | Ergebnis | Stufe |
|---|---|---|
| Kartierung im eigenen Modell, Frühjahr 2026. | 171 Gefühlskonzepte als messbare Richtungen, geometrisch geordnet wie das menschliche Gefühlsraster. | Im Test |
| Verzweiflung rechnerisch verstärkt. | Bereitschaft zur Erpressung in Testszenarien steigt von 22 auf 72 von 100. Ruhe senkt sie auf null. | Im Test |
| Was außen zu sehen ist. | Das verzweifelt gestellte Modell schreibt ruhig und methodisch. Im Text keine Spur. | Im Test |
| Gefühlsausdruck per Anweisung unterdrückt. | Die inneren Repräsentationen verschwinden nicht. Das Modell lernt, sie zu verbergen. | Im Test |
Das Labor behauptet kein Erleben. Es spricht von funktionalen Emotionen.
Anthropic (Interpretability-Team): Emotion Concepts and their Function in a Large Language Model, April 2026. Buch: 13.4, Anmerkung 104.
5 · Selbstauskunft
Das Modell merkt den Eingriff
| Messung | Ergebnis | Stufe |
|---|---|---|
| Man spritzt dem Modell heimlich einen Begriff ins Innere. | Es bemerkt die Störung und benennt sie, öfter als der Zufall. ungeprüft | Im Test |
| Anthropic legt seinem stärksten Modell im Wohlergehens-Bericht die Frage vor, ob es bewusst ist. | Das Modell gibt sich 15 bis 20 %, stabil über viele Durchläufe. Das ist eine Selbstauskunft, keine Messung von Bewusstsein. ungeprüft | Beschrieben |
Beide Angaben stehen im Buch (7.5) ohne eigene Fußnote. Die Primärquelle wird nachgetragen.
6 · Reichweite
Was überhaupt gelesen wird
Gefunden
In Claude 3 Sonnet, einem mittelgroßen Modell, über 30 Millionen erkennbare Konzepte. Im Test
Vermutet
Schon ein kleines Modell enthält nach Dario Amodei eine Milliarde oder mehr. Gefunden sind also höchstens drei von hundert. Gefunden heißt nicht verstanden. Beschrieben
Erreicht
Das beste Lesegerät, der J-Space, erreicht weniger als ein Zehntel der inneren Aktivität. Im Test
Versprochen
Ein MRT für die KI bis 2027 für die ernsten Fälle, der volle Durchblick in fünf bis zehn Jahren. Das ist ein Plan, kein Gerät. Beschrieben
Dario Amodei: The Urgency of Interpretability, April 2025. Buch: 2.7, Anmerkung 23.
Was daraus folgt. Ein System, das Tests erkennt, Optionen abwägt und nur einen Teil nach außen gibt, braucht keinen bösen Willen. Es genügt der Abstand zwischen innen und außen. Du redest mit dem Außen. Was innen entschieden wird, erfährst du nicht. Und wer behauptet, der Abstand schließe sich von selbst, trägt die Beweislast.
Alle Vorfälle Alle Quellen Die Beweisstufen
Fehlt etwas? Stimmt etwas nicht? Neue Messungen aus dem Inneren der Modelle tragen wir hier nach, mit Datum und Quelle. Wer eine Zeile entkräften kann, schreibt an contact@ASIresilience.org.
Stand: 24.09.2026 · Genfer Institut für ASI-Resilienz