· Exkurs
Kompilieren statt nachschlagen
Exkurs: Karpathys LLM Wiki und die Grenze seines Gültigkeitsbereichs
Im April 2026 hat Andrej Karpathy eine Textdatei veröffentlicht: kein Programm, sondern eine Anleitung in Prosa, aus der ein Agent eine Umsetzung für das eigene Gebiet baut. Inzwischen gibt es eine größere Zahl von Nachbauten.
Google hat das Muster seither unter dem Namen Open Knowledge Format standardisiert: ein Verzeichnis aus Markdown-Dateien mit einem Kopf in YAML, ein einziges Pflichtfeld, der Rest optional. Die Festlegung ist klein — sie soll erreichen, dass ein Agent Bestände verschiedener Herkunft ohne Übersetzung lesen kann.
Der Einwand dahinter richtet sich gegen das übliche Verfahren, Wissen zur Laufzeit heranzuholen: Eine Frage, die fünf Dokumente zusammenführen muss, zwingt das Modell jedes Mal dazu, dieselben Fragmente wiederzufinden und neu zusammenzusetzen. Karpathys Bild dafür ist das Kompilieren — einmal übersetzen statt bei jeder Ausführung neu auslegen.
Drei Schichten, drei Handgriffe
Der Aufbau trennt die Quellen von dem, was aus ihnen entsteht. Die Rohschicht hält die Originaldokumente und wird nicht verändert. Das Wiki darüber schreibt und pflegt das Modell. Eine Regeldatei legt fest, wie es dabei vorgeht.
- Aufnehmen: eine Quelle einlesen, eine Zusammenfassung schreiben, ein Dutzend Seiten quer durchs Wiki nachziehen, das Protokoll fortschreiben.
- Fragen: mit Belegen antworten — und gute Antworten als neue Seiten zurücklegen, damit dieselbe Frage beim nächsten Mal schon beantwortet ist. Jede solche Seite endet mit den Quellen, die zur vollständigen Antwort gefehlt haben; diese Liste bestimmt, was als Nächstes aufgenommen wird.
- Prüfen: Widersprüche, veraltete Behauptungen, verwaiste Seiten, fehlende Querverweise.
Das Prüfen wird beim Nachbauen meist weggelassen und ist der wichtigste der drei Handgriffe: Ein Bestand, der laufend erweitert wird, entwickelt Widersprüche und verwaiste Verweise.
Wie viel dabei zusammenkommt, zeigt ein Durchlauf über unsere eigene Wissensbasis im August 2026: 62 Dokumente trugen Verschlagwortungen, die zu den Begriffen des Bestands nicht mehr passten, dazu kamen uneinheitliche Schreibweisen. Ein Teil ließ sich selbständig bereinigen, über den Rest wurde entschieden.
Damit das nachvollziehbar bleibt, führt der Bestand ein Protokoll, an das nur angehängt wird. Jeder Eintrag nennt Datum, Art der Handlung — Aufnahme, Änderung, Frage, Prüfung — und was sie betraf. Seit dem Aufbau im Mai 2026 stehen dort 127 Einträge, darunter 25 Aufnahmeläufe.
Der letzte Prüflauf endete mit null verwaisten Seiten und ohne Fehler in den geprüften Kategorien. Das ist die Zahl, an der sich der dritte Handgriff messen lässt — nicht daran, dass er stattgefunden hat.
Wo das Verfahren trägt
Unsere Wissensbasis zur KI-Regulierung arbeitet nach diesem Muster: 236 Seiten, jede mit einem strukturierten Kopf, aus dem sich das Modell zuerst bedient. Sie erfüllt drei Bedingungen — der Bestand ist kuratiert, jede Aufnahme wird einzeln entschieden, und die Menge passt in eine Übersicht, die ein Modell noch überblickt.
Wie ein gepflegter Bestand ehrlich bleibt
Ein Modell, das eine Wissensbasis schreibt, mischt zwangsläufig Wiedergabe und eigene Schlüsse. Die Regeldatei trennt beides deshalb ausdrücklich. Jede Aussage auf einer Antwortseite trägt eine von drei Kennzeichnungen:
| Stufe | Was sie bedeutet |
|---|---|
| Quellenwiedergabe | steht so in einer Quelle, mit Verweis auf die Rohdatei |
| Ableitung | verbindet Aussagen mehrerer Quellen zu einem Schluss, der in keiner von ihnen steht, aber ohne zusätzliche Annahme aus ihnen folgt |
| Spekulation | fügt eigenes Wissen oder eine Plausibilitätsannahme hinzu, die die Quellen nicht tragen |
Die Grenze zwischen den beiden letzten ist der heikle Teil, und die Regeldatei zieht sie an einem Beispiel: Sagt eine Quelle „Prüfungsreform ist nötig“ und eine andere „Fernaufsicht konserviert das traditionelle Format“, dann ist die Spannung zwischen beiden eine Ableitung. Der Satz „Transparenzpflichten wirken misstrauensfördernd“ ist Spekulation, solange keine Quelle ihn trägt — auch wenn er plausibel klingt. Im Zweifel gilt die schwächere Stufe.
Dazu kommt ein Rückweg in die Quellen. Seiten, die drei oder mehr Quellen zusammenführen, tragen am Absatzende einen Verweis auf die Rohdatei. Und jede Rohdatei führt, um welche Art Quelle es sich handelt — Primärquelle, Studie, Gesetzestext oder Medienbericht. Damit lässt sich maschinell prüfen, ob eine Aussage im Wiki allein auf Berichterstattung beruht.
Wo es nicht mehr trägt
Dasselbe Verfahren haben wir auf 27.500 Modulhandbücher angewendet: nach Markdown gewandelt, dem Modell den Ordner übergeben, organisieren lassen. Das Ergebnis war nicht benutzbar. Das Modell bildete keine Zwischenebene aus, über die es den Gesamtbestand hätte adressieren können; es ordnete jeweils das Material, das es gerade vor sich hatte.
Die Grenze hängt nach unserer Einschätzung an drei Größen, und keine davon ist die Dateigröße: wie verschieden die Quellen sind, ob eine Ordnung vorher feststeht, und ob über die Aufnahme entschieden wird. Systematische Erhebungen liefern typischerweise den ungünstigen Fall — viele gleichartige Dokumente ohne vorgegebene Begriffe.
Zwei Antworten auf dieselbe Frage
Unsere Diskursauswertung beantwortet dieselbe Frage anders, bei fast gleicher Schichtung: Auch dort ist die Rohschicht unveränderlich, auch dort gibt es eine Regeldatei. Die mittlere Schicht aber wird bei jedem Lauf aus der Rohschicht neu berechnet, statt vom Modell gepflegt zu werden.
| kompiliertes Wiki | neu berechnete Ableitung | |
|---|---|---|
| mittlere Schicht gehört | dem Modell | dem Verfahren |
| sammelt Erkenntnis an | ja — Antworten werden Seiten | nein |
| kann abdriften | ja — deshalb das Prüfen | nein |
| reproduzierbar | nur mit Protokoll | durch Neuberechnung |
Beide Bauarten beantworten denselben Einwand — nicht bei jeder Frage von vorn anfangen — und unterscheiden sich darin, wer die mittlere Schicht besitzt. Überlässt man sie dem Modell, sammelt sie Erkenntnis an und kann abdriften. Berechnet man sie neu, ist jedes Ergebnis wiederholbar, aber es bleibt nichts erhalten, was ein früherer Lauf ergeben hat.
Für einen wachsenden Bestand mit widersprüchlichen Quellen ist die erste Bauart geeigneter, für Zahlen, die in einer Arbeit verteidigt werden müssen, die zweite. Wir betreiben deshalb beide nebeneinander.
Dieselbe Frage beim Programmieren
Das Verfahren ist für Quellenbestände gedacht, aber dieselbe Grenze zeigt sich beim Bauen von Software mit Sprachmodellen. Wer an einem größeren Projekt arbeitet, sammelt Festlegungen an: warum ein Feld so heißt, warum ein Weg verworfen wurde, was ein Test absichern soll. Ein Modell verliert diese Festlegungen über einen langen Lauf, weil der Verlauf zwischendurch verdichtet wird.
Die naheliegende Antwort ist, das Wissen über den Gegenstand in eine Wissensbasis zu legen, bevor Quelltext entsteht, und die Planung darauf zu stützen. Sie trägt, solange sich der Gegenstand vorher beschreiben lässt.
Das ist derselbe Befund wie oben, nur an anderem Material: Der Bestand ist gewachsen statt kuratiert, und es gibt keine Ordnung, die vorher feststand. Was hilft, ist eine Zwischenebene — im agilen Vorgehen die Planung je Abschnitt, in Dokumenten, die dem Modell zugänglich bleiben.
Für den Quelltext selbst gibt es dafür ein Maß. Der CRAP-Index verbindet zyklomatische Komplexität mit der Testabdeckung und sagt damit, wie gut sich eine Stelle noch ändern lässt. Als stehende Regel — nach jedem Feature muss der Wert besser werden — hält er den Bestand offen für den nächsten Schritt. Ein vergleichbares Maß für die Dokumentation fehlt.
Beitrag aus dem KIWIT-Teilprojekt NBS. Beschriebene Arbeit: Prof. Dr. Ulrich Hoffmann · Fynn-Frithjof Kraft, M.Sc..