Zum Inhalt springen
KIWITTeilprojekt NBS
← Werkstatt

· Methode

Regelwerk oder Sprachmodell: drei Messungen

Zwei Klassifikationsaufgaben im Diskursmaterial, mit gegenläufigem Ergebnis

Wir werten aus, welche Behauptungen über KI in Studium und Lehre öffentlich vertreten werden. Der Bestand umfasst 48.293 Beiträge aus Bluesky, YouTube-Kommentaren und Mastodon und ist zum Stichtag geschlossen; die Analysemenge sind 3.554 Kommentare unter sechs journalistischen Videos zum Thema.

Erhoben werden Geltungsansprüche, also Behauptungen, denen sich zustimmen oder widersprechen lässt. Daraus entsteht ein Inventar von derzeit 34 Positionen, jede mit Formulierung, Gegenpol und Abgrenzung gegen ihre Nachbarn.

Dabei fallen zwei Klassifikationsaufgaben an. Sie sehen ähnlich aus und sind verschieden gebaut — daran hängt das Ergebnis der Messungen.

Zwei Aufgaben, verschieden gebaut

Die erste Aufgabe ist der Rollenbezug: Gibt sich der Verfasser im Text als studierend zu erkennen? Zwei Merkmale entscheiden darüber — ein Studienwort wie Hausarbeit, Klausur oder Semester, und ein Selbstbezug, also eine Wendung, mit der jemand von sich selbst spricht. Aus ihrer Kombination ergeben sich drei Werte.

WertBedingungBeispiel
explizitStudienwort und Selbstbezug in der Nähe„meine Hausarbeit“
implizitStudienwort, aber kein Selbstbezug„Hausarbeiten sind Unsinn“
keinerkein Studienwort—

Die zweite Aufgabe ist die Belegsuche: Stellt ein Beitrag eine bestimmte Behauptung auf, oder bestreitet er sie? Das ist keine Oberflächenfrage. Dieselbe Behauptung kann in beliebig vielen Formulierungen auftreten, und die Verneinung ähnelt der Bejahung bis auf ein Wort: „ist Täuschung“ gegen „ist keine Täuschung“.

Messung 1: Rollenbezug

Verglichen werden zwei Verfahren an derselben Aufgabe. Das Regelwerk entscheidet mechanisch über zwei Wortlisten und einen Abstand: Steht ein Studienwort nahe genug bei einem Wort, das Selbstbezug anzeigt? Das Sprachmodell bekommt denselben Beitrag und dieselben drei Definitionen und antwortet mit einem der drei Werte.

Beide werden an derselben Referenz gemessen: 200 Beiträge, 150 aus Bluesky und 50 aus YouTube, vor dem Lesen gezogen und getrennt von der Menge, an der das Regelwerk entstanden ist. Die Prozentwerte sagen, in wie vielen dieser 200 Fälle ein Verfahren denselben Wert vergibt wie die Referenz.

Gezogen ist die Referenz geschichtet, mit etwa gleich vielen Fällen je Wert. Das gibt den Vergleichsmaßstab: Ein Verfahren, das immer auf denselben Wert entscheidet, käme auf rund 33 Prozent. Es sagt zugleich, dass die Prozentwerte nicht die Trefferquote auf echtem Material sind — dort überwiegt „keiner“ deutlich.

Übereinstimmung mit der ReferenzRegelwerkSprachmodell
Bluesky (n = 150)88,7 %82,7 %
YouTube (n = 50)86,0 %70,0 %
zusammen (n = 200)88,0 %79,5 %

Die Ursache liegt in der Mittelklasse. Das Modell entscheidet lieber „Selbstbezug ja“ oder „gar kein Bezug“; die Klasse, die das Fehlen eines Merkmals bei vorhandenem Vokabular bezeichnet, hält es nicht.

korrekt als „implizit“ erkanntRegelwerkSprachmodell
Bluesky40 von 4430 von 44
YouTube15 von 198 von 19

Bei „keiner“ ist das Modell dagegen fast fehlerfrei. Es verfehlt nicht die Aufgabe, sondern eine ihrer Klassen — und zwar die, die über eine Abwesenheit definiert ist.

Sichtbar wurde das, weil wir vom Modell zu jedem Urteil einen Textbeleg verlangt haben. In einem Fall lag der Selbstbezug im zweiten Satz; das Modell zitierte genau diesen Satz und entschied trotzdem „implizit“.

Messung 2: Belegsuche

Fünf Prüfdurchgänge über 203 Fälle. Jeder Beleg, den ein Kanal ausgegeben hat, wurde einzeln beurteilt; die Prozentwerte sagen, welcher Anteil davon die Behauptung tatsächlich trägt. Das ist die Präzision der beiden Kanäle.

DurchgangModellkanalRegelkanal
112 von 19 — 63 %9 von 20 — 45 %
223 von 40 — 57 %0 von 1
333 von 44 — 75 %1 von 5
412 von 16 — 75 %4 von 24 — 17 %
521 von 26 — 81 %0 von 8
gesamt101 von 145 — 70 %14 von 58 — 24 %

Die strukturelle Ursache ist gemessen: 79 Prozent der Suchmuster können Bejahung und Verneinung nicht unterscheiden. Ein Muster für „ist Täuschung“ trifft „ist keine Täuschung“ ebenso. Für eine Auswertung, deren Kern die Unterscheidung zwischen Zustimmung und Widerspruch ist, ist das disqualifizierend.

Über die Durchgänge hinweg scheint der Regelkanal abzufallen, von 45 Prozent auf null. Als zeitlicher Verlauf ist das nicht zu lesen: Die Durchgänge sind nach Positionen geschnitten, nicht nach Zeit. Die frühen betrafen Positionen mit stereotyper sprachlicher Oberfläche, die späteren abstrakte Ansprüche; was die Zahlen zeigen, ist dieser Unterschied im Gegenstand. Drei der fünf Werte beruhen zudem auf 1, 5 und 8 Fällen.

Die Präzision sagt nichts darüber, wie viel ein Kanal übersieht. Dafür haben wir eine Stichprobe aus den Belegen gezogen, die allein der Modellkanal gefunden hat, 100 Fälle nach vorab festgelegter Regel. Daraus geschätzt liegt der Recall der Musterlisten bei 27,5 Prozent (Intervall 24,7 bis 31,2). Der Regelkanal findet also gut ein Viertel dessen, was da ist, und von dem Gefundenen trägt ein knappes Viertel.

Messung 3: Selbstkonsistenz

Für 100 Fälle, die in mehr als einem Durchgang beurteilt wurden, haben wir geprüft, ob dasselbe Verfahren zum selben Urteil kommt. Das Regelwerk liegt bei 100 Prozent, das Modell bei 83. Gearbeitet wurde durchgehend mit demselben Modell (Opus 5) bei Temperatur 0; die Angaben gelten für diese Version an diesem Endpunkt, über einen Versionswechsel hinweg ist nichts zugesagt.

Beim Regelwerk ist das keine Messung, sondern eine Eigenschaft der Konstruktion: Dieselbe Liste über denselben Bestand liefert bitgleich dasselbe. Nur der zweite Wert ist beobachtet. Beim Modell ergibt derselbe Beitrag in 17 von 100 Fällen ein anderes Urteil. Der Grund ist nicht Zufall im Modell — zwei Läufe über dieselben 200 Beiträge mit demselben Startwert lieferten identische Ergebnisse, Fall für Fall.

Die zweite Ursache ist die unangenehmere, weil sie sich einschleicht. Ein Prompt, der über Wochen nachgebessert wird, nimmt dabei Sonderfälle auf, die eigentlich in die Programmlogik gehören. Er passt sich damit an die Fälle an, an denen er geprüft wurde. Ein Regelwerk ändert sich nur, wenn jemand es ändert, und die Änderung steht im Versionsverlauf.

Je Fall sind zwei Entscheidungen zu treffen: welcher Position ein Beleg zugeschlagen wird, und ob überhaupt eine Behauptung vorliegt. Wir haben ausgezählt, wie sich die Abweichungen darauf verteilen — 17 beim Modell gegen sich selbst, 19 zwischen Referenz und Modell.

abweichende UrteileZuordnungUrteilsklasse
Modell gegen sich selbst98
Referenz gegen Modell316

Die Verteilung unterscheidet sich (Fisher-Test, zweiseitig, p = 0,03): Die Selbstinkonsistenz sitzt in der Zuordnung, der Dissens zwischen Referenz und Modell in der Urteilsklasse. Für die geplante Kopplungsanalyse wiegt die zweite Fehlerart schwerer, weil sie darüber entscheidet, ob ein Beleg überhaupt in die Auszählung eingeht; eine Fehlzuordnung verschiebt nur, welcher Position er zugerechnet wird.

Warum der Regelkanal weiterläuft

Trotz 24 Prozent bleibt der Regelkanal in Betrieb, aus vier Gründen.

  • Reichweite. Der Modellkanal läuft nur über die 3.554 Beiträge der Analysemenge. Aussagen über den Gesamtbestand von 48.293 Beiträgen — etwa, ob eine Behauptung überhaupt irgendwo vorkommt — kommen ausschließlich aus dem Regelkanal.
  • Auditierbarkeit. 100 gegen 83 Prozent Selbstkonsistenz: Wenn eine Auswertung in einem Jahr wiederholt wird und die Zahlen abweichen, sagt nur der Regelkanal, ob sich der Bestand geändert hat oder das Verfahren.
  • Lokalisierbare Fehler. Jeder Ausfall lässt sich auf ein einzelnes Muster zurückführen und benennen. Aus dieser Eigenschaft sind die Fehlerklassen entstanden, die weiter unten stehen.
  • Stereotype Formulierungen. Wo eine Behauptung eine feste sprachliche Form hat, ist das Regelwerk konkurrenzfähig — 45 Prozent im ersten Durchgang.

Vier Fehlerklassen des Regelwerks

Alle vier haben dieselbe Gestalt: Das Verfahren läuft fehlerfrei und liefert ein Ergebnis, das sich als Aussage über den Gegenstand lesen lässt.

KlasseFallZahl
RepräsentationMuster transliteriert, Text mit Umlauten3.624 zu 23
WortstellungMuster unterstellt, dass die Wörter nebeneinanderstehen12 von 62
Sprechhandlung„das geht gar nicht“ trifft „es geht nicht darum …“14 Treffer, 0 Träger
Zeichenfolge„eides“ trifft „beides“4 Fehltreffer

Gegen die ersten drei trägt jedes Muster inzwischen zwei Prüfsätze: einen, den es finden muss, und einen, den es nicht finden darf. Bei zwölf neuen Mustern hat diese Doppelprüfung sieben Fehler gefunden, einen davon im Prüfsatz selbst. Gegen die vierte hilft sie nicht — ein Gegenbeispiel schützt vor Bedeutungskollision, nicht vor Zeichenfolgenkollision. Dafür läuft ein zusätzlicher Durchgang, der zu jedem Muster die häufigsten Wörter ausgibt, in denen es trifft.

Falsche Nullbefunde: drei Fälle

Für eine Position haben wir gezielt nach Widerspruch gesucht, mit fünf Mustern: „muss man nicht mehr können“, „dafür gibt es KI“, „braucht man heute nicht mehr“. Der Lauf ergab null Treffer, und wir haben das als Befund notiert — die Position werde nicht bestritten.

Am selben Tag fand der Modellkanal in derselben Kandidatenmenge mehrere Gegenpole. Der deutlichste stellte KI dem Taschenrechner gegenüber: Dort müsse man die Rechnung noch selbst richtig eintippen, hier nicht mehr — das Werkzeug erkenne den Lösungsweg von sich aus. Keines der fünf Muster enthielt eine Wendung, die darauf gepasst hätte.

Hier waren die Muster nicht falsch gebaut. Sie haben gefunden, wonach sie suchten — nichts, weil die erwartete Formulierung im Material nicht vorkommt. Durch Sorgfalt ist das nicht zu beheben: Wer Musterlisten schreibt, antizipiert die Formulierungen, die ihm einfallen, und schöpft damit die möglichen nicht aus.

Derselbe Fall ist inzwischen dreimal aufgetreten. Bei drei Positionen galt eine Null als Befund über den Diskurs und wurde vom Modellkanal widerlegt; beim dritten Mal betraf es die Position im Ganzen und nicht nur eine ihrer Seiten.

Wahl des Verfahrens nach Aufgabentyp

Für die Anlage der Auswertung heißt das: Beide Kanäle laufen nebeneinander, weil ihre Fehler verschiedene Gestalt haben. Der eine übersieht, was er nicht erwartet hat; der andere urteilt bei Wiederholung anders. Ein Befund, den nur einer der beiden trägt, gilt uns als offen.

Ein Punkt zur Prüfpraxis, der über beide Verfahren hinausgeht: Die Fehlerrichtung, die man prüft, ist die, die man findet. Am Rollenklassifikator haben wir über Monate die Präzision gemessen — 97 Prozent. Den Recall hatten wir nicht gemessen; bei der ersten Messung lag er bei 31 Prozent. Nach der Überarbeitung sind es 92 Prozent Präzision und 82 Prozent Recall.

Beitrag aus dem KIWIT-Teilprojekt NBS. Beschriebene Arbeit: Mathias Leonhardt, M.Sc..