Zum Inhalt springen
KIWITTeilprojekt NBS
← Werkstatt

· Methode

Ein Wissensgraph über 27.500 Modulhandbücher

Zwei Bauarten im Vergleich und die Bedingung, an der beide hängen

27.500 Dokumente sind für sich genommen nicht auswertbar. Niemand liest sie, und eine Volltextsuche beantwortet nur Fragen, deren Antwort man schon kennt. Gebraucht wird eine Form, in der sich der Bestand befragen lässt, ohne dass jede Formulierung vorher erraten werden muss. Die verbreitete Antwort darauf: Man übergibt die Dokumente einem Sprachmodell und lässt es die Ordnung selbst herstellen.

Wir haben das in zwei Bauarten an diesem Korpus durchgeführt. Die erste trug bei dieser Menge nicht. Die zweite arbeitet technisch einwandfrei und liefert Antworten, deren Reichweite geringer ist, als sie erscheint. Daraus folgt keine Absage an diese Verfahren, sondern eine Bedingung für ihren Einsatz.

Erster Weg: dem Modell den Ordner geben

Der naheliegende und in unserer Arbeitsgruppe erprobte Weg: Dokumente in Textdateien wandeln, einem Sprachmodell den Ordner übergeben und es die Ordnung selbst herstellen lassen — Themen bilden, Verweise setzen, ein Inhaltsverzeichnis darüber legen. Für einen überschaubaren, kuratierten Bestand ist das ein geeignetes Verfahren; an anderer Stelle arbeiten wir so.

Bei 27.500 Dokumenten war das Ergebnis nicht benutzbar. Das Modell bildete keine Zwischenebene aus, über die es den Gesamtbestand hätte adressieren können. Damit ist die Methode nicht widerlegt, aber ihr Gültigkeitsbereich ist enger als angenommen.

Zweiter Weg: der Wissensgraph

Der zweite Versuch ist anspruchsvoller. Ein Verfahren zerlegt die Dokumente in Sinnabschnitte, erkennt darin Dinge und Begriffe — Studierende, Klausur, Selbststudium, eine bestimmte Hochschule — und verbindet sie zu einem Netz. Jeder Knoten bekommt zusätzlich eine Beschreibung, die das Modell aus den Dokumenten selbst formuliert.

Der Vorzug liegt in der Abfrage: Eine Frage findet nicht nur, was wörtlich passt, sondern läuft über eine oder zwei Verbindungen weiter zu benachbarten Themen. Man fragt nach einem Studiengang und bekommt verwandte Angebote anderer Hochschulen mit. Das funktioniert. Bei der Durchsicht des Ergebnisses zeigen sich drei Eigenschaften.

„Studierende“ — ein Knoten, 551 Verbindungen · Schematisch, nach dem Aufbau des erzeugten Graphen
  • Die Verbindungen verteilen sich sehr ungleich. Ein einziger Knoten — „Studierende“ — hält über 550 davon, weil an einer Hochschule fast alles mit Studierenden zu tun hat.
  • Alle Verbindungen heißen gleich. Ihre Richtung steht fest, ihre Bedeutung nur in einem Beschreibungstext daneben. Damit lässt sich nicht nach Beziehungsart filtern — und genau das bräuchte man für eine Frage wie „welche Hochschulen lehren dieses Verfahren im Master“.
  • Die Kategorien bildet das Modell selbst. Neben brauchbaren Typen wie Person, Methode oder Organisation stehen im Ergebnis Einträge wie „Leistungspunkte“ oder „Grund- und Hauptstudium“ — Wörter aus den Dokumenten, die als Klassen behandelt wurden.

Keine dieser drei Eigenschaften ist ein Mangel des Werkzeugs. Vorgeben lässt sich all das: welche Arten von Dokumenten es gibt und in welchen Beziehungen sie stehen dürfen. Dafür gibt es eine Datei, in die man seine Kategorien schreibt, jede mit einer kurzen Erklärung. Der Aufwand ist gering. Er setzt allerdings voraus, dass die eigene Begriffsordnung vorher feststeht.

Bei uns stand sie nicht fest: 27.500 Dokumente und eine Richtung, aber keine Ordnung der Begriffe. Das Verfahren hat diese Lücke aus dem Material gefüllt. Die drei genannten Eigenschaften ließen sich damit beheben. Die vierte nicht.

Der Text hat die Form einer Definition und gibt den Stand der Datenbeschaffung wieder. Darin liegt das methodische Risiko solcher Verfahren: Ohne die Bestandsliste daneben liest sich die Reichweite der Erhebung wie ein Befund über den Gegenstand. Der Nachbarbeitrag führt deshalb auf, welche Hochschulen vertreten sind.

Zwei Nebenbefunde zur Technik

Erstens, zum Aufwand: Das Verfahren stellt für jeden Textabschnitt fünf bis sechs Anfragen an ein Sprachmodell, um Begriffe aufzulösen und Beziehungen zu bestimmen. Bei einem Korpus dieser Größe ist das der Grund, warum ein Neuaufbau keine Kleinigkeit ist — und warum die Ordnung vorher stehen muss.

Zweitens zur Modellgröße: Für die Begriffsauflösung genügte ein Modell mit rund vier Milliarden Parametern auf eigener Hardware — langsam, aber ausreichend. Das Angebot der großen Anbieter beginnt deutlich darüber. Für eine Aufgabe, die aus vielen einfachen Entscheidungen besteht, ist der eigene Betrieb eines kleinen Modells damit die günstigere Bauart.

Was wir mitnehmen

  • Die Begriffsordnung muss vor dem Graphen stehen. Eine nachträglich geänderte Einordnung erfordert, den ganzen Bestand erneut durchzurechnen — bei jedem Abschnitt mehrere Modellaufrufe.
  • „Schemafrei“ trägt nur bis zu einer gewissen Bestandsgröße. Bei kleinen Beständen ist es ein Vorteil; bei großen wird die selbstgebildete Struktur redundant und verliert gerade dort an Trennschärfe, wo man genau hinsehen will.
  • Ein Netz, das mitwächst, verschiebt seine eigenen Begriffe. Kommen zu Modulhandbüchern später Prüfungsordnungen hinzu, werden dieselben Wörter ein zweites Mal und anders belegt; ein festes Schema, das dem widerspräche, gibt es nicht.
  • Volltext und Einordnung bleiben getrennt. Der erfasste Text bleibt unverändert, die Einordnung darauf ist wiederholbar.

Für unsere Fragestellung arbeiten wir deshalb mit dem dritten Weg: auszählen. Begriffe, Häufigkeiten, Verteilungen über Jahre und Fächer, mit offengelegten Stichwortlisten und einer Fehlerabschätzung. Das beantwortet weniger Fragen als ein Wissensgraph, dafür ist jede Antwort nachrechenbar und lässt sich ohne erneuten Durchlauf über den Bestand revidieren.

Beitrag aus dem KIWIT-Teilprojekt NBS. Beschriebene Arbeit: Fynn-Frithjof Kraft, M.Sc..