· Befund
34 Positionen, ein Streitkern
Was im öffentlichen Diskurs über KI im Studium vertreten wird und wo er sich teilt
Wenn Studierende unaufgefordert über ihr Studium schreiben, kommt Künstliche Intelligenz fast nicht vor. Das zeigt sich in drei Erhebungssituationen, die sich in einem Punkt unterscheiden: ob das Thema vorgegeben war.
| Erhebungssituation | Grundlage | mit KI-Bezug |
|---|---|---|
| Kommentare unter Studienvideos ohne KI-Bezug | 7 Videos, 3.908 Kommentare | 0,3 % |
| Beiträge von Studierenden über ihr Studium (Bluesky) | eigene Ziehung über Suchbegriffe der Studienpraxis | 4,4 % |
| Kommentare unter Videos über KI im Studium | 6 Videos, 3.554 Kommentare | 34,2 % |
Die dritte Zeile trägt nichts bei: Unter einem Video über KI im Studium wird über KI im Studium geredet. Die ersten beiden sind der Befund. Verhandelt wird dort Prüfungsangst, Betreuung, Arbeitsbelastung, Zugangsgerechtigkeit und die Vereinbarkeit des Studiums mit Sorgearbeit.
Der Kontrast zur Nutzungsstatistik
Das CHE hat im Wintersemester 2025/26 über 28.000 Studierende befragt. 81 Prozent gaben an, KI-Werkzeuge mindestens wöchentlich zu nutzen, 46,5 Prozent täglich.
CHE Centrum für Hochschulentwicklung, DatenCHECK: Künstliche Intelligenz im Studium — die Sicht von Studierenden im Wintersemester 2025/26. Veröffentlicht im Juli 2026, 28.584 auswertbare Antworten. Zur Quelle
Für diesen Abstand sind mindestens drei Erklärungen plausibel. Möglich ist, dass der Einsatz zu selbstverständlich für eine Erwähnung geworden ist, wie Rechtschreibprüfung oder Suchmaschine. Möglich ist ebenso, dass die Erwähnung heikel bleibt, weil ein Täuschungsverdacht mitschwingt. Und möglich ist, dass es sich um ein Werkzeug handelt, über das man schlicht nicht spricht.
Unsere Daten unterscheiden diese drei Erklärungen nicht. Sie zeigen, dass der Abstand existiert und wie groß er ist.
Worüber gestritten wird, wenn KI vorkommt
Aus denselben 3.554 Kommentaren haben wir ein Inventar von Positionen gebaut: Behauptungen, denen sich zustimmen oder widersprechen lässt, jede mit Formulierung, Gegenpol und Abgrenzung gegen ihre Nachbarn. Es umfasst 34 ausformulierte Positionen aus laufender Kuration; 218 Belege sind geprüft und mit Textstelle hinterlegt.
Die technischen Eigenschaften sind darin weitgehend unstrittig. Dass Ausgaben zu prüfen sind, dass Modelle verzerrt antworten, dass der Umgang mit KI im Beruf verlangt wird — dazu finden sich viele Belege und kein geprüfter Widerspruch. Umkämpft ist die Zurechnung: wem eine Leistung gehört, und wo Hilfe aufhört.
Die Positionen hängen zusammen
Ob zwei Positionen gemeinsam vertreten werden, lässt sich an den kodierten Beiträgen kaum ablesen: 88,8 Prozent von ihnen tragen genau eine Position, keiner mehr als drei. In Kommentaren wird selten mehr als eine Behauptung aufgestellt — das ist selbst ein Befund, und es macht die beobachtete Kopplung zu dünn für eine Struktur.
Wir haben deshalb Sprachmodelle nach allen 561 Positionspaaren gefragt: Wer die eine vertritt — vertritt der eher auch die andere? Aus den Antworten entsteht eine Kopplungsstruktur.
Eine Richtung trägt ein Viertel der Kopplungsstärke. Verteilt man dieselben Vorzeichen zufällig neu und hält dabei fest, wie viele Zustimmungen jede Position trägt, sind es zwölf Prozent; keiner von 600 Läufen erreicht den gemessenen Wert. Gezählt sind nur die Paare, bei denen beide Modelle übereinstimmten.
Sie ist inhaltlich lesbar. Auf der einen Seite stehen Positionen, die den Einsatz einordnen: dass sich mit KI lernen lässt, dass Prüfungen sie einbeziehen sollen, dass das Werkzeug Zeit spart, dass es Nutzungen gibt, die die Prüfungsleistung nicht berühren. Auf der anderen Seite stehen Positionen, die etwas erhalten wollen: dass ein KI-Text keine eigene Leistung ist, dass Wissenschaft eine neue Erkenntnis verlangt, dass Wissensvermittlung ihren Zweck behält, dass Übung nötig bleibt.
Auf der bewahrenden Seite steht auch die Position, dass KI eingeführt wird, um Arbeitskraft zu ersetzen und Märkte zu besetzen. Sie bildet keine eigene Fraktion.
Eine Lagerteilung gibt es nur im Kern
Die Lagerrichtung teilt aber nicht alle 34 Positionen. Man kann prüfen, wie gut sich der Bestand überhaupt in zwei Gruppen legen lässt, in denen Zustimmungen innerhalb und Gegensätze zwischen den Gruppen liegen. Über alle 34 Positionen hinweg lässt er sich nicht so legen: Die beste erreichbare Teilung lässt genauso viele Kopplungen ungelöst wie gar keine Teilung, nämlich 60.
Zufällig verteilt sind die Gegensätze dennoch nicht. Unter den 34 Positionen gibt es 2.487 Dreiergruppen, in denen alle drei Paare beurteilt sind; 81 Prozent davon gehen widerspruchsfrei auf. Verteilt man dieselben 60 Gegensätze zufällig über dieselben Kopplungen, sind es 68 Prozent.
Der Widerspruch verteilt sich ungleich. 14 der 34 Positionen tragen ihn. Fünf Positionen haben überhaupt keinen Gegensatz, obwohl sie mit 23 bis 27 anderen gekoppelt sind und damit im Durchschnitt liegen:
- Die Prüfungsformate müssen sich ändern, weil die bisherigen mit KI nicht mehr messen, was sie messen sollen.
- Ob KI-Nutzung gegen die Eigenständigkeitserklärung verstößt, ist ungeklärt.
- Der Umgang mit KI muss unterrichtet werden, gleich in welcher institutionellen Form.
- Wer die Sache nicht selbst beherrscht, kann die Ausgabe nicht beurteilen — und merkt das nicht.
- Wer der Täuschung verdächtigt wird, muss seine Unschuld belegen, und diese Umkehr der Beweislast ist das Problem.
Innerhalb der 14 Positionen mit mindestens vier Gegensätzen teilt sich der Bestand dann sauber. Zwischen ihnen liegen 79 Kopplungen, 33 davon gegensätzlich. Bei der besten Teilung passen fünf nicht dazu, und alle fünf sind Zustimmungen, die über die Lagergrenze laufen. Verteilt man die Vorzeichen zufällig, bleiben im Mittel 24 Kopplungen ungelöst, und keiner von 500 Läufen kommt unter 18.
- 33 Gegensätze — jeder verläuft quer
- 41 Zustimmungen — jede bleibt im Lager
- 5 Zustimmungen, die quer verlaufen
Die fünf Ausreißer hängen an zwei Positionen: dass das Modell fachlich mehr leistet als der Mensch, mit dem es verglichen wird, und dass abrufbares Wissen die Vermittlung entwertet. Die Leistungsfähigkeit des Modells ist in beiden Lagern Prämisse.
Was im Kern verhandelt wird
Der schärfste belegte Konflikt
Zwei Positionen schließen einander im Material durchgehend aus: dass ein mit KI erzeugter Text keine eigene Leistung sei, und dass das Umschreiben fremder Vorlagen zulässig bleibe. Neun Beiträge äußern sich zu beiden, und keiner davon vertritt beide gleichsinnig. Belegt sind beide Seiten:
- „Abgeschrieben haben wir doch schon immer, jetzt eben bei ChatGPT.“
- „Wer ein Tool als Ghostwriter nutzt, erbringt keine eigenständige Leistung.“
Dass eine Grenze existiert, ist geteilt
Bei der Frage nach der zulässigen Verwendung bestreitet fast niemand, dass es eine Grenze gibt. Wo sie verläuft, sagt jeder anders. Fünf geprüfte Träger nennen fünf verschiedene Kriterien:
| Beleg | Die Grenze verläuft an |
|---|---|
| „für Formulierung ja, für Denkarbeit nein“ | der Funktion |
| „Klausuren ja, Hausarbeiten nein“ | der Prüfungsart |
| „Zeitersparnis ja, Können muss bleiben“ | der Wirkung |
| „Recherche ja, Prüfungssituation nein“ | der Situation |
| „Präsentationen ja, Hausarbeiten nein“ | dem Aufgabentyp |
Eine Prozentzahl zur Zustimmung würde hier hohe Einigkeit ausweisen und genau die Uneinigkeit verdecken, um die es geht.
Wie empfindlich diese Zuordnung gegen den Kommentarbereich ist, zeigt ein sechstes Kriterium: die Grenze an der Sprachform, Formulierungshilfe zulässig und inhaltliche nicht. Seine Belege stammen sämtlich aus einem Rechtsvideo über einen Übersetzungsfall.
Die einzige Position, der mehrheitlich widersprochen wird
Eine Position steht im Material weitgehend allein: dass Wissensvermittlung ihren Zweck verliere, wenn Wissen jederzeit abrufbar ist. Von 13 geprüften Belegen widersprechen ihr zehn.
- „Wer das Wissen nicht selbst im Kopf hat, kann es nicht verknüpfen, um es zu bewerten.“
- „Kann es wirklich sein, dass vom Bildschirm herunterlesen gleichzusetzen ist mit Bildung?“
Das ist die Position, die dem Fortschrittsoptimismus am nächsten steht, und sie hat im Material kaum Fürsprecher. Dreizehn Belege sind eine schmale Grundlage: Die Richtung ist eindeutig, das Verhältnis nicht belastbar.
Wer sich nicht ausweist, redet über gelingende Täuschung
Eine dritte Richtung trennt die Positionen danach, ob Täuschung feststellbar ist oder ob sie funktioniert. Auf ihr unterscheiden sich zwei Gruppen von Beiträgen: Wer sich im Text als studierend zu erkennen gibt, liegt in der Mitte. Beiträge ohne Selbstbezug liegen auf der Seite von „Umschreiben ist zulässig“ und „mit KI besteht man Prüfungen“.
Der Klassifikator, der den Selbstbezug erkennt, ist an Bluesky entwickelt und erreicht dort 92 Prozent Präzision bei 82 Prozent Recall. In der hier ausgewerteten Menge — YouTube-Kommentaren — liegt der Recall bei 58,8 Prozent. Jede Zahl zum Selbstbezug ist dort eine Untergrenze.
Kommentarräume sind verschiedene Diskursräume
Dieselbe Rechnung lässt sich für die vier Kanäle anstellen. Die Reportage über einen Selbstversuch und das Wissenschaftsformat liegen auf der Lagerrichtung an entgegengesetzten Enden, mit einem Abstand vom 2,3-fachen der Streuung innerhalb der Kommentarräume.
Unterscheidbar sind allerdings nur drei von sechs Kanalpaaren. Belegt ist damit, dass zwei bestimmte Kommentarräume verschieden sind, nicht dass es die Kommentarräume allgemein wären. Für die ungleiche Herkunft der Belege weiter unten ist das der Grund: Wo die Räume auseinanderliegen, trägt es eine Aussage, aus welchem ein Beleg stammt.
Wofür die Struktur gebaut ist
Wenn Positionen eine Kopplungsstruktur haben, lässt sich für jede Menge von Äußerungen fragen, wo sie darin liegt. Für die Kommentarräume steht das oben. Dieselbe Rechnung ist für die Kommunikation einer Hochschule möglich — und damit die Frage, ob eine Einrichtung ein kontroverses Thema in sich stimmig adressiert. Die Daten dafür liegen vor, die Auswertung steht aus.
Wie die Zahlen zustande kommen
Der Bestand umfasst 48.293 Beiträge und ist zum Stichtag geschlossen: 35.460 aus Bluesky, über Suchbegriffe erhoben, 12.300 Kommentareinheiten unter ausgewählten YouTube-Videos und 533 Beiträge aus Mastodon.
Die Videos stehen in zwei Gruppen. Die eine umfasst journalistische Beiträge über KI im Studium, von einem juristischen Kanal sowie PULS Reportage, 3sat NANO und ZDFheute. Die andere sind Videos über das Studium ohne KI-Bezug (Studi-Vlogs, Prüfungsvorbereitung, Studienwahl) und damit die Kontrollgruppe: Sie beantwortet, ob KI von selbst aufkommt, wenn niemand danach fragt. Die dritte Messung auf Bluesky ist davon unabhängig; erhoben wurde dort über Suchbegriffe der studentischen Praxis wie Hausarbeit, Bachelorarbeit und Klausur, nicht über KI-Begriffe.
Ein Hinweis zur Vergleichbarkeit: Die Videos in Gruppe B sind im Schnitt älter. Beschränkt man die Rechnung auf Kommentare ab 2023, steigt ihr KI-Anteil von 0,3 auf 0,7 Prozent. Beide Werte sind klein, und die Richtung ändert sich nicht.
Drei geprüfte Gegenhypothesen
Ein so niedriger Wert ist zuerst ein Verdacht gegen die eigene Messung. Drei Erklärungen, die den Befund erledigt hätten, haben wir geprüft.
Erstens: Vielleicht wird der Einsatz umschrieben, ohne dass das Wort fällt. Wir haben 1.839 Beiträge nach Umschreibungen durchsucht — „generieren lassen“, „nicht selbst geschrieben“, „das Tool“, „automatisch erstellt“. Das Ergebnis waren zwei echte Treffer; die naheliegendsten Formulierungen kamen kein einziges Mal vor.
Zweitens: Vielleicht findet der Klassifikator zu wenig, der erkennt, ob sich jemand im Text als studierend zu erkennen gibt. Er hatte anfangs einen Recall von 31 Prozent und übersah damit zwei Drittel der einschlägigen Fälle; nach der Überarbeitung liegt er bei 82 Prozent. Der gemessene KI-Anteil in dieser Menge ist dabei von 10,3 auf 5,5 Prozent gesunken.
Drittens: Vielleicht liegt es an der Plattform. Der Befund ist auf YouTube unabhängig repliziert — andere Plattform, andere Erhebungslogik, kein Suchwortfilter. Dort liegt der Wert mit 0,3 Prozent noch niedriger als auf Bluesky.
Was die Daten nicht hergeben
- Keine Repräsentativität. Die Stichprobe ist gefunden und nicht gezogen. Wie viele Studierende KI nutzen, messen Befragungen wie die des CHE; dafür sind sie das geeignete Instrument.
- Keine Aussage über einzelne Hochschulen: 3,2 Prozent der Beiträge nennen eine Einrichtung.
- Keine Fachunterschiede: 7,2 Prozent nennen ein Fach.
- Die Analysemenge sind sechs Videos aus vier Kanälen über drei Jahre. Dass dort dicht und argumentativ kommentiert wird, ist der Vorteil der kontextbasierten Auswahl; der enge Ausschnitt ist ihr Preis.
- Die geprüften Belege bilden die Analysemenge nicht ab, sondern sind gegen sie verschoben: Das Rechtsvideo stellt 14 Prozent der Kommentare und 26 Prozent der Belege, der größte Nachrichtenkanal umgekehrt 48 gegen 38 Prozent. Aussagen über einzelne Positionen tragen diese Verschiebung mit.
- Das Positionsinventar entsteht in laufender Kuration. Positionen kommen hinzu, werden geteilt und zusammengelegt; die hier genannten Verhältnisse gelten für den Stand dieses Beitrags.
- Die Kopplungen zwischen Positionen sind Modellurteile. Zwei Sprachmodelle haben geschätzt, welche Positionen zusammen vertreten werden; befragt wurde niemand. Dass beide übereinstimmen, macht ein Urteil belastbarer, aber nicht zu einer Beobachtung: Zwei Modelle können denselben Vorrat an Sprache teilen und deshalb denselben Fehler machen.
Eine Grenze zeigt sich am Instrument selbst. Wir haben nach Positionen gesucht, die einander logisch ausschließen und trotzdem gemeinsam vertreten werden; elf Paare kamen heraus, fünf davon sind belegt. Beim Lesen der Belege war es keine Widersprüchlichkeit — der Schreibende zieht eine Unterscheidung, die unser Kategoriensystem nicht kennt:
- „Ich denke das Ding ist es nicht das komplette Teil mit ChatGPT zu schreiben, sondern ihn wie eine Art Sekretär zu verwenden.“
- „Gerade weil man ohne Können nicht urteilen kann, wird die Täuschung erkennbar.“
Im zweiten Fall verbindet der Schreibende zwei Positionen kausal, wo die Auswertung nur sieht, dass beide vorkommen. Wo zwei Modelle bei einem Positionspaar zu entgegengesetzten Urteilen kommen, ist häufig die Formulierung zu grob — bei drei Positionen häuft sich das auf das Dreifache des Erwartungswerts, und dort zeigen die Belege eine fehlende Unterscheidung. Das ist ein Befund über das Instrument und keiner über den Diskurs.
Hinzu kommt der Zuschnitt des Gegenstands: Gemessen wird öffentliche Kommunikation. Was in Sprechstunden, Prüfungsausschüssen und Gruppenchats verhandelt wird, ist nicht im Bestand und mit diesem Instrument auch nicht erreichbar.
Wie sich die Grenzen verschieben ließen
Die Analysemenge ließe sich auf zwanzig bis fünfzig Videos erweitern. Der Engpass ist dabei nicht die Technik, sondern die Population: Journalistische deutschsprachige Videos über KI im Studium mit diskussionsfähigem Kommentarraum sind eine zweistellige Menge. Über KI in Schule, Arbeitsmarkt und Gesellschaft gibt es reichlich Material; über die Hochschule berichten dieselben wenigen Redaktionen. Das ist ein eigener Befund über die Medienlandschaft.
Zwei Erweiterungen sind vorbereitet: Reddit, wo die deutschsprachigen Studierendenforen echte Diskussionsverläufe enthalten — der Forschungszugang verlangt ein Ethikvotum und einen Vorlauf von Monaten —, und ein Bluesky-Archiv, das bis November 2022 zurückreicht und die Zeitachse nach hinten öffnen würde, die derzeit am Erhebungsbeginn endet.
Eine Frage für die qualitative Arbeit
Welche der drei Erklärungen für den Abstand zutrifft — Normalisierung, Stigma oder reine Werkzeuglichkeit —, lässt sich mit mehr Beiträgen nicht entscheiden. Dafür braucht es Interviews und Gruppengespräche, also die Verfahren der qualitativen Teilprojekte im Verbund.
Beitrag aus dem KIWIT-Teilprojekt NBS. Beschriebene Arbeit: Mathias Leonhardt, M.Sc..