Daten & Prozesse · Dokumentextraktion
Neun Prüfungen, im Browser
Vier aufgezeichnete Modellläufe auf 16 Seiten Fachtext. Diese Seite nimmt die Rohantworten, zerlegt sie selbst und prüft jeden Datensatz neu gegen den Dokumenttext – wörtlich, seitengenau, Kennwert im Zitat, Quelle im Literaturverzeichnis. Nichts davon ist ein gespeichertes Ergebnis.
Was hier läuft – und was nicht
Die Modellantworten sind echt und unverändert:
vier Läufe vom 2. September 2026, aufgezeichnet mit
skripte/ki-lauf.py. Sie werden hier nicht nacherzählt,
sondern als Rohtext geladen und neu zerlegt – samt der Fehler.
Es läuft kein Modellaufruf. Diese Seite sendet nichts, lädt nichts von fremden Servern nach und speichert nichts. Der Dokumenttext, gegen den geprüft wird, liegt mit: Kapitel 4 der Bachelorarbeit, gedruckte Seiten 19 bis 34.
Dieselben neun Prüfungen stehen ein zweites Mal in
skripte/ki-pruefung.py. Die Regeltests weiter unten
halten beide Fassungen Datensatz für Datensatz gegeneinander – und
die Regel, was „wörtlich“ heißt, steht nur an einer Stelle, in
shared/beleg.js.
Das Dokument
Die vier Läufe
Einen Lauf anklicken, um seine 13 Datensätze mit allen Befunden zu sehen. Belegt heißt: alle neun Prüfungen ohne Befund. Nicht wörtlich heißt: inhaltlich gefunden, aber nicht zeichengenau – kein Fehler, aber auch kein Beleg.
| Lauf | Schema | Sätze | wörtlich | seitengenau | belegt | Befunde | Kosten |
|---|
Bewusst erzeugte Testfälle
Halluzination (E2) und erfundene Quelle (E4) traten in keinem der vier Läufe auf. Eine Prüfung, die nie anschlägt, sieht aber wie eine bestandene Prüfung aus und ist keine. Diese fünf Fehler sind deshalb absichtlich in einen sonst sauberen Datensatz eingebaut. Es sind keine Modellfehler und sie zählen nirgends mit.
| Nr. | Eingebaut in | Wert | Erwartet | Gefunden | Befund |
|---|
Die neun Prüfungen
| Nr. | Frage | Bei Befund | Gegenmaßnahme |
|---|
Keine dieser Prüfungen fragt ein Modell. Alle neun vergleichen Zeichenketten mit dem Dokument oder zählen.
Regeltests
Der wichtigste Block ist der erste: Er hält die Prüfung dieser Seite
gegen das Urteil, das skripte/ki-pruefung.py beim
Aufzeichnen gefällt hat – Datensatz für Datensatz. Der zweite baut
jeden Fehler der Klassen E1 bis E6 künstlich ein und prüft, dass die
zuständige Prüfung anschlägt.
| Test | Ergebnis |
|---|
Grenzen
- Ein Lauf je Modell. 52 geprüfte Datensätze sind ein Beleg für die Denkweise, keine Modellbewertung. Modelle antworten nicht deterministisch.
- Die Prüfung prüft Belege, nicht Fachlichkeit. Dass ein Wert im Dokument steht, heißt nicht, dass er stimmt.
- Sie beurteilt auch nicht die Auswahl. Ob ein Zitat die Kernaussage seines Kapitels trifft, kann kein Zeichenvergleich entscheiden.
- Keine Berufserfahrung mit Dokumentextraktion. Dieser Fall ist 2026 für dieses Portfolio entstanden.
Zum Nachrechnen
Extraktion (CSV) Fehlerlog (CSV) Modellvergleich (CSV)
Wie der Fall aufgebaut ist, warum die Sollmenge 13 beträgt und was die Prüfung ausdrücklich nicht entscheidet, steht auf Ein Dokument, ein Modell, neun Prüfungen.