Sie fragen in normalen Sätzen, geantwortet wird aus Ihrem eigenen Bestand. Bei jeder Auskunft steht die Fundstelle dabei, nicht bloß die Behauptung.
SimuliertDer Bestand, die Dokumente und die Antwort sind erfunden und vorbereitet. Hier läuft keine Suche und kein Sprachmodell. Gezeigt wird der Weg, den ein solches System nimmt, Schritt für Schritt.
Dokumente
1.946
Gruppen
4
Belege je Antwort
3
Die Vorführung läuft am Computer oder Tablet. Am Handy wäre sie zu klein, um etwas zu erkennen; worum es geht, steht im Text.
Trinkwasser
Wartung
Prüfungen
Verträge
PDFRichtlinie_Trinkwasser.pdf
Spülung von Trinkwasseranlagen
Bei längerer Betriebsunterbrechung ist die Anlage vor der Wiederinbetriebnahme zu spülen.
Unterbrechung
Maßnahme
über 7 Tage
Spülung
über 4 Wochen
Spülung, Beprobung
Die Durchführung ist im Betriebsbuch zu vermerken.
Seite 12
PDFWartungshandbuch.pdf
Seite 8
ScanPrüfprotokoll.pdf
Seite 3
PDFPrüfbericht_2024-118.pdf
Seite 2
WordRahmenvertrag.docx
Abschnitt 12
Über sieben Tage Unterbrechung: spülen.
Richtlinie_Trinkwasser.pdf · Seite 12 · Abschnitt 6.3
Wiederkehrende Spülung nach Betriebsanweisung.
Wartungshandbuch.pdf · Seite 8 · Abschnitt 4
Letzte Spülung ist im Protokoll vermerkt.
Prüfprotokoll.pdf · Seite 3 · Abschnitt 2
Druckprüfung nach abgeschlossener Montage.
Richtlinie_Trinkwasser.pdf · Seite 31
Frage
Wie oft muss die Trinkwasserleitung gespült werden?
Antwort aus dem eigenen Bestand
Nach mehr als sieben Tagen Unterbrechung ist vor der Wiederinbetriebnahme zu spülen. Den Turnus im laufenden Betrieb gibt die Betriebsanweisung vor, die letzte Spülung steht im Prüfprotokoll.
Richtlinie_Trinkwasser.pdf · Seite 12
Wartungshandbuch.pdf · Seite 8
Prüfprotokoll.pdf · Seite 3
01 · Einlesen
Alles, was im Betrieb herumliegt
Richtlinien, Handbücher, Protokolle und Verträge kommen so herein, wie sie sind.
Dateiname und Seitenzahl bleiben von Anfang an daran hängen.
Einlesen. Richtlinien, Handbücher, Protokolle und Verträge kommen herein, wie sie sind. Dateiname und Seitenzahl bleiben daran hängen.
Erkennen. Aus der Dokumentseite entsteht maschinenlesbarer Inhalt: Überschriften, Absätze, Tabellen.
Zerlegen. Der Text wird in zusammenhängende Abschnitte geteilt. Jeder Abschnitt behält seine Herkunft.
Verstehen. Jeder Abschnitt wird in eine Zahlenreihe übersetzt. Inhalte mit ähnlicher Bedeutung liegen im Speicher nahe beieinander.
Finden. Die Frage wird ebenso übersetzt. Gesucht wird, was ihr in der Bedeutung am nächsten liegt, nicht das gleiche Wort.
Antworten. Nur die gefundenen Stellen gehen an das Sprachmodell. Die Antwort nennt Richtlinie_Trinkwasser.pdf Seite 12, Wartungshandbuch.pdf Seite 8 und Prüfprotokoll.pdf Seite 3.
Was hineinkommt
Alles, was im Betrieb an Wissen herumliegt und niemand mehr findet: Herstellerrichtlinien, Verträge, Protokolle, Handbücher, Prüfberichte. Bei mir waren es knapp 2.000 Dokumente, es hätten auch zweihundert oder zwanzigtausend sein können. Die Zahl ist mein eigener Bestand, kein Merkmal des Systems.
Was das System liest: PDF-Dateien, gescannte Ordner mit Texterkennung, Word- und Textdateien. Was es nicht liest, sind Pläne. Eine DWG-Zeichnung enthält Linien und Symbole, keinen zusammenhängenden Text. Was auf einem Plan steht, muss als Text danebenliegen, sonst existiert es für das System nicht.
Wie viel Wissen verträgt das?
Der Speicherplatz ist selten die Grenze. Pinecone, ein Anbieter für die Suche in solchen Systemen, spricht in der eigenen Dokumentation von „Namensräumen im Millionenbereich und darüber“ (Pinecone, Understanding indexes). Ein System wie meines stößt mit ein paar tausend oder auch einigen hunderttausend Dokumenten technisch an keine Wand.
Die Forscher nennen das Vektorsuche-Verwässerung: In einem großen, gemischten Bestand verlieren ähnliche Dokumente ihre Unterscheidbarkeit, und die Suche findet zunehmend etwas zum Thema, aber nicht zur Frage. Trennung nach Themenbereich hat die Trefferquote in derselben Untersuchung wieder deutlich angehoben. Das trifft sich mit meiner eigenen Erfahrung: Nicht die Menge macht ein System gut, sondern die Abgrenzung.
Wie die Suche arbeitet
Sie stellen eine Frage in normaler Sprache. Das System sucht dazu die passenden Stellen in Ihren eigenen Dokumenten. Diese Stellen bekommt das Sprachmodell zusammen mit der Frage vorgelegt und schreibt daraus die Antwort, mit der Fundstelle dazu. Der englische Fachbegriff dafür ist Retrieval-Augmented Generation, kurz RAG: Auffinden plus Textgenerierung, statt Textgenerierung allein.
Gefragt wird in normalen Sätzen, so wie man einen Kollegen fragen würde. Die Frage wird nicht nach Stichwörtern durchsucht, sondern nach Bedeutung. Wer „Leckagetest“ eingibt, findet auch den Abschnitt über die Dichtheitsprüfung, obwohl das Wort dort nicht vorkommt. Warum das funktioniert, steht im Beitrag Wie ein Modell Bedeutung misst.
Warum die Fundstelle alles entscheidet
Eine Antwort ohne Beleg hilft auf der Baustelle keinem Menschen.
Das war die wichtigste Lehre aus einem Jahr Betrieb. Niemand unterschreibt eine Auskunft, die er nicht nachschlagen kann.
Deshalb steht bei jeder Antwort, woher sie stammt: Datei, Kapitel, Seite. Ein Klick öffnet das Original an der richtigen Stelle. Das klingt nach einer Kleinigkeit und ist der Unterschied zwischen Spielzeug und Werkzeug. Es hat einen zweiten Nutzen: Ein falscher Treffer fällt beim Nachschlagen sofort auf. Eine erfundene Auskunft ohne Beleg nicht.
Wo es im Alltag hilft
Draußen. Eine Frage am Handy, statt im Büro anzurufen und jemanden suchen zu lassen.
Beim Prüfen. Zwei Fassungen einer Vorgabe nebeneinander, mit Fundstelle zu beiden.
Beim Einarbeiten. Neue Kollegen fragen das System, statt dreimal dieselbe Frage zu stellen.
Wenn jemand geht. Was in Protokollen und Berichten steht, bleibt auffindbar.
Gebaut habe ich das für die eigene Baustelle. Das Prinzip trägt aber überall dort, wo Antworten in einem großen Textbestand versteckt sind:
Technische Dokumentation. Ein Hersteller mit hunderten Handbüchern zu verschiedenen Baureihen: Die Antwort nennt Modell und Seite statt „schauen Sie im Handbuch nach“.
Verträge und Vereinbarungen. Welche Klausel in welchem von vielen Verträgen steht, ohne jeden Einzelnen von Hand zu öffnen.
Interne Richtlinien. Wer was freigeben darf, ab welcher Summe, in welcher Fassung.
Support-Anfragen. Dieselbe Frage kommt selten zum ersten Mal; die Antwort mit Fundstelle muss nur einmal geschrieben werden.
Grenzen und Verantwortung
Es denkt nicht mit. Es weiß nichts, was nicht eingelesen wurde, und es merkt nicht, wenn eine Vorgabe inzwischen überarbeitet wurde. Fehlt die neue Fassung, antwortet es aus der alten, mit derselben Selbstsicherheit wie sonst. Die Pflege der Quellen ist keine Nebensache, sondern die eigentliche Arbeit.
Es ersetzt auch keine Entscheidung. Es findet die Stelle, an der etwas steht. Ob das für den Fall gilt, entscheidet weiterhin ein Mensch, der dafür geradesteht. Ohne gepflegte Quellen und ohne Fundstelle bei jeder Antwort ist es ein Ratewerkzeug mit gutem Ton, kein Nachschlagewerk.
Bleiben die Dokumente im Haus?
Das hängt vom Aufbau ab, und es ist die Frage, die vor allen anderen geklärt gehört. Die Dokumente selbst liegen im eigenen Haus. Was an ein Sprachmodell geht, ist die Frage und der gefundene Abschnitt, nicht der ganze Bestand. Wer auch das vermeiden will, betreibt das Modell selbst, zahlt dafür aber mit Rechenleistung und Wartung. Was dabei zu klären ist, steht im Beitrag Wo Ihre Daten landen.
Was ich beim nächsten Mal anders machen würde
Kleiner anfangen. Ich habe zu Beginn zu viel auf einmal hineingegeben. Sinnvoller wäre gewesen: der eine Dokumentenberg, der am meisten wehtut, zuerst. Wenn der funktioniert und die Leute ihn benutzen, kommt der nächste dazu.