Kurze Antwort: Ein großes Sprachmodell ist ein sehr guter Vorhersager des nächsten Wortes. Es liest Text als Tokens, hält eine begrenzte Menge davon in einem Kontextfenster und schreibt ein Token nach dem anderen, jeweils das plausibelste. Deshalb ist es flüssig, und deshalb halluziniert es: Plausibel ist nicht dasselbe wie wahr. Frag es, ob die CIP von letzter Nacht an Gärtank 7 die Spezifikation erfüllt hat, und ohne deine SOP vergleicht es mit einem typischen Branchenwert und klingt dabei sicher. Gib ihm über Retrieval (RAG) die SOP-Klausel und die Protokollzeilen, und es kann gegen deinen eigenen Standard antworten, mit Quellenangabe. Diese eine Designentscheidung macht im Betrieb den größten Teil des Unterschieds aus.
Hier ist eine Zeile aus einem erfundenen CIP-Protokoll eines Gärtanks, wie sie jede Brauerei, Weinkellerei und Brennerei tausendfach erzeugt:
02:14 | FV-07 | CAUSTIC STEP START | NaOH 1.8% | SUPPLY 78.0 C
02:31 | FV-07 | CAUSTIC STEP END | DURATION 17 MIN
Füg das in einen Chatbot ein und frag, ob die Reinigung die Spezifikation erfüllt hat. Mit ziemlicher Sicherheit bekommst du ein selbstsicheres “Ja”: Lauge im Bereich von 1 bis 2 Prozent bei etwa 75 bis 85 Grad C ist für eine CIP typisch, und 17 Minuten klingen in Ordnung. Nimm nun an, deine SOP verlangt 2,0 Prozent bei 80 Grad für mindestens 20 Minuten. Die Reinigung ist in allen drei Punkten durchgefallen, und der Chatbot hat dir gerade gesagt, sie sei bestanden.
Der erste Beitrag dieser Serie hat generative KI auf der Leiter eingeordnet. Dieser hier öffnet sie, denn sobald man sieht, wie ein Sprachmodell arbeitet, ist diese falsche Antwort kein Rätsel mehr.
Tokens: wie das Modell liest
Ein Sprachmodell liest weder Buchstaben noch ganze Wörter. Es liest Tokens, Textstücke, die oft ein Wort, ein Wortteil oder ein Symbol sind. “Caustic” ist vielleicht ein Token. “NaOH” vielleicht zwei oder drei. Als Faustregel für Englisch entsprechen tausend Tokens etwa 750 Wörtern; deutscher Text braucht meist etwas mehr.
Tokens sind aus zwei praktischen Gründen wichtig. Kosten und Grenzen werden in Tokens gezählt, und Zahlen werden auf seltsame Weise in Tokens zerlegt. “78.0” kann zu mehreren Stücken werden. Das ist ein Grund, warum Sprachmodelle beim Rechnen unzuverlässig sind: Sie arbeiten nicht mit der Zahl, sondern mit Fragmenten ihres Textes.
Das Kontextfenster: was das Modell sehen kann
Das Kontextfenster ist alles, was das Modell auf einmal sehen kann: deine Frage, alle eingefügten Dokumente, den bisherigen Gesprächsverlauf und seine eigene Antwort. 2026 akzeptieren führende Modelle Hunderttausende Tokens, manche mehr als eine Million. Das klingt, als reiche es, um jede SOP des Betriebs einzufügen.
So einfach ist es nicht ganz. Modelle verteilen ihre Aufmerksamkeit über einen sehr langen Kontext ungleichmäßig, und Details in der Mitte eines langen Dokuments werden leichter übersehen. Außerdem ist der Kontext flüchtig. Endet das Gespräch, erinnert sich das Modell an nichts. Es hat deine SOP nicht gelernt. Es hat sie einmal gelesen.
Vorhersage des nächsten Tokens: wie das Modell schreibt
Im Kern tut ein großes Sprachmodell genau eines: Ausgehend von den bisherigen Tokens sagt es voraus, welches Token am wahrscheinlichsten als Nächstes kommt. Dann hängt es dieses Token an und macht es noch einmal. Eine ganze Antwort besteht aus Hunderten solcher Vorhersagen hintereinander.
Gelernt hat es diese Vorhersagen durch Training auf einer enormen Textmenge. Daher kommt sein Allgemeinwissen. Es hat Tausende Dokumente über CIP gelesen, also kennt es den typischen Laugenbereich. Deine SOP hat es nie gelesen, also kann es deinen Standard nicht kennen, solange du ihn nicht zeigst.
Halluzination: warum die selbstsichere falsche Antwort entsteht
Setzt man diese Teile zusammen, wird Halluzination offensichtlich. Das Modell ist darauf gebaut, die plausibelste Fortsetzung zu erzeugen. Liegt die wahre Antwort vor ihm, decken sich plausibel und wahr meistens. Liegt sie nicht vor, erzeugt das Modell trotzdem etwas Plausibles, denn etwas anderes kann es nicht. Es gibt keinen internen Alarm, der sagt: “Diese Information habe ich nicht.”
Deshalb kam bei der CIP-Frage “Ja” heraus. Der plausibelste Text, gemessen an dem, was das Modell im Training gesehen hatte, war, dass 1,8 Prozent bei 78 Grad eine normale Reinigung sind. Es hat deinen Standard nicht geprüft, weil es keinen Standard zum Prüfen hatte.
Halluzination lässt sich verringern, aber nie beseitigen. Der wichtigste Hebel ist kein besseres Modell. Es ist der richtige Text für das Modell.
RAG: dem Modell den richtigen Text geben
Retrieval-Augmented Generation, kurz RAG, ist die Standardlösung. Bevor das Modell antwortet, durchsucht ein Retrieval-Schritt deine eigenen Dokumente (SOPs, Spezifikationen, Wartungshandbücher, frühere Störungsberichte) und legt die relevantesten Passagen zusammen mit der Frage in den Kontext. Das Modell wird angewiesen, aus diesen Passagen zu antworten und sie zu zitieren.
Mit RAG erneut gefragt, holt das System SOP-Abschnitt 4.2 und die FV-7-Protokollzeilen. Das Modell antwortet nun: Der Laugenschritt lag bei Konzentration, Temperatur und Dauer unter dem SOP-Minimum, siehe Abschnitt 4.2. Gleiches Modell, andere Eingaben, andere Antwort.
Zwei Verfeinerungen machen das im Betrieb vertrauenswürdig:
- Alles belegen. Jede Antwort nennt das Dokument und den Abschnitt, aus dem sie stammt, damit ein Bediener die SOP öffnen und nachprüfen kann.
- Den Vergleich dem Code überlassen. Ein Modell kann “mindestens 2,0 Prozent” aus der SOP lesen. Ob 1,8 unter 2,0 liegt, ist eine Aufgabe für eine Codezeile, nicht für ein Sprachmodell. Die besten Systeme extrahieren Grenzwerte und Messwerte und lassen gewöhnliche Software vergleichen.
Ich habe früher einen Beitrag über die Suche in Brauerei-SOPs mit GenAI geschrieben. Die Idee hat sich nicht geändert. Die Modelle sind nur so gut geworden, dass jetzt die Qualität des Retrievals das schwache Glied ist.
Fine-Tuning: ein anderes Werkzeug
Fine-Tuning heißt, ein bestehendes Modell mit eigenen Beispielen noch etwas weiterzutrainieren. Viele nehmen an, so bringe man einem Modell die eigenen SOPs bei. Dafür ist es meist das falsche Werkzeug.
Fine-Tuning ist gut darin, das Verhalten eines Modells zu ändern: das Format seiner Antworten, den Ton einer Schichtübergabe, wie es eine Art von Linienstillstand klassifiziert. Schlecht ist es darin, Fakten zu speichern, die sich ändern, denn die Fakten stecken dann ohne Quellenangabe und ohne einfache Aktualisierung in den Gewichten des Modells. Wird die SOP überarbeitet, liest ein RAG-System morgen die neue Fassung. Ein feinabgestimmtes Modell zitiert weiter die alte, bis man es neu trainiert.
Eine nützliche Regel: RAG für Wissen, Fine-Tuning für Verhalten, und die meisten Betriebe brauchen das Zweite nie.
Multimodal: wenn die Eingabe kein Text ist
Viele aktuelle Modelle sind multimodal: Sie nehmen neben Text auch Bilder an, manche auch Audio. In der Produktion öffnet das einige nützliche Türen. Ein Bediener fotografiert ein Manometer, eine Störungsmeldung auf einem HMI oder ein handschriftliches Sudprotokoll, und das Modell liest es. Ein Instandhaltungstechniker fotografiert ein Typenschild und bekommt den richtigen Abschnitt im Handbuch.
Es gelten dieselben Regeln. Ein Modell, das das Foto eines Manometers liest, kann sich verlesen, und es meldet seinen Lesefehler mit derselben Sicherheit. Nutze es zum Erfassen und Entwerfen, und bestätige dann die Zahlen.
Wo es bricht
Das Retrieval kann die falsche Passage holen. Sind die SOP für die Drucktanks und die SOP für die Gärtanks fast identisch, zieht der Retriever vielleicht die falsche. Die Quellenangabe ist das, was es einem Menschen erlaubt, das zu bemerken.
Dokumente sind oft veraltet. RAG macht das Modell genau so aktuell wie deine Dokumentenbibliothek. Eine nicht überarbeitete SOP erzeugt selbstsicher veraltete Antworten.
Zahlen bleiben riskant. Selbst mit dem richtigen Text kann ein Modell eine Tabelle falsch lesen oder einen Wert runden. Wo eine Entscheidung an einer Zahl hängt, sollte die Zahl aus einem führenden System oder einer Berechnung kommen, nicht aus dem Fließtext des Modells.
Das Modell klingt gleich, wenn es falsch liegt. Zwischen einer richtigen und einer erfundenen Antwort ändert sich der Ton nicht. Menschen darin zu schulen, die Quellenangabe zu prüfen, ist so wichtig wie der Bau des Systems.
Das Fazit
Ein Sprachmodell sagt plausiblen Text Token für Token voraus. Es weiß, was typisch ist, und nichts über deinen Betrieb, solange du es ihm nicht zeigst. Das macht es flüssig, nützlich und anfällig für selbstsichere Fehler. RAG schließt den größten Teil der Lücke, indem es deine eigenen SOPs und Protokolle vor das Modell legt und es zwingt, sie zu zitieren. Fine-Tuning ändert Verhalten, nicht Wissen. Und wenn die Antwort eine Zahl ist, auf die es ankommt, lass Code sie prüfen.
Als Nächstes: Was agentische KI ist, wenn ein Modell aufhört, Fragen zu beantworten, und anfängt, Werkzeuge zu benutzen. Die Brennerei-Sicht auf diese Grundlagen steht in Was ist generative KI? Der Unterschied, der für Brenner zählt. Wie dieselbe Idee den Datenassistenten einer Weinkellerei trägt, zeigt die Serie Cellar Ledger.
Häufig gestellte Fragen
Was ist ein großes Sprachmodell, einfach erklärt? Ein großes Sprachmodell ist ein neuronales Netz, das auf einer riesigen Textmenge trainiert wurde, um das nächste Stück Text vorherzusagen, ein Token nach dem anderen. Weil es so viel Sprache gesehen hat, kann es schreiben, zusammenfassen, übersetzen und Fragen beantworten. Es schlägt keine Fakten nach, solange man ihm keinen Weg dazu gibt, und es hat kein eingebautes Gespür dafür, ob das Geschriebene stimmt.
Warum halluzinieren LLMs? Weil sie darauf gebaut sind, die plausibelsten nächsten Wörter zu erzeugen, nicht die richtigen. Steht die Antwort nicht im mitgegebenen Text, füllen sie die Lücke mit etwas, das richtig klingt. Wer nach einer CIP-Laugenkonzentration fragt, ohne die eigene SOP mitzugeben, bekommt einen typischen Branchenwert, selbstsicher vorgetragen, der nicht der eigene sein muss.
Sollte ein Betrieb RAG oder Fine-Tuning nutzen? Für Fakten, die in Dokumenten stehen, etwa SOPs, Spezifikationen und Wartungshandbücher, ist Retrieval (RAG) das Mittel der Wahl: Das System findet die passende Textstelle und gibt sie dem Modell zusammen mit der Frage, sodass die Antworten die eigenen Dokumente zitieren und sich mit ihnen aktualisieren. Fine-Tuning verändert den Stil des Modells oder bringt ihm ein Aufgabenformat bei. Für Fakten, die sich ändern, ist es ein schlechter Speicherort.