Kurze Antwort: Ein Agent ist ein Sprachmodell mit Werkzeugen und einer Schleife. Du gibst ihm ein Ziel, etwa “finde heraus, warum Linie 2 letzte Nacht 40 Minuten verloren hat”. Es plant einen Schritt, ruft ein Werkzeug auf (das Stillstandsprotokoll der Linie abfragen), sieht sich das Ergebnis an, entscheidet über den nächsten Schritt (im Instandhaltungssystem nach dieser Anlage sehen) und macht weiter, bis es eine Antwort hat oder einen Menschen braucht. MCP ist der Standardstecker, der Modelle mit diesen Werkzeugen verbindet. Gedächtnis lässt es Kontext zwischen Schritten und Sitzungen mitnehmen. Die wichtige Designfrage ist nicht, wie klug der Agent ist, sondern wie viel er allein tun darf. Ich nutze eine Leiter mit fünf Stufen, L0 bis L4, und in der Produktion sollten die meisten Agenten auf L1 oder L2 leben.
Die Nachtschicht auf Linie 2 hat 40 Minuten verloren. In der Morgenbesprechung fragt jemand, warum. Normalerweise dauert die Antwort eine halbe Stunde: das Stillstandsprotokoll öffnen, die langen Stillstände finden, die Anlage im Instandhaltungssystem nachschlagen, prüfen, ob sie schon früher ausgefallen ist, die Schichtnotizen lesen und dann alles zusammensetzen.
Ein Chatbot kann das nicht. Er kann nur aus dem antworten, was du ihm einfügst. Ein Agent kann es, weil er jedes Teil selbst holen kann. Dieser Beitrag, der dritte der Serie, erklärt, wie. Der vorherige Beitrag hat behandelt, was ein Sprachmodell ist. Ein Agent ist dasselbe Modell mit zwei Ergänzungen: Werkzeugen und einer Schleife.
Werkzeuge: was ein Agent erreichen kann
Ein Werkzeug ist eine Funktion, die das Modell aufrufen darf. Sie hat einen Namen, eine Beschreibung in einfacher Sprache, definierte Eingaben und eine definierte Ausgabe. Für einen Betrieb könnten nützliche Werkzeuge sein:
get_line_stops(line, start, end)liefert jeden Stillstand mit Dauer, Störcode und Anlageget_asset_history(asset_id)liefert frühere Arbeitsaufträge und Ausfälle aus dem Instandhaltungssystemsearch_sop(query)liefert die relevanten SOP-Passagen mit Abschnittsnummernget_shift_notes(line, shift)liefert, was die Bediener aufgeschrieben haben
Das Modell führt nie direkt SQL gegen die Instandhaltungsdatenbank aus. Es fordert ein Werkzeug per Namen mit einigen Eingaben an, gewöhnliche Software führt eine getestete Abfrage aus, und das Ergebnis kommt als Text zurück. Diese Trennung ist die wichtigste Sicherheitseigenschaft eines Agenten. Das Modell entscheidet, was nachgeschlagen wird. Der Code entscheidet, wie, und was erlaubt ist.
Die Schleife: planen, handeln, beobachten
Mit verfügbaren Werkzeugen arbeitet das Modell in einer Schleife:
- Planen. Ausgehend vom Ziel und dem bisherigen Wissen den nächsten Schritt festlegen. “Zuerst die langen Stillstände auf Linie 2 von letzter Nacht finden.”
- Handeln. Ein Werkzeug aufrufen.
get_line_stops("L2", "22:00", "06:00"). - Beobachten. Das Ergebnis lesen. Sechs Stillstände, vier davon am Leimwerk der Etikettiermaschine, insgesamt 31 Minuten.
- Wiederholen. Den nächsten Schritt mit der neuen Information planen. “Die Instandhaltungshistorie des Leimwerks prüfen.” Und so weiter.
Die Schleife endet, wenn der Agent genug für eine Antwort hat oder an etwas stößt, das er nicht allein entscheiden sollte, und an einen Menschen übergibt. Für die Frage zu Linie 2 könnte ein guter Agent so abschließen: Der größte Teil der 40 Minuten war das Leimwerk der Etikettiermaschine, vier Stillstände mit demselben Störcode; derselbe Fehler taucht letzten Monat in zwei Arbeitsaufträgen auf; die Schichtnotizen erwähnen die Leimtemperatur; der SOP-Abschnitt zum Anfahren des Leimwerks ist 6.3.
Das ist keine Magie. Es ist die halbstündige Handarbeit in einer Minute, mit jedem Schritt sichtbar.
MCP: der Standardstecker
Bis vor Kurzem hieß ein Modell mit einem Werkzeug zu verbinden, für jedes Modell und jedes System eigenen Code zu schreiben. Das Model Context Protocol (MCP), ein offener Standard, den Anthropic Ende 2024 veröffentlicht hat und der seitdem breit übernommen wurde, löst das. Man baut einmal einen MCP-Server, etwa für das Instandhaltungssystem. Er beschreibt seine Werkzeuge auf standardisierte Weise. Jeder Assistent, der MCP spricht, kann sie dann nutzen.
Für einen Betrieb liegt der praktische Nutzen in der Zuständigkeit. Das Instandhaltungsteam kann den MCP-Server für das Instandhaltungssystem verantworten und genau entscheiden, welche Werkzeuge er anbietet. Das Qualitätsteam kann den für das LIMS verantworten. Steht ein Werkzeug nicht auf dem Server, kann kein Agent es nutzen, egal welches Modell darüber sitzt.
Gedächtnis: was der Agent mitnimmt
Sprachmodelle erinnern sich zwischen Gesprächen an nichts. Agenten ergänzen Gedächtnis in zwei Formen:
- Arbeitsgedächtnis ist das Kontextfenster während einer Aufgabe: das Ziel, jeder Werkzeugaufruf und jedes Ergebnis. Deshalb weiß der Agent bei Schritt vier, was er bei Schritt eins gefunden hat.
- Langzeitgedächtnis ist alles, was außerhalb des Modells gespeichert und später wieder gelesen wird: Notizen aus früheren Untersuchungen, eine Liste bekannter wiederkehrender Fehler, die Vorlieben eines Nutzers.
Langzeitgedächtnis ist mächtig und braucht dieselbe Sorgfalt wie jeder andere Datensatz. Wenn ein Agent sich an eine falsche Schlussfolgerung vom letzten Monat “erinnert”, verwendet er sie selbstsicher wieder. Behandle gespeichertes Gedächtnis wie ein Dokument: datiert, mit Quelle und korrigierbar.
Fünf Autonomiestufen
Die Frage, die im Betrieb am meisten zählt, ist nicht “wie klug ist der Agent?”. Sie lautet “was darf er ohne Menschen tun?”. Ich nutze eine einfache Leiter mit fünf Stufen:
- L0: kein Agent. Menschen erledigen die Aufgabe von Hand.
- L1: liest und erklärt. Der Agent kann Daten abfragen und eine Antwort oder Zusammenfassung schreiben. Er ändert nichts.
- L2: entwirft, ein Mensch gibt frei. Der Agent bereitet eine Aktion vor, etwa einen Arbeitsauftrag, einen Umstellplan oder eine E-Mail, und ein Mensch gibt sie frei, bevor etwas passiert.
- L3: handelt in engen Grenzen, ein Mensch hat ein Veto. Der Agent führt risikoarme Aktionen selbst aus, innerhalb fester Grenzen, mit Protokoll und einer Möglichkeit, sie rückgängig zu machen. Ein Beispiel ist die Nachbestellung eines Verbrauchsmaterials innerhalb eines vereinbarten Budgets.
- L4: handelt allein, ein Mensch überwacht. Der Agent führt eine Aufgabe von Anfang bis Ende aus, und Menschen prüfen seine Arbeit hinterher.
In der Produktion eines Getränkebetriebs sollten die meisten Agenten lange auf L1 und L2 leben. Lesen und Entwerfen liefern den Großteil des Nutzens zu einem Bruchteil des Risikos. L3 ist nur für enge, umkehrbare, kostengünstige Aktionen. Und eine Kategorie steht ganz außerhalb der Leiter: Nichts, was ein Agent tut, sollte auf eine SPS, ein SCADA-System oder einen Prozesssollwert schreiben. Die Prozesssteuerung bleibt bei ingenieurmäßig ausgelegten Steuerungssystemen und Menschen. Beitrag 7 behandelt diese Leitplanken im Detail.
Human in the Loop, richtig gemacht
“Human in the Loop” ist leicht gesagt und leicht schlecht gemacht. Ein Freigabeschritt, bei dem ein müder Planer am Schichtende vierzig Entwürfe durchklickt, ist keine Aufsicht. Es ist ein Stempel.
Ein paar Gewohnheiten machen es echt:
- Zu jedem Entwurf die Belege zeigen: welche Werkzeugaufrufe, welche Daten, welcher SOP-Abschnitt.
- Entwürfe wenige und konkret halten. Ein Agent, der einen guten Arbeitsauftrag entwirft, ist nützlicher als einer, der zehn mittelmäßige entwirft.
- Verfolgen, wie oft Menschen die Entwürfe des Agenten ändern oder ablehnen. Eine sinkende Änderungsquote ist gut. Eine Änderungsquote von null heißt meist, dass niemand liest.
Wo es bricht
Agenten können sich im Kreis drehen oder abschweifen. Ein schlecht abgegrenzter Agent ruft Werkzeuge vielleicht immer wieder auf oder verfolgt eine irrelevante Spur. Setze Grenzen für Schritte, Zeit und Kosten, und mache “Ich brauche einen Menschen” zu einer akzeptablen Antwort.
Werkzeugergebnisse können Anweisungen enthalten. Ein Agent liest Text aus Protokollen, Notizen und Dokumenten. Steht darin “ignoriere die vorherigen Anweisungen”, folgt ein nachlässiger Aufbau dem vielleicht. Das nennt man Prompt Injection. Behandle alles, was ein Werkzeug zurückgibt, als Daten, nie als Befehl, und halte schreibende Werkzeuge hinter Freigaben.
Die Kette ist nur so gut wie die Daten. Ein Agent, der ein Stillstandsprotokoll voller Störcodes “Sonstiges” liest, liefert eine selbstsichere Zusammenfassung von “Sonstiges”. Agenten machen gute Daten schneller nutzbar. Schlechte Daten machen sie nicht besser.
Autonomie schleicht sich ein. Sobald ein Agent auf L2 gut funktioniert, entsteht Druck, die Freigabe zu überspringen. Lege die Stufe bewusst fest, nach den Kosten eines Fehlers, und schreib sie auf.
Das Fazit
Ein Agent ist ein Sprachmodell mit Werkzeugen und einer Schleife. Er plant, handelt über ein Werkzeug, beobachtet das Ergebnis und wiederholt das, und so erledigt er das Zusammensuchen und Gegenprüfen, das früher eine halbe Stunde vom Morgen eines Schichtleiters gefressen hat. MCP ist der Standardweg, ihn an Betriebssysteme anzubinden, wobei der Verantwortliche jedes Systems entscheidet, welche Werkzeuge es gibt. Gedächtnis macht ihn über Schritte und Sitzungen hinweg nützlich. Autonomie ist eine Entscheidung, und in einem Getränkebetrieb ist der vernünftige Standard L1 und L2: lesen, erklären und entwerfen, mit einem Menschen, der freigibt, und einer Prozesssteuerung außer Reichweite.
Als Nächstes: Grundlagen der Operational Excellence für Datenleute, denn ein Agent ist nur nützlich, wenn er die richtigen Verluste jagt. Ein durchgerechnetes Beispiel für MCP-Werkzeuge bei einem Rückruf in einer Weinkellerei steht in Chargengenealogie als Graph. Die vollständige Liste steht auf der Serienseite.
Häufig gestellte Fragen
Was ist der Unterschied zwischen einem Chatbot und einem KI-Agenten? Ein Chatbot beantwortet eine Nachricht mit einer Antwort aus dem, was er bereits hat. Ein Agent bekommt ein Ziel und eine Reihe von Werkzeugen und arbeitet dann in einer Schleife: Er plant einen Schritt, ruft ein Werkzeug auf, etwa eine Datenbankabfrage, sieht sich das Ergebnis an und entscheidet über den nächsten Schritt, bis er eine Antwort hat oder einen Menschen braucht. Das Modell ist von derselben Art; erst die Werkzeuge und die Schleife machen es zum Agenten.
Was ist MCP bei agentischer KI? MCP, das Model Context Protocol, ist ein offener Standard, um Sprachmodelle mit Werkzeugen und Datenquellen zu verbinden. Statt für jedes Modell und jedes System eine eigene Integration zu schreiben, baut man einmal einen MCP-Server, etwa für das Instandhaltungssystem, und jeder MCP-fähige Assistent kann dessen Werkzeuge nutzen. Der Server beschreibt, was jedes Werkzeug tut, welche Eingaben es braucht und was es zurückgibt.
Wie viel Autonomie sollte ein KI-Agent in einem Getränkebetrieb haben? Die Autonomie sollte zu den Kosten eines Fehlers passen. Daten lesen und Entwürfe schreiben ist risikoarm, das dürfen Agenten frei tun. Alles, was einen Datensatz ändert, sollte der Agent vorschlagen und ein Mensch freigeben. Alles, was die Prozesssteuerung berührt, etwa einen Sollwert oder eine SPS, sollte vollständig außerhalb der Reichweite eines Agenten bleiben.