Kurze Antwort: Das Nützlichste, was du für einen Brau-Assistenten tun kannst, ist, ihm das Rechnen abzunehmen. Gib dem Agenten eine kleine Zahl von Werkzeugen (Umrechnung der Dichte, Vergärungsgrad, Alkohol, Bittere), jedes davon gewöhnlicher, getesteter Code, der in Basiseinheiten arbeitet und seine Methode zusammen mit dem Ergebnis zurückgibt. Der Agent wählt das Werkzeug und erklärt die Antwort. Die beiden durchgerechneten Beispiele unten zeigen, warum die Methode mit der Zahl reisen muss: Ein Bier ist auf der wirklichen Skala zu 64,9% vergoren und auf der scheinbaren zu 78,6%, und drei anerkannte IBU-Modelle liefern für dieselbe Hopfengabe 34, 45 und 46.
Ein Brauer fragt den Assistenten: “Welchen Vergärungsgrad hat Sud 212 erreicht?” Die ehrliche Antwort ist eine Gegenfrage: welchen Vergärungsgrad? Ein Laborbericht gibt meist den wirklichen Vergärungsgrad an. Ein Hobbybrauer oder ein Verkaufsblatt meint meist den scheinbaren. Beim Bier in der Abbildung sind das 64,9% und 78,6%. Gleicher Tank, gleicher Tag, gleiche Probe.
Ein Sprachmodell, das sich selbst überlassen ist, wählt stillschweigend einen der beiden Werte und rechnet unterwegs vielleicht noch im Kopf um. Der erste Beitrag dieser Serie hat argumentiert, dass Retrieval das Wissen liefern sollte und Code die Zahlen. Dieser Beitrag baut den Code.
Was ein Werkzeug ist
In aktuellen Agenten-Frameworks (den APIs von Claude und OpenAI, dem Model Context Protocol, den meisten Orchestrierungsbibliotheken) ist ein Werkzeug eine Funktion, deren Ausführung das Modell anfordern kann. Du beschreibst sie mit einem Namen, einem Zweck und einem Schema für die Eingaben. Das Modell entscheidet, wann es sie aufruft und mit welchen Argumenten. Dein Code führt sie aus und gibt das Ergebnis zurück.
Ein Werkzeugkasten fürs Brauen muss nicht groß sein. Fünf Werkzeuge decken die meisten Fragen ab:
gravity_convert: spezifisches Gewicht in Grad Plato und zurück, auf einer angegebenen Temperaturbasis.attenuation: wirklicher und scheinbarer Vergärungsgrad aus Stammwürze, wirklichem und scheinbarem Extrakt.alcohol: Alkohol in Gewichts- und Volumenprozent aus Stammwürze und wirklichem Vergärungsgrad.bitterness: IBU für eine Hopfengabe, mit dem Modell als benanntem Argument.unit_convert: Liter, Hektoliter, Barrel, Kilogramm, Pfund, ohne Raten.
So sieht eines davon für das Modell aus:
{
"name": "bitterness",
"description": "Estimate IBU in wort for one hop addition. Returns the value and the model used.",
"input_schema": {
"type": "object",
"properties": {
"hop_mass_g": {"type": "number"},
"alpha_acid_pct": {"type": "number"},
"volume_l": {"type": "number"},
"boil_min": {"type": "number"},
"wort_plato": {"type": "number"},
"model": {"type": "string", "enum": ["tinseth", "rager", "kinetic"]}
},
"required": ["hop_mass_g", "alpha_acid_pct", "volume_l", "boil_min", "wort_plato", "model"]
}
}
Das Feld model ist absichtlich ein Pflichtfeld. Der Assistent kann also nicht nach “den IBU” fragen. Er muss nach den IBU nach Tinseth oder nach Rager fragen. Diese eine Designentscheidung bringt mehr für die Genauigkeit als jeder Prompt.
Beispiel 1: die Falle der Vergärungsgrad-Skala
Nimm ein Lagerbier mit 13,0 Grad Plato Stammwürze, vergoren auf einen wirklichen Vergärungsgrad von 64,9%.
Das Alkohol-Werkzeug verwendet die Konvention nach Balling (jedes Gramm Alkohol verbraucht etwa 2,0665 Gramm Extrakt) und kommt auf einen wirklichen Extrakt von 4,77% und einen Alkoholgehalt von 4,27 Gewichtsprozent. Um von Gewicht auf Volumen zu kommen, braucht es die Dichte des fertigen Biers, die vom verbliebenen Extrakt und vom Alkohol gemeinsam abhängt. Deshalb verwendet es ein angepasstes Modell der Bierdichte statt einer Faustformel. Das ergibt ein spezifisches Gewicht von etwa 1,0109 und einen Alkoholgehalt von 5,46% ABV.
Das Vergärungsgrad-Werkzeug berechnet dann, was ein Aräometer in diesem Bier anzeigen würde. Alkohol ist leichter als Wasser, also zeigt das Aräometer einen scheinbaren Extrakt von etwa 2,78 Grad Plato, deutlich unter den wirklichen 4,77. Der scheinbare Vergärungsgrad vergleicht die Stammwürze mit diesem Messwert: 78,6%. Der wirkliche Vergärungsgrad vergleicht sie mit dem tatsächlich verbliebenen Extrakt: 64,9%.
Beide Zahlen stimmen. Sie messen verschiedene Dinge. Ein Brauer, der dieses Bier mit dem Datenblatt eines Hefelieferanten vergleicht, das den scheinbaren Vergärungsgrad angibt, und mit dem Laborbericht, der den wirklichen angibt, sieht eine Lücke von 13,7 Punkten und fragt sich, was schiefgelaufen ist. Nichts ist schiefgelaufen. Jemand hat die Beschriftung weggelassen.
Ein gutes Werkzeug gibt beide zurück, jeweils benannt:
attenuation(og_plato=13.0, rdf_pct=64.9)
-> real_df_pct: 64.9, apparent_df_pct: 78.6,
real_extract_plato: 4.77, apparent_extract_plato: 2.78,
method: "Balling 2.0665; beer SG from extract-alcohol density model; 20/20 C"
Beispiel 2: drei ehrliche IBU-Zahlen
Jetzt eine Hopfengabe: 30 Gramm eines Hopfens mit 10% Alphasäure, 60 Minuten gekocht in 20 Litern derselben Würze mit 13,0 Grad Plato (spezifisches Gewicht etwa 1,0525).
- Tinseth ergibt etwa 22,5% Ausnutzung und 33,8 IBU.
- Rager ergibt etwa 30,4% Ausnutzung und 45,7 IBU.
- Ein kinetisches Modell erster Ordnung für Isomerisierung und Abbau der Alphasäure (die Geschwindigkeitskonstanten von Malowicki und Shellhammer am Siedepunkt, mit einer Korrektur für die Dichte) ergibt etwa 30,1% isomerisierte Alphasäure in der Würze und 45,2 IBU.
Drei veröffentlichte, weit verbreitete Methoden. Eine Spanne von etwa 12 IBU, rund ein Drittel, bei einer einzigen Gabe. Wechsle zu einer 15-Minuten-Gabe, und die Reihenfolge dreht sich um: Tinseth ergibt 11,2% Ausnutzung und Rager 8,1%.
Keine davon ist die Wahrheit. Es sind empirische Modelle, angepasst an unterschiedliche Daten, und jedes davon ist eine Schätzung in der Würze, bevor Keller- und Abfüllverluste ihren Anteil nehmen. Die Wahrheit ist das, was ein Labor im fertigen Bier misst. Für einen Assistenten zählt, dass er niemals “etwa 40 IBU” meldet, als wäre damit etwas geklärt. Er meldet “45,7 IBU nach Rager, Würzeschätzung”, und ein Brauer, der gegen Tinseth kalibriert, weiß sofort, dass er den Wert abschlagen muss.
Wenn du diese Modelle nebeneinander in einer Tabelle sehen willst, geht der IBU-Rezeptrechner in Excel Tinseth für mehrere Gaben durch, und Hopfenbittere mit Machine Learning vorhersagen behandelt die Kalibrierung gegen Messwerte.
Die Regeln, die den Agenten vertrauenswürdig machen
- Keine Arithmetik im Fließtext. Der System-Prompt legt fest, dass jede Zahl, die aus anderen Zahlen abgeleitet ist, aus einem Werkzeugaufruf stammen muss. Teste das mit Fragen, die das Modell zur Abkürzung verleiten, und lass jede Antwort durchfallen, die eine berechnete Zahl ohne dahinterliegenden Werkzeugaufruf enthält.
- Basiseinheiten innen, Anzeigeeinheiten außen. Werkzeuge arbeiten in Kilogramm, Litern und Grad Plato auf einer angegebenen Temperaturbasis. Die Umrechnung in Pfund, Barrel oder spezifisches Gewicht passiert einmal, am Rand.
- Die Methode ist Teil der Ausgabe. Jedes Werkzeug gibt die verwendete Methode, die Konstanten und die Temperaturbasis zurück, und der Agent wiederholt sie in der Antwort.
- Werkzeuge werden getestet wie jeder andere Code. Jedes Werkzeug hat Unit-Tests gegen veröffentlichte Rechenbeispiele. Das Vergärungsbeispiel oben ist eines davon: Wenn das Werkzeug für diese Eingabe nicht mehr 4,77 wirklichen Extrakt und 4,27 Alkohol zurückgibt, schlägt der Build fehl.
- Fragen statt annehmen. Sagt der Brauer “Vergärungsgrad” oder “Dichte” ohne Skala, fragt der Agent nach, welche gemeint ist, oder antwortet mit beiden.
Wo das an Grenzen stößt
Werkzeuge kodieren Entscheidungen. Die Wahl der Konstante nach Balling, eines Dichtemodells oder eines Ausnutzungsmodells ist eine fachliche Entscheidung. Das Werkzeug macht sie konsistent, nicht richtig. Dokumentiere die Entscheidungen und lass einen Brauer, der es besser weiß, sie ändern.
Schlechte Eingaben liefern weiterhin schlechte Ergebnisse. Ein Werkzeug, das eine bei falscher Temperatur abgelesene Stammwürze bekommt, gibt eine präzise falsche Antwort zurück. Der Agent sollte nachfragen, woher die Zahlen stammen, wenn sie außerhalb des üblichen Bereichs liegen.
Der Agent kann das falsche Werkzeug aufrufen. Ein Modell kann alcohol wählen, wo es attenuation gebraucht hätte, oder Plato übergeben, wo das spezifische Gewicht erwartet wurde. Strikte Schemas mit Einheiten in den Feldnamen und ein Testsatz echter Fragen fangen das meiste davon ab.
Werkzeuge ersetzen nicht das Labor. Jede Zahl hier ist eine Berechnung aus anderen Messwerten. Gerade die Bittere sollte gemessen werden, und der berechnete Wert gilt als Planungsschätzung.
Das Fazit
Ein Assistent, der im Kopf rechnet, wird einem Brauer irgendwann eine falsche Zahl mit selbstsicherer Stimme geben. Ein Assistent, der Werkzeuge aufruft, gibt jedes Mal dieselbe Zahl, mit angehängter Methode. Die Beispiele hier sind keine Randfälle: Wirklicher und scheinbarer Vergärungsgrad liegen bei einem gewöhnlichen Lagerbier 13,7 Punkte auseinander, und drei Standard-IBU-Modelle streuen bei einer einzigen Hopfengabe um ein Drittel. Lass das Modell das Werkzeug wählen und das Ergebnis erklären. Lass getesteten Code die Mathematik machen.
Als Nächstes in der Serie: Malz-Aromaräder als Vektoren. Die vollständige Liste steht auf der Serienseite von The Brewer’s Agent.
Häufig gestellte Fragen
Warum sollte ein KI-Brau-Assistent für Berechnungen Werkzeuge nutzen? Weil Sprachmodelle bei mehrstufiger Arithmetik unzuverlässig sind und Brauformeln Einheiten- und Temperaturkonventionen mitbringen, die leicht verwechselt werden. Ein Werkzeug ist gewöhnlicher, getesteter Code: Es nimmt Eingaben in festgelegten Einheiten entgegen, wendet eine dokumentierte Methode an und gibt das Ergebnis mit dem Namen dieser Methode zurück. Das Modell entscheidet, welches Werkzeug es aufruft, und erklärt die Antwort.
Was ist der Unterschied zwischen wirklichem und scheinbarem Vergärungsgrad? Der scheinbare Vergärungsgrad vergleicht die Stammwürze mit dem scheinbaren Extrakt, den ein Aräometer im fertigen Bier anzeigt und den der Alkohol nach unten zieht, weil er leichter als Wasser ist. Der wirkliche Vergärungsgrad verwendet den tatsächlich verbliebenen Extrakt. Beim selben Bier ist der scheinbare Wert immer höher, hier 78,6% gegenüber 64,9%, deshalb ist eine Zahl ohne ihre Skala mehrdeutig.
Welche IBU-Formel ist richtig, Tinseth oder Rager? Keine ist allgemein richtig. Beide sind empirische Anpassungen an unterschiedliche Daten, und für eine 60-Minuten-Gabe in einer Würze mit 13 Grad Plato liegen sie um etwa ein Drittel auseinander. Wähle eine für deine Brauerei, kalibriere sie gegen im Labor gemessene Bittere und lass das Werkzeug angeben, welches Modell es verwendet hat.