Erklärt
Woran ich mich gerade entlangarbeite, vom Steuern eines einzelnen Modells bis zum Betrieb ganzer Systeme. Geschrieben, um verstanden zu werden, nicht um schwierig zu klingen.
Tools & Schnittstellen — Wie Modelle die Außenwelt anfassen: Werkzeuge, strukturierte Aufrufe, offene Standards
Modelle wissen viel und können wenig, bis man ihnen Werkzeuge gibt
Suchen, rechnen, Code ausführen, APIs aufrufen. Das Modell entscheidet selbst, wann es zum Werkzeug greift, und rechnet das Ergebnis in seine Antwort ein. Genau diese eine Fähigkeit macht aus einem Textgenerator etwas, das handeln kann.
Function Calling
Sattelfest
Das Modell füllt nur das Formular aus; ausgeführt wird bei dir
Der Mechanismus hinter Tool Use: Du beschreibst deine Funktionen als JSON-Schema; das Modell antwortet nicht mit Freitext, sondern mit einem strukturierten Aufruf wie get_weather({"city": "Stuttgart"}). Beim Modell läuft nichts. Es reicht dir eine ausgefüllte Anfrage, und dein Code entscheidet, was damit passiert.
Betrieb — Der Unterschied zwischen Demo und Produkt: testen, absichern, beobachten, bezahlbar halten
Wenn eine Antwort schiefgeht, willst du sehen, warum, nicht nur, dass
Jeder Request wird als Trace aufgezeichnet: Prompts, Tool-Aufrufe, Zwischenschritte, Latenz, Token, Kosten. Das ist der Teil der Arbeit, den ich für Infrastruktur ohnehin mache. Neu ist der Gegenstand unter dem Mikroskop, nicht die Disziplin.
Eine API vor allen Anbietern
Die zentrale Schaltstelle zwischen deinen Anwendungen und allen Modellanbietern: Routing und Fallbacks, Caching, Rate Limits, Schlüsselverwaltung, ein einziger Blick auf die Kosten (LiteLLM, Portkey). Fällt ein Anbieter aus, fließt der Verkehr einfach woanders weiter.
Cost Optimization
Lerne gerade
Jeder Token steht auf der Rechnung
Also spart man mit System: Antworten cachen, leichte Aufgaben in einer Kaskade an kleine Modelle routen, Prompts entschlacken, Anfragen bündeln. Ziel ist kein billigeres Produkt, sondern gleiche Qualität für einen Bruchteil der Rechnung, und zu wissen, welcher Hebel Qualität kostet.
Als Nächstes: RAG 2.0, Guardrails, Evaluation, Multi-Agent
Log 記録
Was ich aufgesetzt habe, was es gekostet hat und was kaputtgegangen ist. Datiert, mit dem gemessenen Wert daneben.
Noch keine Einträge. Das Log beginnt, sobald etwas läuft, das sich messen lässt — ab Januar, wenn die Inferenz für Kotoba auf einen Mac Mini in Tokio zieht. Ein leeres Log, das das sagt, ist mehr wert als eines, das aus dem Gedächtnis geschrieben wurde.