LangChain
https://youtu.be/P3kmo04DiEw?si=xvSCViTT0LjKJFp2
LangSmith ist die Plattform von LangChain, um LLM-Anwendungen und KI-Agenten zu beobachten, zu testen und zu betreiben. Die Seite selbst ist nur die Login-App. Ihr Untertitel lautet sinngemäß: Agenten vom Prototyp in die Produktion bringen, also bauen, debuggen, evaluieren und ausliefern. Den Rest der Übersicht habe ich aus meinem Hintergrundwissen zusammengestellt.
Wofür man es braucht: LLM-Apps sind nicht deterministisch. Dieselbe Eingabe kann unterschiedliche Ergebnisse liefern, und Fehler stecken oft mitten in einer langen Kette aus Prompts, Tool-Aufrufen und Modellantworten. LangSmith macht diese Kette sichtbar und messbar.
Die Kernbausteine:
- Tracing / Observability: Jeder Lauf wird Schritt für Schritt aufgezeichnet, mit Prompts, Antworten, Tool-Calls, Latenz, Token-Verbrauch und Kosten. So findet man schnell, wo ein Agent danebengegriffen hat.
- Evaluation: Man baut Testdatensätze und lässt die App automatisiert prüfen, per Code, per LLM-as-Judge oder durch menschliche Bewertung. So erkennt man Verschlechterungen nach einer Prompt- oder Modelländerung.
- Prompt-Management: Prompts lassen sich versionieren, im Playground ausprobieren und im Team teilen.
- Monitoring im Betrieb: Dashboards und Alerts für Fehlerraten, Kosten und Qualität, dazu Feedback von echten Nutzern.
- Deployment: Es gibt Werkzeuge, um Agenten (vor allem solche auf LangGraph) als Dienst zu betreiben.
Wichtig zu wissen:
- Es funktioniert auch ohne LangChain. Es gibt SDKs für Python und TypeScript, und OpenAI, Anthropic und eigener Code lassen sich anbinden.
- Es gibt einen kostenlosen Einstieg und kostenpflichtige Team- und Enterprise-Pläne. Dazu kommen Self-Hosting und Cloud-Varianten für Datenschutzanforderungen. Aktuelle Preise und Limits solltest du auf der Preisseite prüfen.
- Vergleichbare Alternativen sind Langfuse (Open Source), Arize Phoenix und Weights & Biases Weave.