Dieser Leitfaden ist für Menschen, die Claude Code im Unternehmen einsetzen und wissen wollen, wofür sie zahlen. Er setzt keine Programmierkenntnisse voraus. Grundlage ist die Anthropic-Schulung Maximizing the value of your Claude Code sessions von Lydia Hallie, 14. August 2026, sowie die Folien dazu. Eine englische Fassung steht daneben.
Die vier Grössen, die die Rechnung bestimmen
| Hebel | Was dahintersteckt |
|---|---|
| Token hinein | Was geladen ist, was hinzukommt, und wie lange die Session läuft |
| Token hinaus | Wie weit das Modell ausholt. Gesteuert über die Effort-Einstellung. |
| Wie viele davon aus dem Cache | Der Anfang der Anfrage bleibt identisch, der Cache bleibt warm |
| Welches Modell | Der Preis pro Token. Er multipliziert die drei anderen. |
Alles Weitere in diesem Leitfaden ist eine dieser vier Grössen.
Warum ein grösseres Modell mehr kostet
Ein grösseres Modell hat mehr Gewichte. Mehr Gewichte bedeuten mehr Rechenarbeit für jedes einzelne Token, in beide Richtungen. Der Preis pro Token steigt entsprechend, für Eingabe und Ausgabe.
Ein kleineres Modell ist ein anderes Werkzeug, und für viele Aufgaben das richtige.
| Modell | Rolle | Geeignet für |
|---|---|---|
| Haiku | Schnelle Assistenz | Kleine, klar umrissene Aufgaben, Subagenten |
| Sonnet | Generalist | Präzise Änderungen, mechanische Arbeit, Code im Zusammenhang |
| Opus | Experte | Feine Fehler, unbekanntes Terrain, schwer zu beschreibende Probleme |
| Fable | Spezialist | Probleme, die noch niemand gesehen hat |
Was geladen ist, bevor Sie etwas tippen
Der Befehl lautet /context. Er zeigt jeden Posten mit seiner Tokenzahl
an, bevor Sie ein Wort geschrieben haben. Alles davon wird in jeder Nachricht der
ganzen Session berechnet.
Der Teil von Claude Code: System-Prompt, eingebaute Werkzeugdefinitionen, Umgebung und Git-Stand.
Ihr Teil: CLAUDE.md, Beschreibungen der Skills, Namen der MCP-Werkzeuge, Beschreibungen der Subagenten.
Prompt Caching
Claude hat zwischen zwei Nachrichten kein Gedächtnis. Jedes Mal, wenn Sie Enter drücken, wird das gesamte Gespräch von vorn mitgeschickt.
Der Cache ist das, was der Server bereits berechnet hat und behält. Wenn der Anfang Ihrer Anfrage identisch zur vorherigen ist, wird dieser Teil zu einem Bruchteil des Preises zurückgelesen. Das ist die grösste verfügbare Ersparnis, und ein Grossteil dieses Leitfadens handelt davon, sie zu schützen.
| Vorgang | Satz | Wann |
|---|---|---|
| Cache-Lesen | 0,1× | Der Eingabepreis, bei jeder Anfrage, solange der Cache warm ist |
| Cache-Schreiben, 5 Minuten | 1,25× | Einmalig, wenn neuer Inhalt hinzukommt |
| Cache-Schreiben, 1 Stunde | 2× | Das längere Fenster kostet mehr im Aufbau |
Der Cache läuft ab
| Wo | Fenster |
|---|---|
| Abonnement, innerhalb der Nutzung | rund 1 Stunde |
| API und Cloud | rund 5 Minuten |
| Subagenten | 5 Minuten |
Jeder Cache-Treffer setzt die Uhr zurück. Der Cache läuft also ab, wenn Sie weggehen, nicht während Sie arbeiten.
Das längere Fenster ist eine Einstellung, in ~/.claude/settings.json oder in den verwalteten Einstellungen eines Teams:
{
"promptCacheTtl": "1h",
"subagentPromptCacheTtl": "1h"
} Ein Schreibvorgang für eine Stunde kostet das Doppelte der Eingabe, gegenüber dem 1,25-Fachen beim Fünf-Minuten-Fenster. Er lohnt sich, wenn Sie weggehen und zurückkommen. Er lohnt sich nicht, wenn Sie durcharbeiten.
Was den Cache bricht, und was nicht
Bricht ihn:
/model. Ein anderes Modell führt seinen eigenen Cache, und davon ist noch nichts von Ihnen darin. Alles wird vom neuen Modell frisch gelesen./effort. Die Effort-Einstellung sitzt bei den meisten Modellen im vorderen Teil der Anfrage. Fable 5.1 ist die Ausnahme. Alles dahinter wird zum vollen Preis frisch gelesen.
Beide Befehle fragen nach, solange der Cache noch warm ist.
Mitten in der Session unbedenklich, weil es hinten angehängt wird und den Anfang unberührt lässt:
- Dateien bearbeiten
- Den Berechtigungsmodus wechseln
- CLAUDE.md bearbeiten, die wird erst in der nächsten Session gelesen
- Einen MCP-Server verbinden
/compact, /rewind, /clear
| Befehl | Was passiert |
|---|---|
/compact | Das ganze Gespräch wird durch eine kurze Zusammenfassung ersetzt, und Sie können sagen, was erhalten bleiben soll. Ab da passt nichts mehr zum alten Cache, es wird also einmal neu berechnet. Die Zusammenfassung ist klein, die Kosten bleiben es auch. |
/rewind | Die letzten Züge fallen weg. Der Cache davor bleibt bestehen. |
/clear | Ein frisches Gespräch. Übrig bleibt nur der beim Start geladene Teil. Vorher /rename ausführen, wenn Sie mit --resume zurückkehren wollen. |
Die Sessionlänge ist der grösste Hebel
Drei Aufgaben in einer langen Session, gegenüber drei Aufgaben mit /clear
dazwischen.
Mit /clear beginnt jede Aufgabe wieder klein. In einer langen Session
trägt Aufgabe 3 immer noch Aufgabe 1 und 2 mit sich. Ungefähr die doppelte
Tokenmenge für dieselbe Arbeit.
Ausgaben von Befehlen bleiben im Gespräch
Was ein Befehl ausgibt, landet im Gespräch und wird bei jeder folgenden Anfrage erneut mitgeschickt.
- 400 Zeilen ausgegeben: diese 400 Zeilen fahren in jeder späteren Anfrage mit.
- Nur die Fehlschläge ausgegeben: ein paar Zeilen.
- Sehr grosse Ausgabe: sie wird in eine Datei geschrieben, und nur eine kurze Vorschau geht ins Gespräch.
Die Lösung ist, die leise Variante zur Vorgabe zu machen und sie in CLAUDE.md zu hinterlegen:
# CLAUDE.md
Eine einzelne Testdatei ausführen: npx vitest run <datei> --reporter=dot Verbundene Apps abschalten
/mcp schaltet ab, was Sie in dieser Session nicht brauchen. Ein
ungenutzter Server ist günstig, und er ist nicht gratis.
Ein einfaches Kommandozeilenwerkzeug lädt vorab gar nichts. Claude ruft es auf, wenn
es gebraucht wird. Genannt werden gh, aws und gcloud.
CLAUDE.md ist für das, was jede Aufgabe braucht
Zwei Fragen für jeden Block in der Datei:
- Ist er aufgabenspezifisch? Dann gehört er in einen Skill. Ein Migrationsrezept in CLAUDE.md fährt bei jeder einzelnen Anfrage mit. Als Skill lädt es nur, wenn das Modell es braucht.
- Wird er überhaupt noch gebraucht? Anweisungen sammeln sich an. Eine Zeile, die vor drei Monaten ein Problem gelöst hat, wird heute noch in jeder Nachricht bezahlt.
Die Datei mit @ erwähnen
fix the failing test in utils.test.ts kostet zwei Anfragen.
Claude muss die Datei erst holen und lesen.
fix the failing test in @utils.test.ts kostet eine. Die
Datei steckt schon in der Anfrage.
Eine Datei einmal pro Gespräch erwähnen. Danach bleibt sie im Gespräch.
Subagenten
Sagen Sie „mach das in einem Subagenten“. Der Subagent bekommt seinen eigenen Kontext, sein eigenes Modell und sein eigenes Effort-Level. Er erledigt die laute Arbeit, alles Gelesene wird am Ende verworfen, und nur sein Bericht kommt in Ihre Session zurück.
Zwei Kosten dabei: er liest möglicherweise Dateien erneut, die Ihre Hauptsession schon hat, und er läuft auf dem Modell der Hauptsession, solange Sie kein anderes festlegen. Für eine wiederkehrende laute Aufgabe geben Sie ihm ein kleineres Modell.
Wenn die Antwort danebenliegt, fragen Sie, welches von beidem es war
| Es wusste nicht genug | Es hat sich nicht genug angestrengt |
|---|---|
Falscher Ansatz, die Zusammenhänge nicht erfasst. Das ist das Modell: /model. | Eine Datei übersprungen, die Tests nicht ausgeführt, auf halbem Weg aufgehört. Das ist das Effort-Level: /effort. |
In der Praxis
- Modell und Effort zu Beginn wählen, oder direkt nach
/clear. - Wechsel mitten in der Aufgabe? Erst
/compact, dann/model. /compact, bevor Sie weggehen, solange der Cache noch warm ist.- Morgen wieder da?
/compactvor dem Weggehen. Ein kaltes--resumeliest alles zum vollen Preis neu.
Für ein Team: verwaltete Einstellungen
Eine Datei unter claude.ai/admin-settings/claude-code. Jede Installation
liest sie beim Start, und Nutzer können sie nicht überschreiben.
| Schlüssel | Was er festlegt |
|---|---|
model | Womit alle starten |
availableModels | Worauf sie wechseln dürfen |
effortLevel · maxEffortLevel | Das Start-Effort und eine Obergrenze |
promptCacheTtl | Das lange Cache-Fenster, für API und Cloud |
allowedMcpServers | Welche Server hinzugefügt werden dürfen |
env | Telemetrie für jede Installation |
Für ein Team: messen
Telemetrie in derselben Datei einschalten, dann drei Zahlen lesen. Jede hat eine Korrektur, die eine Nachricht kostet.
"env": {
"CLAUDE_CODE_ENABLE_TELEMETRY": "1",
"OTEL_METRICS_EXPORTER": "otlp",
"OTEL_EXPORTER_OTLP_ENDPOINT": "https://collector:4317"
} Cache-Lesevorgänge als Anteil an der Eingabe jeder Person. Dieser Anteil sollte mit Abstand der grösste sein. Ein niedriger Anteil heisst, dass der Cache ständig bricht: Wechsel von Modell oder Effort, oder lange Pausen. Die Folien zeigen drei Entwickler bei 92%, 88% und 41%.
Eingabe pro Anfrage über eine Session hinweg. Sie sollte bei jedem
/clear abfallen. Eine Linie, die nur steigt, ist eine endlose Session
oder ein Wiederaufnehmen, nachdem der Cache bereits abgelaufen war.
Kosten nach Modell, pro Person. Das zeigt, wer das grösste Modell für alles eingeschaltet hat.
Drei Dinge zum Mitnehmen
- Zu Beginn entscheiden, dann dabei bleiben. Modell, Effort, MCP-Server.
- Bewusst festlegen, was hineingeht. Bekannte Dateien mit @ erwähnen. Eine schlanke CLAUDE.md. Aufgabenspezifische Schritte in Skills. Laute Arbeit in einen Subagenten.
- Keine Session endlos laufen lassen.
/clearfür eine neue Aufgabe./compact, bevor Sie weggehen.
Das Modell multipliziert alles davon. Für ein Team gehen dieselben Entscheidungen als verwaltete Einstellungen hinein.
Was veraltet, und was bleibt
Die Befehlsnamen und Einstellungsschlüssel in diesem Leitfaden gehören zu einem Produkt, das häufig Änderungen ausliefert. Prüfen Sie sie gegen die aktuelle Dokumentation, bevor Sie danach arbeiten.
Die Rechnung dahinter bleibt. Token hinein sind günstig. Token hinaus kosten ungefähr das Fünffache. Jede Nachricht schickt das ganze Gespräch erneut. Ein identischer Anfang wird zu einem Zehntel des Preises zurückgelesen. So funktioniert die Abrechnung, und das gilt auch dann noch, wenn die Befehle sich verschoben haben.
Quelle: Anthropic, Maximizing the value of your Claude Code sessions, Lydia Hallie, 14. August 2026, und die Folien der Schulung. Zusammengestellt und ins Deutsche gebracht für Führungskräfte, die ohne Entwicklerhintergrund entscheiden müssen, was ein Werkzeug kostet.