---
title: "Was eine Claude-Code-Session wirklich kostet"
description: "Ein Praxisleitfaden für Führungskräfte: die vier Grössen, die die Rechnung bestimmen, wie Prompt Caching funktioniert, und wie ein Team seine Ausgaben deckelt."
url: https://theclosedgap.com/guides/claude-code-kosten/
author: Madina Umbetova
---

[Leitfäden](https://theclosedgap.com/guides) Leitfaden · Deutsch

# Was eine Claude-Code-Session wirklich kostet

Jede Nachricht schickt das ganze Gespräch noch einmal. Wer das verstanden hat, versteht jede Kostenentscheidung im Werkzeug.

13 September 2026 14 Min. Lesezeit

Dieser Leitfaden ist für Menschen, die Claude Code im Unternehmen einsetzen und wissen wollen, wofür sie zahlen. Er setzt keine Programmierkenntnisse voraus. Grundlage ist die Anthropic-Schulung _Maximizing the value of your Claude Code sessions_ von Lydia Hallie, 14. August 2026, sowie die Folien dazu. Eine [englische Fassung](https://theclosedgap.com/guides/claude-code) steht daneben.

## Die vier Grössen, die die Rechnung bestimmen

Hebel

Was dahintersteckt

**Token hinein**

Was geladen ist, was hinzukommt, und wie lange die Session läuft

**Token hinaus**

Wie weit das Modell ausholt. Gesteuert über die Effort-Einstellung.

**Wie viele davon aus dem Cache**

Der Anfang der Anfrage bleibt identisch, der Cache bleibt warm

**Welches Modell**

Der Preis pro Token. Er multipliziert die drei anderen.

Alles Weitere in diesem Leitfaden ist eine dieser vier Grössen.

## Warum ein grösseres Modell mehr kostet

Ein grösseres Modell hat mehr Gewichte. Mehr Gewichte bedeuten mehr Rechenarbeit für jedes einzelne Token, in beide Richtungen. Der Preis pro Token steigt entsprechend, für Eingabe und Ausgabe.

Ein kleineres Modell ist ein anderes Werkzeug, und für viele Aufgaben das richtige.

Modell

Rolle

Geeignet für

**Haiku**

Schnelle Assistenz

Kleine, klar umrissene Aufgaben, Subagenten

**Sonnet**

Generalist

Präzise Änderungen, mechanische Arbeit, Code im Zusammenhang

**Opus**

Experte

Feine Fehler, unbekanntes Terrain, schwer zu beschreibende Probleme

**Fable**

Spezialist

Probleme, die noch niemand gesehen hat

## Was geladen ist, bevor Sie etwas tippen

Der Befehl lautet `/context`. Er zeigt jeden Posten mit seiner Tokenzahl an, bevor Sie ein Wort geschrieben haben. Alles davon wird in jeder Nachricht der ganzen Session berechnet.

**Der Teil von Claude Code:** System-Prompt, eingebaute Werkzeugdefinitionen, Umgebung und Git-Stand.

**Ihr Teil:** CLAUDE.md, Beschreibungen der Skills, Namen der MCP-Werkzeuge, Beschreibungen der Subagenten.

## Prompt Caching

Claude hat zwischen zwei Nachrichten kein Gedächtnis. Jedes Mal, wenn Sie Enter drücken, wird das gesamte Gespräch von vorn mitgeschickt.

Der Cache ist das, was der Server bereits berechnet hat und behält. Wenn der Anfang Ihrer Anfrage identisch zur vorherigen ist, wird dieser Teil zu einem Bruchteil des Preises zurückgelesen. Das ist die grösste verfügbare Ersparnis, und ein Grossteil dieses Leitfadens handelt davon, sie zu schützen.

Vorgang

Satz

Wann

Cache-Lesen

**0,1×**

Der Eingabepreis, bei jeder Anfrage, solange der Cache warm ist

Cache-Schreiben, 5 Minuten

**1,25×**

Einmalig, wenn neuer Inhalt hinzukommt

Cache-Schreiben, 1 Stunde

**2×**

Das längere Fenster kostet mehr im Aufbau

## Der Cache läuft ab

Wo

Fenster

Abonnement, innerhalb der Nutzung

rund 1 Stunde

API und Cloud

rund 5 Minuten

Subagenten

5 Minuten

Jeder Cache-Treffer setzt die Uhr zurück. Der Cache läuft also ab, wenn Sie weggehen, nicht während Sie arbeiten.

Das längere Fenster ist eine Einstellung, in `~/.claude/settings.json` oder in den verwalteten Einstellungen eines Teams:

```
{
  "promptCacheTtl": "1h",
  "subagentPromptCacheTtl": "1h"
}
```

Ein Schreibvorgang für eine Stunde kostet das Doppelte der Eingabe, gegenüber dem 1,25-Fachen beim Fünf-Minuten-Fenster. Er lohnt sich, wenn Sie weggehen und zurückkommen. Er lohnt sich nicht, wenn Sie durcharbeiten.

## Was den Cache bricht, und was nicht

**Bricht ihn:**

-   `/model`. Ein anderes Modell führt seinen eigenen Cache, und davon ist noch nichts von Ihnen darin. Alles wird vom neuen Modell frisch gelesen.
-   `/effort`. Die Effort-Einstellung sitzt bei den meisten Modellen im vorderen Teil der Anfrage. Fable 5.1 ist die Ausnahme. Alles dahinter wird zum vollen Preis frisch gelesen.

Beide Befehle fragen nach, solange der Cache noch warm ist.

**Mitten in der Session unbedenklich**, weil es hinten angehängt wird und den Anfang unberührt lässt:

-   Dateien bearbeiten
-   Den Berechtigungsmodus wechseln
-   CLAUDE.md bearbeiten, die wird erst in der nächsten Session gelesen
-   Einen MCP-Server verbinden

## /compact, /rewind, /clear

Befehl

Was passiert

`/compact`

Das ganze Gespräch wird durch eine kurze Zusammenfassung ersetzt, und Sie können sagen, was erhalten bleiben soll. Ab da passt nichts mehr zum alten Cache, es wird also einmal neu berechnet. Die Zusammenfassung ist klein, die Kosten bleiben es auch.

`/rewind`

Die letzten Züge fallen weg. Der Cache davor bleibt bestehen.

`/clear`

Ein frisches Gespräch. Übrig bleibt nur der beim Start geladene Teil. Vorher `/rename` ausführen, wenn Sie mit `--resume` zurückkehren wollen.

## Die Sessionlänge ist der grösste Hebel

Drei Aufgaben in einer langen Session, gegenüber drei Aufgaben mit `/clear` dazwischen.

Mit `/clear` beginnt jede Aufgabe wieder klein. In einer langen Session trägt Aufgabe 3 immer noch Aufgabe 1 und 2 mit sich. **Ungefähr die doppelte Tokenmenge für dieselbe Arbeit.**

## Ausgaben von Befehlen bleiben im Gespräch

Was ein Befehl ausgibt, landet im Gespräch und wird bei jeder folgenden Anfrage erneut mitgeschickt.

-   **400 Zeilen ausgegeben:** diese 400 Zeilen fahren in jeder späteren Anfrage mit.
-   **Nur die Fehlschläge ausgegeben:** ein paar Zeilen.
-   **Sehr grosse Ausgabe:** sie wird in eine Datei geschrieben, und nur eine kurze Vorschau geht ins Gespräch.

Die Lösung ist, die leise Variante zur Vorgabe zu machen und sie in CLAUDE.md zu hinterlegen:

```
# CLAUDE.md
Eine einzelne Testdatei ausführen: npx vitest run <datei> --reporter=dot
```

## Verbundene Apps abschalten

`/mcp` schaltet ab, was Sie in dieser Session nicht brauchen. Ein ungenutzter Server ist günstig, und er ist nicht gratis.

Ein einfaches Kommandozeilenwerkzeug lädt vorab gar nichts. Claude ruft es auf, wenn es gebraucht wird. Genannt werden `gh`, `aws` und `gcloud`.

## CLAUDE.md ist für das, was jede Aufgabe braucht

Zwei Fragen für jeden Block in der Datei:

1.  **Ist er aufgabenspezifisch?** Dann gehört er in einen Skill. Ein Migrationsrezept in CLAUDE.md fährt bei jeder einzelnen Anfrage mit. Als Skill lädt es nur, wenn das Modell es braucht.
2.  **Wird er überhaupt noch gebraucht?** Anweisungen sammeln sich an. Eine Zeile, die vor drei Monaten ein Problem gelöst hat, wird heute noch in jeder Nachricht bezahlt.

## Die Datei mit @ erwähnen

`fix the failing test in utils.test.ts` kostet **zwei Anfragen**. Claude muss die Datei erst holen und lesen.

`fix the failing test in @utils.test.ts` kostet **eine**. Die Datei steckt schon in der Anfrage.

Eine Datei einmal pro Gespräch erwähnen. Danach bleibt sie im Gespräch.

## Subagenten

Sagen Sie „mach das in einem Subagenten“. Der Subagent bekommt seinen eigenen Kontext, sein eigenes Modell und sein eigenes Effort-Level. Er erledigt die laute Arbeit, alles Gelesene wird am Ende verworfen, und nur sein Bericht kommt in Ihre Session zurück.

Zwei Kosten dabei: er liest möglicherweise Dateien erneut, die Ihre Hauptsession schon hat, und er läuft auf dem Modell der Hauptsession, solange Sie kein anderes festlegen. Für eine wiederkehrende laute Aufgabe geben Sie ihm ein kleineres Modell.

## Wenn die Antwort danebenliegt, fragen Sie, welches von beidem es war

Es wusste nicht genug

Es hat sich nicht genug angestrengt

Falscher Ansatz, die Zusammenhänge nicht erfasst. Das ist das **Modell**: `/model`.

Eine Datei übersprungen, die Tests nicht ausgeführt, auf halbem Weg aufgehört. Das ist das **Effort-Level**: `/effort`.

## In der Praxis

1.  Modell und Effort zu Beginn wählen, oder direkt nach `/clear`.
2.  Wechsel mitten in der Aufgabe? Erst `/compact`, dann `/model`.
3.  `/compact`, bevor Sie weggehen, solange der Cache noch warm ist.
4.  Morgen wieder da? `/compact` vor dem Weggehen. Ein kaltes `--resume` liest alles zum vollen Preis neu.

## Für ein Team: verwaltete Einstellungen

Eine Datei unter `claude.ai/admin-settings/claude-code`. Jede Installation liest sie beim Start, und Nutzer können sie nicht überschreiben.

Schlüssel

Was er festlegt

`model`

Womit alle starten

`availableModels`

Worauf sie wechseln dürfen

`effortLevel` · `maxEffortLevel`

Das Start-Effort und eine Obergrenze

`promptCacheTtl`

Das lange Cache-Fenster, für API und Cloud

`allowedMcpServers`

Welche Server hinzugefügt werden dürfen

`env`

Telemetrie für jede Installation

## Für ein Team: messen

Telemetrie in derselben Datei einschalten, dann drei Zahlen lesen. Jede hat eine Korrektur, die eine Nachricht kostet.

```
"env": {
  "CLAUDE_CODE_ENABLE_TELEMETRY": "1",
  "OTEL_METRICS_EXPORTER": "otlp",
  "OTEL_EXPORTER_OTLP_ENDPOINT": "https://collector:4317"
}
```

**Cache-Lesevorgänge als Anteil an der Eingabe jeder Person.** Dieser Anteil sollte mit Abstand der grösste sein. Ein niedriger Anteil heisst, dass der Cache ständig bricht: Wechsel von Modell oder Effort, oder lange Pausen. Die Folien zeigen drei Entwickler bei 92%, 88% und 41%.

**Eingabe pro Anfrage über eine Session hinweg.** Sie sollte bei jedem `/clear` abfallen. Eine Linie, die nur steigt, ist eine endlose Session oder ein Wiederaufnehmen, nachdem der Cache bereits abgelaufen war.

**Kosten nach Modell, pro Person.** Das zeigt, wer das grösste Modell für alles eingeschaltet hat.

## Drei Dinge zum Mitnehmen

1.  **Zu Beginn entscheiden, dann dabei bleiben.** Modell, Effort, MCP-Server.
2.  **Bewusst festlegen, was hineingeht.** Bekannte Dateien mit @ erwähnen. Eine schlanke CLAUDE.md. Aufgabenspezifische Schritte in Skills. Laute Arbeit in einen Subagenten.
3.  **Keine Session endlos laufen lassen.** `/clear` für eine neue Aufgabe. `/compact`, bevor Sie weggehen.

Das Modell multipliziert alles davon. Für ein Team gehen dieselben Entscheidungen als verwaltete Einstellungen hinein.

## Was veraltet, und was bleibt

Die Befehlsnamen und Einstellungsschlüssel in diesem Leitfaden gehören zu einem Produkt, das häufig Änderungen ausliefert. Prüfen Sie sie gegen die aktuelle Dokumentation, bevor Sie danach arbeiten.

Die Rechnung dahinter bleibt. Token hinein sind günstig. Token hinaus kosten ungefähr das Fünffache. Jede Nachricht schickt das ganze Gespräch erneut. Ein identischer Anfang wird zu einem Zehntel des Preises zurückgelesen. So funktioniert die Abrechnung, und das gilt auch dann noch, wenn die Befehle sich verschoben haben.

* * *

Quelle: Anthropic, _Maximizing the value of your Claude Code sessions_, Lydia Hallie, 14. August 2026, und die Folien der Schulung. Zusammengestellt und ins Deutsche gebracht für Führungskräfte, die ohne Entwicklerhintergrund entscheiden müssen, was ein Werkzeug kostet.

## Eine Methode pro Woche.

Geschrieben von einer Operatorin, die ein globales Portfolio von 0,8 Mrd. USD führt, für Menschen, die selbst operieren. Der Newsletter erscheint auf Englisch.

The Closed Gap auf Substack. Kein Spam, Abbestellen mit einem Klick.
