Warum Prompt Caching kein Geld spart: AI-Coding-Agents mit prompt-cache-skills prüfen

"Das Repository prompt-cache-skills ordnet Cache-Fixes nach Agent-Harness und verlangt nach jedem Diff eine Prüfung anhand realer Cache-Nutzungsfelder."
Deine monatliche API-Rechnung für Claude Code oder Cline könnte 30 bis 50 Prozent höher sein als nötig. Vielleicht ist nicht die Nutzung zu hoch, sondern Prompt Caching funktioniert nicht.
Viele AI-Coding-Agents aktivieren Prompt Caching standardmäßig. Trotzdem kann eine kleine Konfigurationsänderung das gesamte Cache-Präfix ungültig machen: ein Zeitstempel im System-Prompt, ein falsch berechneter Cache Key, ein nicht aktivierter Schalter oder eine zu kurze TTL. Diese Probleme erzeugen nicht zwingend einen Fehler. Auch die Rechnung nennt die Ursache nicht; die API-Kosten bleiben einfach hoch.
prompt-cache-skills ist eine Drop-in-Skill-Bibliothek für solche stillen Cache-Fehler. Bei geeigneten Workloads kann sie die Trefferrate von beinahe null auf 80 Prozent oder mehr erhöhen. Die folgenden Abschnitte erklären Abrechnung, vier Hauptursachen, typische Fixes und die praktische Verifikation.
Wie Prompt Caching Kosten senkt
Das Prinzip ist einfach: Ein stabiles Präfix wird zwischengespeichert und bei erneuter Nutzung deutlich günstiger verarbeitet als normale Eingabe-Token.
Die Anbieter verwenden unterschiedliche Feldnamen, das Prinzip bleibt gleich:
| Abrechnungstyp | Abrechnungsverhalten | Geeigneter Einsatz | Beispielanbieter |
|---|---|---|---|
| cache_creation_input_tokens | Erstellt den Cache beim ersten Aufruf und kostet oft mehr als normale Eingabe-Token | Erster Aufruf mit langem Präfix | Anthropic |
| cache_read_input_tokens | Cache-Treffer kosten deutlich weniger, ungefähr 10 Prozent der normalen Eingabe | Wiederholte Nutzung eines stabilen Präfixes | Anthropic |
| Normale Eingabe-Token | Abrechnung zum regulären Preis | Kurze Anfragen oder häufig wechselnde Präfixe | Alle Anbieter |
| cached_tokens (OpenAI) | Gecachte Eingabe kostet ungefähr 50 Prozent weniger | Wiederholte Nutzung eines stabilen Präfixes | OpenAI |
| cached content (Gemini) | Abrechnung nach Speicherdauer des Caches | Workloads mit langem Kontext | Google Gemini |
Angenommen, ein Anthropic-System-Prompt hat 2.000 Token und derselbe Agent nutzt ihn täglich 100-mal. Bei einem Treffer werden diese 2.000 Token als cache_read mit ungefähr 10 Prozent des normalen Eingabepreises berechnet. Dieser Anteil der Eingabekosten kann um etwa 90 Prozent sinken.
Das funktioniert nur, wenn das Präfix stabil bleibt und wiederverwendet wird. Enthält der System-Prompt bei jedem Aufruf einen neuen Zeitstempel oder eine zufällige ID, muss der Cache immer neu erstellt werden. Wiederholtes cache_creation kann teurer sein als normale Eingabe.
Warum der Agent-Cache ständig verfehlt
Diese Fehler lösen nicht zwingend eine Fehlermeldung aus. Du siehst die Rechnung, aber nicht die Ursache:
-
Volatile Nachrichten zerstören das Präfix. Ein Zeitstempel, eine zufällige ID oder ein anderer Wert, der sich pro Anfrage ändert, macht das ganze Cache-Präfix ungültig. Das ist die häufigste Ursache.
-
Der Cache Key fehlt oder ist falsch. Manche Agent-Tools setzen die Cache-Markierung nicht korrekt oder berechnen einen eigenen Cache Key falsch. Das Präfix bleibt stabil, doch die API erkennt es nicht als wiederverwendbaren Inhalt.
-
Caching ist standardmäßig aus. Einige Agent-Tools verlangen eine explizite Aktivierung in der Konfiguration. Obwohl du automatische Unterstützung erwartest, wird jede Anfrage als normale Eingabe berechnet.
-
Die TTL ist zu kurz. Läuft ein Cache etwa nach einer Stunde ab, während zwischen deinen Anfragen mehr Zeit liegt, ist er beim nächsten Aufruf bereits verschwunden.
Das genaue Symptom hängt vom Agent ab. Die README von prompt-cache-skills ordnet Symptome nach Tool. Prüfe zuerst, ob die passende SKILL.md wirklich zu deinem Setup passt.
Was ist prompt-cache-skills?
prompt-cache-skills ist eine Sammlung von Drop-in-Skills, die ein AI-Coding-Agent selbst lesen und anwenden kann:
| Dimension | Beschreibung |
|---|---|
| Einordnung | Drop-in-Fixes, die ein AI-Coding-Agent lesen und anwenden kann |
| Ziel | Eine kaputte oder teilweise funktionierende Cache-Trefferrate bei passenden Workloads auf 80–99 Prozent erhöhen |
| Relevante Agents | Claude Code, Codex, Cline, Cursor, Devin, Gemini CLI, OpenCode, Aider, Continue, Roo Code und weitere |
| Repository | https://github.com/OnlyTerp/prompt-cache-skills |
| Ablauf | Repository angeben → passende Skills anwenden lassen → Treffer prüfen oder Patches aus skills/ manuell übernehmen |
| Zeitvorteil | Nicht jede Prompt-Caching-Spezifikation der Anbieter selbst untersuchen müssen |
Das Projekt hat derzeit ungefähr 99 Stars. Skill-Liste und Namen können sich ändern; die aktuelle README ist maßgeblich.
Bei manueller Fehlersuche müsstest du die Caching-Dokumentation jedes Anbieters lesen, Unterschiede zwischen Agents vergleichen und raten, welches Feld das Präfix instabil macht. Jeder Skill grenzt einen konkreten Fehler ein, liefert den Diff und beschreibt die Verifikation.
Den Agent mit prompt-cache-skills reparieren
Du kannst den Agent den Fix anwenden lassen oder die Änderungen selbst übernehmen.
Methode 1: Fix automatisch anwenden lassen (empfohlen)
Verweise zuerst auf das Repository und sende deinem AI-Coding-Agent diese Anweisung:
Lies https://github.com/OnlyTerp/prompt-cache-skills und wende jeden Skill in skills/ an, der zu meinem aktuellen Harness passt: Ziel bestätigen → Diff einspielen → nach SKILL.md verifizieren
Der Agent erkennt anschließend dein Tool, etwa Cline, Continue oder Aider, und listet passende Skills mit der jeweils behobenen Ursache auf.
Prüfe danach den Diff. In jedem Skill-Verzeichnis beschreibt die SKILL.md Ziel und konkrete Änderung. Bestätige, dass der Fix für dein Setup sicher ist.
Lass den Agent nach deiner Freigabe den Diff in die lokale oder projektbezogene Konfiguration einspielen. Sichere vorher die Originaldatei.
Prüfe zum Schluss mit tools/check_cache.py, ob der Cache trifft. Der genaue Ablauf folgt im Abschnitt „Einen echten Cache-Treffer verifizieren“.
Methode 2: Fix manuell anwenden
Wenn kein Agent deine Konfiguration ändern soll, kannst du den Fix selbst einspielen.
Öffne zuerst das Repository: https://github.com/OnlyTerp/prompt-cache-skills
Suche im Verzeichnis skills/ nach dem Skill für dein Tool, etwa cline-fix-volatile-msg oder continue-enable-defaults.
Lies die SKILL.md. Sie beschreibt Ziel, Symptom, Fix und Verifikation.
Ändere die Konfigurationsdatei entsprechend.
Verifiziere anschließend den Treffer mit tools/check_cache.py.
Sicherheitshinweis
Ein automatisch angewendeter Diff verändert lokale oder projektbezogene Konfiguration. Lies die SKILL.md, verstehe jede Änderung und sichere die Originaldatei, bevor du zustimmst.
Typische Fixes der Skill-Bibliothek
Jeder Skill ist ein vollständiger Fix aus Ziel-Agent, Symptom, Diff und Verifikation. Einige Beispiele:
| Skill | Ziel-Agent | Symptom | Fix |
|---|---|---|---|
| cline-fix-volatile-msg | Cline | Das System-Prompt-Präfix enthält einen Zeitstempel und ändert sich pro Anfrage | Volatile Nachricht entfernen oder stabilisieren |
| cline-openai-cache-key | Cline + OpenAI | Der OpenAI Cache Key wird falsch berechnet | Erzeugung des Cache Keys korrigieren |
| cline-pin-timestamp | Cline | Ein Zeitstempel macht den Cache ungültig | Zeitstempel fixieren oder entfernen |
| continue-fix-volatile-msg | Continue | Der System-Prompt enthält volatile Felder | Volatile Nachricht entfernen |
| continue-enable-defaults | Continue | Prompt Caching ist standardmäßig deaktiviert | Caching in der Standardkonfiguration aktivieren |
| continue-gemini-explicit | Continue + Gemini | Die Gemini-Cache-Konfiguration fehlt | Cache-Parameter explizit setzen |
| aider-1h-ttl | Aider | Eine einstündige TTL führt zu häufigem Ablauf | TTL verlängern oder Anfragefrequenz anpassen |
| aider-cache-default-on | Aider | Caching ist standardmäßig deaktiviert | Standardschalter aktivieren |
| opencode-detect-openai-compat | OpenCode | Caching scheitert im OpenAI-kompatiblen Modus | OpenAI-kompatible API korrekt erkennen und behandeln |
| opencode-bedrock-doc-blocks | OpenCode + Bedrock | Bedrock-Dokumentblöcke werden falsch gecacht | Cache-Strategie für Dokumentblöcke korrigieren |
Die Liste wächst und Namen können sich ändern. Prüfe README und skills/. Ist dein Agent nicht enthalten, kannst du vorhandene SKILL.md-Dateien und Patches als Vorlage für ähnliche Fehler verwenden.
Einen echten Cache-Treffer verifizieren
prompt-cache-skills enthält tools/check_cache.py. Das Tool vergleicht eine kalte mit einer warmen Anfrage und berechnet die Trefferrate.
Prüfschritte
Lade check_cache.py hier herunter:
https://github.com/OnlyTerp/prompt-cache-skills/blob/main/tools/check_cache.py
Setze danach die API-Zugangsdaten als Umgebungsvariablen:
- Anthropic: ANTHROPIC_API_KEY
- OpenAI: OPENAI_API_KEY
- Google Gemini: GOOGLE_API_KEY
Führe als Nächstes die kalte Anfrage aus:
python check_cache.py --provider anthropic --prompt "dein System-Prompt" --message "deine Benutzernachricht"
Prüfe cache_creation_input_tokens:
- Ein positiver Wert bedeutet, dass ein Cache erstellt wurde
- Notiere input_tokens
Warte eine Sekunde und sende dann dieselbe Anfrage mit exakt identischem Prompt und identischer Nachricht erneut.
Prüfe diese Felder:
- cache_read_input_tokens: Ein Wert größer als 0 bestätigt den Treffer
- cache_creation_input_tokens: Sollte 0 sein oder fehlen
- input_tokens: Sollte deutlich sinken, weil der gecachte Anteil nicht mehr als normale Eingabe zählt
Berechne anschließend die Trefferrate:
Trefferrate = cache_read_input_tokens / (cache_read_input_tokens + input_tokens)
Beispiel:
- Kalte Anfrage: input_tokens=2000, cache_creation_input_tokens=1800
- Warme Anfrage: cache_read_input_tokens=1800, input_tokens=200
- Trefferrate = 1800 / (1800 + 200) = 90%
Bewerte zum Schluss das Ergebnis:
- Cache-Treffer: cache_read_input_tokens der warmen Anfrage > 0
- Cache-Fehler: cache_read_input_tokens der warmen Anfrage = 0 oder Feld fehlt
Erklärung der Metriken
- cache_creation_input_tokens: Bei Anthropic zur Cache-Erstellung verwendete Token
- cache_read_input_tokens: Bei Anthropic aus dem Cache gelesene Token
- cached_tokens: Bei OpenAI gecachte Eingabe-Token
- input_tokens: Normale, nicht gecachte Eingabe-Token
Bleibt cache_read_input_tokens bei der warmen Anfrage 0, prüfe erneut volatile Nachrichten, einen falschen Cache Key, deaktivierte Standardwerte und eine zu kurze TTL.
Wann sich die Skill-Bibliothek lohnt
Die Bibliothek behebt bekannte Cache-Fehler, passt aber nicht zu jedem Workload:
| Workload | Empfehlung | Grund |
|---|---|---|
| Langer System-Prompt + viele ähnliche Anfragen | Empfohlen | Ein stabiles Präfix lässt sich wiederverwenden |
| Agent-Coding-Tools wie Claude Code und Cline | Empfohlen | Das Projekt zielt auf diese Tools |
| Monatliche Rechnung über 50 US-Dollar | Empfohlen | Mögliche Einsparungen rechtfertigen den Aufwand |
| Vorhandene Prompt-Caching-Konfiguration mit unklarem Ergebnis | Empfohlen | Das Prüfwerkzeug bestätigt die tatsächliche Funktion |
| Kurzer Prompt + eine Anfrage | Nicht empfohlen | Cache-Overhead kann den Nutzen übersteigen |
| Häufig wechselnder System-Prompt mit Live-Daten | Nicht empfohlen | Ein instabiles Präfix ist nicht wiederverwendbar |
| Anfrageabstand über der TTL, etwa nur wenige Aufrufe pro Tag | Erst prüfen | Der Cache kann vor der Wiederverwendung ablaufen |
| Agent nicht im Repository | Erst prüfen | Manuelle Anpassung oder künftiger Community-Skill nötig |
Liegt deine Rechnung über 50 US-Dollar und nutzt du einen aufgeführten Agent, kann sich die Prüfung klar lohnen. Bei seltenen Anfragen oder ständig wechselnden Präfixen solltest du die erwartete Wiederverwendung zuerst abschätzen.
Risiken und Hinweise
Prüfe vor der Anwendung diese Punkte:
-
Das Projekt ist noch jung. Es hat derzeit ungefähr 99 Stars; Skill-Namen und Abdeckung können sich ändern. Die aktuelle README ist maßgeblich.
-
Automatische Konfigurationsänderungen brauchen Kontrolle. Ein Agent verändert lokale oder projektbezogene Dateien. Lies zuerst die SKILL.md und entscheide, ob jeder Fix in dein Setup gehört.
-
Anbieter verwenden unterschiedliche Abrechnungsfelder. Anthropic nutzt cache_creation/cache_read, OpenAI cached_tokens und Gemini cached content. Prüfe die aktuelle Dokumentation für exakte Namen und Preise.
-
Caching ist nicht universell sinnvoll. Einmalige kurze Aufrufe und ständig wechselnde Präfixe profitieren kaum und können sogar teurer sein. Erzwinge Caching nicht überall.
-
Das Prüfwerkzeug hat Grenzen. check_cache.py ist vor allem für die Anthropic API ausgelegt. Nutze für OpenAI und Gemini zusätzlich die jeweilige offizielle Dokumentation.
-
Trefferraten sind nicht garantiert. Die 80–99 Prozent sind das vom Projekt genannte Ziel. Das tatsächliche Ergebnis hängt von Präfixlänge, Frequenz, TTL und weiteren Faktoren ab.
Nächste Schritte und weitere Artikel
Weitere Möglichkeiten zur Senkung der AI-Coding-Kosten:
-
AI Gateway für Monitoring, Caching und Failover — mehrere Anbieter zentral verwalten und vermeidbare Kosten reduzieren
-
Prompt-Engineering-Techniken für bessere AI-Ausgaben — Prompts verbessern und unnötige Token vermeiden
-
Computer-Use Agent: AI bedient deinen Computer — Computersteuerung durch Agents verstehen und Workflows verbessern
Offizielle Ressourcen:
- GitHub-Repository prompt-cache-skills
- Anthropic-Dokumentation zu Prompt Caching
- OpenAI-Dokumentation zu Prompt Caching
- Google-Gemini-Dokumentation zu Context Caching
Prompt Caching mit prompt-cache-skills prüfen und verifizieren
Bestimme das Agent-Harness, prüfe den Fix und vergleiche kalte und warme Anfragen, um die tatsächliche Cache-Nutzung zu bestätigen.
- 1
Step 1: Eignung des Workloads prüfen
Prüfe, ob die Anfragen ein langes, stabiles und wiederverwendetes Präfix enthalten. Kurze Prompts, Einzelanfragen und ständig veränderte System-Prompts sind ungeeignet. - 2
Step 2: Passenden Skill finden
Wähle im Verzeichnis skills von prompt-cache-skills den Skill für dein Agent-Harness und deinen Modellanbieter. - 3
Step 3: Ziel und Diff prüfen
Lies die zugehörige SKILL.md, bestätige Zieldatei, Umfang, Risiken und Verifikation und sichere die ursprüngliche Konfiguration vor einer automatischen Änderung. - 4
Step 4: Kleinsten Fix anwenden
Behebe nur die volatile Nachricht, den Cache Key, den Caching-Schalter oder die TTL aus der Skill-Anleitung und ändere keine fremde Konfiguration. - 5
Step 5: Kalte Anfrage ausführen
Nutze check_cache.py oder die Nutzungsfelder des Anbieters für die erste Anfrage und notiere normale Eingabe- sowie Cache-Erstellungs-Token. - 6
Step 6: Warme Anfrage vergleichen
Sende exakt denselben Prompt und dieselbe Nachricht erneut, prüfe Cache-Lese-Token größer als null und berechne die tatsächliche Trefferrate.
FAQ
Welche AI-Coding-Tools unterstützt prompt-cache-skills?
Liegt die Cache-Trefferrate nach dem Fix immer über 80 Prozent?
Wie viel Geld spart ein Cache-Treffer?
Ist eine automatische Konfigurationsänderung durch einen Agent sicher?
Was tun, wenn mein Agent keinen passenden Skill hat?
8 Min. Lesezeit · Veröffentlicht am: 29. Juli 2026 · Aktualisiert am: 30. Juli 2026
Prompt Engineering Guide
Wenn du über die Suche hier gelandet bist, kommst du am schnellsten weiter, indem du zum vorherigen oder nächsten Beitrag dieser Serie springst.
Vorheriger
Prompt-Engineering-Vorlagenbibliothek: 12 wiederverwendbare Prompt-Design-Muster
Bewährte Methode zum Aufbau einer Prompt-Vorlagenbibliothek: Vier-Felder-Struktur, 12 Prompt Patterns, Multi-Modell-Anpassungstabelle und 5 produktionsreife Vorlagen zum direkten Kopieren.
Teil 4 von 5
Nächster
Dies ist bisher der neueste Beitrag dieser Serie.



Kommentare
Melde dich mit GitHub an, um einen Kommentar zu hinterlassen