> ## Documentation Index
> Fetch the complete documentation index at: https://docs.capriole.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Capriole AI abgerechnete Tokens erklärt

> Berechnen Sie Capriole AI abgerechnete Tokens aus ungecachter Eingabe, gecachter Eingabe und Ausgabe mit reproduzierbaren Beispielen sowie den Kontingentgrenzen für Personal und Team.

Abgerechnete Tokens sind die Einheiten, die von einem Capriole AI API-Guthaben abgezogen werden. Persönliches Premium umfasst 5 Millionen pro Monat als Teil der USD 8 Arbeitsbereich-Mitgliedschaft. Ungecachte Eingabe und Ausgabe zählen zu 100%. Gecachte Eingabe zählt zu 10%, aufgerundet auf das nächste ganze Token.

Sie gelten für öffentlichen API- und Coding-Agent-Traffic. Unbegrenzter Premium Browser Chat verbraucht dieses API-Guthaben nicht.

## Die Formel

Capriole normalisiert jedes unterstützte Protokoll zu einer Gesamtzahl Eingabe-Tokens und, wenn der gewählte Anbieter sie meldet, einer gecachten Eingabezahl. Gecachte Eingabe ist eine Teilmenge der gesamten Eingabe.

```text theme={null}
uncached_input = input_tokens - cached_input

charged_tokens =
  uncached_input
  + ceil(cached_input × 0.1)
  + output_tokens
```

Wenn der Anbieter keine gecachte Eingabe meldet, zählen alle Eingabe-Tokens zu 100%. Capriole leitet keinen Cache-Treffer ab, den die Nutzungsmetadaten nicht melden.

| Protokoll               | Normalisierte Eingabe                                                  | Gecachte Teilmenge                    |
| ----------------------- | ---------------------------------------------------------------------- | ------------------------------------- |
| OpenAI Responses        | `input_tokens`                                                         | `input_tokens_details.cached_tokens`  |
| OpenAI Chat Completions | `prompt_tokens`                                                        | `prompt_tokens_details.cached_tokens` |
| Anthropic Messages      | `input_tokens + cache_creation_input_tokens + cache_read_input_tokens` | `cache_read_input_tokens`             |

Bei Anthropic Messages bleibt die Cache-Erstellung 100% Eingabe. Nur gemeldete Cache-Reads erhalten die 10%-Behandlung für abgerechnete Tokens.

## Drei reproduzierbare Beispiele

| Beispiel                        | Gesamteingabe | Gecachte Eingabe | Ausgabe | Berechnung                  | Abgerechnete Tokens |
| ------------------------------- | ------------: | ---------------: | ------: | --------------------------- | ------------------: |
| Kein Cache-Treffer              |           800 |                0 |     200 | `800 + 0 + 200`             |               1,000 |
| Überwiegend gecachter Prompt    |        10,000 |            8,000 |     500 | `2,000 + ceil(800) + 500`   |               3,300 |
| Großer gemeldeter Cache-Treffer |       228,807 |          228,224 |      90 | `583 + ceil(22,822.4) + 90` |              23,496 |

Die dritte Anfrage hat 228,897 rohe Eingabe-plus-Ausgabe-Tokens. Sie zieht 23,496 abgerechnete Tokens ab, weil der Anbieter 228,224 Eingabe-Tokens als gecacht gemeldet hat.

Die Rundung erfolgt auf dem gecachten Anteil jeder erfassten Anfrage. Ein gecachtes Eingabe-Token berechnet daher nach `ceil(0.1)` ein Token, während zehn gecachte Eingabe-Tokens ebenfalls ein Token berechnen.

## Schätzen, wie viele Anfragen in 5 Millionen abgerechnete Tokens passen

Verwenden Sie den durchschnittlichen Wert der abgerechneten Tokens aus Ihrer eigenen API-Nutzung, statt aus der rohen Kontextgröße zu raten.

```text theme={null}
estimated_requests = floor(5,000,000 / average_charged_tokens_per_request)
```

| Durchschnittliche abgerechnete Tokens pro Anfrage | Anfragen aus 5 Millionen abgerechneten Tokens |
| ------------------------------------------------: | --------------------------------------------: |
|                                             1,000 |                                         5,000 |
|                                             5,000 |                                         1,000 |
|                                            25,000 |                                           200 |
|                                           100,000 |                                            50 |

Diese Zeilen sind Planungsarithmetik, keine typischen Arbeitslastbehauptungen. Ein kurzer Klassifikationsaufruf und ein langer Coding-Agent-Turn können um Größenordnungen voneinander abweichen. Ausgabelänge, wiederholter Kontext, vom Anbieter gemeldete Cache-Treffer und Tool-Ergebnisse ändern alle den gemessenen Durchschnitt.

## Abgerechnete Tokens und Anbieterpreise verwenden unterschiedliche Einheiten

Offizielle Anbieter können getrennte Preise für Eingabe, gecachte Eingabe, Cache-Writes, Ausgabe, Tools oder lange Kontexte veröffentlichen. Das Guthaben an abgerechneten Tokens von Capriole ist eine Kundenkontingenteinheit mit einer Formel über unterstützte öffentliche API-Routen.

| Einheit                           | Welche Frage sie beantwortet                                        |
| --------------------------------- | ------------------------------------------------------------------- |
| Anbieter-Input- und Output-Preise | Was der Anbieter nach seiner eigenen Preistabelle berechnet         |
| Rohe API-Nutzungs-Tokens          | Wie viele Eingabe-, Ausgabe- und gecachte Tokens die Antwort meldet |
| Capriole abgerechnete Tokens      | Wie viel Capriole vom API-Guthaben des Kontos abzieht               |

Multiplizieren Sie abgerechnete Tokens nicht mit einem veröffentlichten Input- oder Output-Satz eines Anbieters. Die Einheiten beschreiben unterschiedliche Abrechnungssysteme.

Der [datierte API-Kostenvergleich](/de/articles/ai-api-cost-comparison) wendet diese Formel auf eine feste Arbeitslast von 5 Millionen Tokens an und vergleicht dann die Barkosten unter jedem Dienst.

## Grenzen des Personal- und Team-Guthabens

| Zugang           |                                                             Enthaltenes API-Guthaben | Basispreis der Aufstockung | Aktuelle Regel                                                                                                                                          |
| ---------------- | -----------------------------------------------------------------------------------: | -------------------------: | ------------------------------------------------------------------------------------------------------------------------------------------------------- |
| Personal Premium |           5 Millionen abgerechnete Tokens pro aktivem monatlichem Kontingentzeitraum |      USD 8 pro 5 Millionen | Öffentliche API und persönliche Aufstockungen erfordern aktiven Premium-Zugang; Käufe mehrerer Pakete erhalten den angezeigten Mengenrabatt, bis zu 15% |
| Team             | 50 Millionen geteilte abgerechnete Tokens pro aktivem monatlichem Kontingentzeitraum |    USD 80 pro 50 Millionen | USD 70/Monat umfasst fünf Sitze; Owners und Admins können ein bis fünf Pakete kaufen, mit dem angezeigten Mengenrabatt bis zu 10%                       |

Das enthaltene Kontingent wird vor der passenden persönlichen oder Team-Aufstockungsbörse verbraucht. Gekaufte Aufstockungsguthaben bleiben über monatliche Kontingentzeiträume und Lücken im bezahlten Zugang bestehen; ihr Verbrauch erfordert weiterhin berechtigten aktiven bezahlten Zugang. Browser Chat ist von der API-Abrechnung getrennt; Coding-Agents zählen als API-Traffic und ziehen abgerechnete Tokens ab.

Die monatlichen 5 Millionen sind Teil der vollständigen USD 8 Premium-Arbeitsbereich-Mitgliedschaft. Es ist kein unbegrenzter API-Plan und sollte nicht als eigenständiger API-Preis dargestellt werden.

Aufstockungen erweitern die programmatische Nutzung. Sie ändern nicht das Browser-Chat-Kontingent, die Modellkompatibilität oder die Anforderung eines berechtigten aktiven persönlichen oder Team-Zugangs.

## Was die API erfasst

Capriole hält protokolnormalisierte Nutzung und berechnete Nutzung als getrennte Felder. Eine erfolgreiche öffentliche API-Anfrage kann erfassen:

* normalisierte Eingabe-Tokens;
* Ausgabe-Tokens;
* normalisierte Eingabe-plus-Ausgabe-Tokens;
* vom Anbieter gemeldete gecachte Eingabe-Tokens;
* vom Kontingent abgezogene abgerechnete Tokens;
* das aufgelöste Modell und den Anfragestatus.

Die Capriole-native Antwort von `POST /v1/chat` stellt `cached_tokens` und `charged_tokens` in `usage` bereit. Protokollkompatible Responses-, Chat Completions- und Messages-Endpunkte bewahren ihre Upstream-Antwortformen, während Capriole den passenden Wert der abgerechneten Tokens für die Kontonutzung erfasst.

## Bestätigen, ob gecachte Eingabe eine Belastung reduziert hat

Öffnen Sie die Capriole AI [API-Seite](https://capriole.ai?view=api) und nutzen Sie die Filter **Key**, **Model** und **Status**, um die Anfrage zu isolieren. Vergleichen Sie diese Spalten in der Nutzungstabelle:

| Spalte             | Was sie bestätigt                                                     |
| ------------------ | --------------------------------------------------------------------- |
| **Input tokens**   | Protokolnormalisierte Eingabe, bevor gecachte Eingabe getrennt wird   |
| **Cached tokens**  | Eingabe, die der Anbieter als gecacht gemeldet hat                    |
| **Charged tokens** | Nach Anwendung der Formel für gecachte Eingabe abgezogenes Kontingent |
| **Total tokens**   | Protokolnormalisierte Eingabe plus Ausgabe                            |

Ein positiver Wert für gecachte Tokens bestätigt, dass kompatible Anbieternutzungsmetadaten einen Cache-Treffer gemeldet haben. Er beweist nicht, dass jede wiederholte Anfrage denselben Anbieter-Cache trifft. Anbieterrouting, Cache-Lebensdauer, Anfragestruktur und Modellverhalten können das Ergebnis ändern.

Für Capriole-natives `POST /v1/chat` ist dieselbe Prüfung in `usage.cached_tokens` und `usage.charged_tokens` verfügbar. Andere Protokollantworten behalten ihre Upstream-Schemata, daher ist die Kontonutzungstabelle der konsistente Ort, um Anfragen über Routen zu vergleichen.

## Häufige Fragen

### Erhält gecachte Eingabe immer den 90%-Kontingentrabatt?

Nur wenn der gewählte Anbieter gecachte Eingabe in kompatiblen Nutzungsmetadaten meldet. Fehlende Cache-Metadaten werden nicht als Cache-Treffer behandelt.

### Werden Reasoning-Tokens ein zweites Mal addiert?

Nein. Die vom Anbieter gemeldete Ausgabe-Nutzung enthält bereits die Ausgabeabrechnung der Route. Capriole addiert für diese Formel keine getrennte Reasoning-Token-Belastung zusätzlich zur Ausgabe.

### Ist die API-Nutzung unter Premium unbegrenzt?

Nein. Premium Browser Chat ist über die unterstützte Premium-Modellgruppe unbegrenzt. API- und Coding-Agent-Anfragen nutzen das enthaltene Guthaben an abgerechneten Tokens und jedes verfügbare Aufstockungsguthaben.

### Wo sollte ich mit dem Programmieren beginnen?

Nutzen Sie den [API-Schnellstart](/de/quickstart) für die kleinste Rohanfrage oder die [OpenAI- und Anthropic-SDK-Anleitung](/de/guides/openai-anthropic-sdks) für protokollnative Python- und TypeScript-Clients. Wenn Sie noch nicht abonniert haben, [probieren Sie die Flaggschiff-Modelle im begrenzten kostenlosen Browser Chat](https://capriole.ai), bevor Sie upgraden.

Capriole-Plan-, Kontingent-, Aufstockungs- und berechnete-Token-Fakten auf dieser Seite werden als First-Party-Dokumentation gepflegt.

**Fakten geprüft:** 2026-08-11.
