Skip to main content
Tokens cobrados são as unidades deduzidas de um saldo de API da Capriole AI. O Premium pessoal inclui 5 milhões por mês como parte da assinatura de espaço de trabalho de USD 8. Entrada sem cache e saída contam 100%. Entrada em cache conta 10%, arredondada para cima até o próximo token inteiro. Eles se aplicam ao tráfego da API pública e de agentes de programação. O Browser Chat ilimitado do Premium não consome este saldo de API.

A fórmula

A Capriole normaliza cada protocolo suportado em uma contagem total de tokens de entrada e, quando o provedor selecionado a informa, uma contagem de entrada em cache. A entrada em cache é um subconjunto da entrada total.
Se o provedor não informar entrada em cache, todos os tokens de entrada contam 100%. A Capriole não infere um acerto de cache que os metadados de uso não informam. No Anthropic Messages, a criação de cache continua sendo entrada a 100%. Só as leituras de cache informadas recebem o tratamento de tokens cobrados a 10%.

Três exemplos reproduzíveis

A terceira solicitação tem 228,897 tokens brutos de entrada mais saída. Ela deduz 23,496 tokens cobrados porque o provedor informou 228,224 tokens de entrada como em cache. O arredondamento acontece na porção em cache de cada solicitação registrada. Um token de entrada em cache, portanto, cobra um token depois de ceil(0.1), enquanto dez tokens de entrada em cache também cobram um token.

Estime quantas solicitações cabem em 5 milhões de tokens cobrados

Use o valor médio de tokens cobrados do seu próprio uso da API, em vez de chutar a partir do tamanho bruto do contexto.
Essas linhas são aritmética de planejamento, não afirmações de carga de trabalho típica. Uma chamada curta de classificação e um turno longo de agente de programação podem diferir por ordens de magnitude. Comprimento da saída, contexto repetido, acertos de cache informados pelo provedor e resultados de ferramenta alteram a média medida.

Tokens cobrados e preços do provedor usam unidades diferentes

Os provedores oficiais podem publicar preços separados para entrada, entrada em cache, gravações de cache, saída, ferramentas ou contextos longos. O saldo de tokens cobrados da Capriole é uma unidade de cota do cliente, com uma fórmula em todas as rotas públicas da API suportadas. Não multiplique tokens cobrados pela taxa publicada de entrada ou saída de um provedor. As unidades descrevem sistemas de cobrança diferentes. A comparação datada de custo da API aplica esta fórmula a uma carga de trabalho fixa de 5 milhões de tokens e depois compara o custo em dinheiro em cada serviço.

Limites de saldo pessoal e Team

A cota incluída é consumida antes da carteira de recarga pessoal ou Team correspondente. Saldos de recarga comprados persistem entre períodos de cota mensal e intervalos de acesso pago; consumi-los ainda exige acesso pago ativo elegível. O Browser Chat é separado da contabilidade da API; agentes de programação contam como tráfego de API e deduzem tokens cobrados. Os 5 milhões mensais fazem parte da assinatura completa de espaço de trabalho Premium de USD 8. Não é um plano de API ilimitado e não deve ser apresentado como um preço de API avulso. As recargas estendem o uso programático. Elas não alteram a cota do Browser Chat, a compatibilidade de modelos nem o requisito de acesso pessoal ou Team ativo elegível.

O que a API registra

A Capriole guarda o uso normalizado pelo protocolo e o uso cobrado como campos separados. Uma solicitação bem-sucedida da API pública pode registrar:
  • tokens de entrada normalizados;
  • tokens de saída;
  • tokens normalizados de entrada mais saída;
  • tokens de entrada em cache informados pelo provedor;
  • tokens cobrados deduzidos da cota;
  • o modelo resolvido e o status da solicitação.
A resposta nativa da Capriole em POST /v1/chat expõe cached_tokens e charged_tokens dentro de usage. Os endpoints compatíveis de Responses, Chat Completions e Messages preservam as formas de resposta do upstream, enquanto a Capriole registra o valor correspondente de tokens cobrados para o uso da conta.

Confirme se a entrada em cache reduziu uma cobrança

Abra a página da API da Capriole AI e use os filtros Key, Model e Status para isolar a solicitação. Compare estas colunas na tabela de uso: Um valor positivo de tokens em cache confirma que os metadados de uso compatíveis do provedor informaram um acerto de cache. Isso não prova que toda solicitação repetida vai acertar o mesmo cache do provedor. Roteamento do provedor, tempo de vida do cache, estrutura da solicitação e comportamento do modelo podem mudar o resultado. Para POST /v1/chat nativo da Capriole, a mesma verificação está disponível em usage.cached_tokens e usage.charged_tokens. Outras respostas de protocolo mantêm os schemas do upstream, então a tabela de uso da conta é o lugar consistente para comparar solicitações entre rotas.

Perguntas comuns

A entrada em cache sempre recebe o desconto de 90% da cota?

Só quando o provedor selecionado informa entrada em cache em metadados de uso compatíveis. Metadados de cache ausentes não são tratados como acerto de cache.

Tokens de reasoning são somados uma segunda vez?

Não. O uso de saída informado pelo provedor já contém a contabilidade de saída usada pela rota. A Capriole não adiciona uma cobrança separada de tokens de reasoning por cima da saída nesta fórmula.

O uso da API é ilimitado no Premium?

Não. O Browser Chat do Premium é ilimitado no conjunto de modelos Premium suportado. Solicitações de API e de agentes de programação usam o saldo incluído de tokens cobrados e qualquer saldo de recarga disponível.

Por onde devo começar a programar?

Use o início rápido da API para a menor solicitação bruta ou o guia dos SDKs OpenAI e Anthropic para clientes nativos de protocolo em Python e TypeScript. Se você ainda não assinou, experimente os modelos principais no Browser Chat gratuito limitado antes de fazer upgrade. Os fatos de plano, cota, recarga e tokens cobrados da Capriole nesta página são mantidos como documentação de primeira parte. Fatos verificados: 2026-08-11.
Última modificação em 18 de agosto de 2026