コンテンツにスキップ

料金

ai& は推論をトークン単位で課金し、リクエスト完了時にプリペイドのクレジット残高から差し引きます。チャージは クレジットとチャージ から。

cost = (input_tokens / 1_000_000) × input_per_1m
+ (output_tokens / 1_000_000) × output_per_1m

input_per_1m と output_per_1m はいずれも 組織の請求通貨(USD または JPY、組織作成時に固定)建ての 100 万トークンあたり単価 で、currency フィールドとともに GET /v1/models の各モデル行に含まれます。API キーなしで呼び出した場合は USD 建てで返されます。請求通貨の価格が設定されていないモデルは一覧に表示されず、呼び出すこともできません。

繰り返されるプロンプトのプレフィックスは自動的に検出され、再利用された先頭部分は、対応するモデルでは割引された キャッシュ入力単価 で課金されます。安定したシステムプロンプト(およびツール定義)に増加していく会話履歴が続く、という一般的なパターンでは、2 ターン目以降は直前のターンのプロンプトをプレフィックスとして再利用するため、その部分が割引されます。cache_control マーカーやコード変更は不要です。

モデルがキャッシュ単価を持つ場合、コストは次のようになります:

cost = (cached_tokens / 1_000_000) × cached_input_per_1m
+ (input_tokens − cached_tokens) / 1_000_000 × input_per_1m
+ (output_tokens / 1_000_000) × output_per_1m

キャッシュされたトークン数は、各 SDK が想定するフィールドでレスポンスの usage に返されます:

APIフィールド
OpenAI Chat Completionsusage.prompt_tokens_details.cached_tokens
OpenAI Responsesusage.input_tokens_details.cached_tokens
Anthropic Messagesusage.cache_read_input_tokens

ストリーミングレスポンスでは、同じ値が event: metrics trailer の tokens.cached として返されます(X-Aiand-Metrics: true 付与時)。

  • キャッシュは 1024 トークン以上 のプロンプトに適用され、128 トークン単位 で計上されます。
  • 再利用は組織ごとにスコープされ、無操作からおよそ 10 分 持続します。
  • キャッシュ入力単価を持つモデルのみが cached_tokens を返します。それ以外のモデルでは入力はすべて標準単価で課金され、このフィールドは省略されます。

リクエストヘッダ X-Aiand-Metrics: true を付与すると、レスポンスごとに正確な計算済みコストを受け取れます:

  • 非ストリーミング: X-Cost + X-Cost-Currency ヘッダ。レスポンスヘッダ を参照。
  • ストリーミング: モデルの終端メッセージ後の event: metrics trailer イベント。ペイロードにはトークン数・cost に加えて、コストの通貨を示す currency フィールドが含まれます。ストリーミングイベント を参照。

過去分の利用状況・コストは Analytics と リクエストログ からも参照できます。

結果課金
出力ありの 2xxあり — (入力 × 単価) + (出力 × 単価)
モデル呼び出し前の 4xx (バリデーション・認証・レート制限・残高不足)なし
一部ストリーミング後の 5xx生成済み分は課金
ストリーム中断生成済み分は課金

リクエスト確定時にアトミックに引き落とされるため、並行リクエストでも残高超過は発生しません。

トークン単価はティアによらず共通です。ティアで異なるのはスループット — RPM / TPM の上限は レート制限 を参照。