料金
ai& は推論をトークン単位で課金し、リクエスト完了時にプリペイドのクレジット残高から差し引きます。チャージは クレジットとチャージ から。
cost = (input_tokens / 1_000_000) × input_per_1m + (output_tokens / 1_000_000) × output_per_1minput_per_1m と output_per_1m はいずれも 組織の請求通貨(USD または JPY、組織作成時に固定)建ての 100 万トークンあたり単価 で、currency フィールドとともに GET /v1/models の各モデル行に含まれます。API キーなしで呼び出した場合は USD 建てで返されます。請求通貨の価格が設定されていないモデルは一覧に表示されず、呼び出すこともできません。
プロンプトキャッシュ
Section titled “プロンプトキャッシュ”繰り返されるプロンプトのプレフィックスは自動的に検出され、再利用された先頭部分は、対応するモデルでは割引された キャッシュ入力単価 で課金されます。安定したシステムプロンプト(およびツール定義)に増加していく会話履歴が続く、という一般的なパターンでは、2 ターン目以降は直前のターンのプロンプトをプレフィックスとして再利用するため、その部分が割引されます。cache_control マーカーやコード変更は不要です。
モデルがキャッシュ単価を持つ場合、コストは次のようになります:
cost = (cached_tokens / 1_000_000) × cached_input_per_1m + (input_tokens − cached_tokens) / 1_000_000 × input_per_1m + (output_tokens / 1_000_000) × output_per_1mキャッシュされたトークン数は、各 SDK が想定するフィールドでレスポンスの usage に返されます:
| API | フィールド |
|---|---|
| OpenAI Chat Completions | usage.prompt_tokens_details.cached_tokens |
| OpenAI Responses | usage.input_tokens_details.cached_tokens |
| Anthropic Messages | usage.cache_read_input_tokens |
ストリーミングレスポンスでは、同じ値が event: metrics trailer の tokens.cached として返されます(X-Aiand-Metrics: true 付与時)。
- キャッシュは 1024 トークン以上 のプロンプトに適用され、128 トークン単位 で計上されます。
- 再利用は組織ごとにスコープされ、無操作からおよそ 10 分 持続します。
- キャッシュ入力単価を持つモデルのみが
cached_tokensを返します。それ以外のモデルでは入力はすべて標準単価で課金され、このフィールドは省略されます。
リクエスト単位のコスト表示
Section titled “リクエスト単位のコスト表示”リクエストヘッダ X-Aiand-Metrics: true を付与すると、レスポンスごとに正確な計算済みコストを受け取れます:
- 非ストリーミング:
X-Cost+X-Cost-Currencyヘッダ。レスポンスヘッダ を参照。 - ストリーミング: モデルの終端メッセージ後の
event: metricstrailer イベント。ペイロードにはトークン数・costに加えて、コストの通貨を示すcurrencyフィールドが含まれます。ストリーミングイベント を参照。
過去分の利用状況・コストは Analytics と リクエストログ からも参照できます。
課金されるケース
Section titled “課金されるケース”| 結果 | 課金 |
|---|---|
| 出力ありの 2xx | あり — (入力 × 単価) + (出力 × 単価) |
| モデル呼び出し前の 4xx (バリデーション・認証・レート制限・残高不足) | なし |
| 一部ストリーミング後の 5xx | 生成済み分は課金 |
| ストリーム中断 | 生成済み分は課金 |
リクエスト確定時にアトミックに引き落とされるため、並行リクエストでも残高超過は発生しません。
トークン単価はティアによらず共通です。ティアで異なるのはスループット — RPM / TPM の上限は レート制限 を参照。