ビジョン
ビジョン対応モデルはテキストと一緒に画像入力を受け付けます。ai& は 3 種類の入力方式に対応しているため、用途に合わせて選択してください。
画像を渡す 3 つの方法
Section titled “画像を渡す 3 つの方法”{ "role": "user", "content": [ { "type": "text", "text": "What's in this image?" }, { "type": "image_url", "image_url": { "url": "https://example.com/cat.png" } } ]}{ "role": "user", "content": [ { "type": "text", "text": "What's in this image?" }, { "type": "image_url", "image_url": { "url": "data:image/png;base64,iVBORw0KG..." } } ]}{ "role": "user", "content": [ { "type": "text", "text": "What's in this image?" }, { "type": "file", "file": { "file_id": "file-abc123" } } ]}file_id 方式の仕組み
Section titled “file_id 方式の仕組み”{type: "file", file: {file_id}} を送ると、アップロード済みのバイト列がモデルに渡されます — 公開ホスティングは不要です。クライアント側のワイヤーフォーマットはどの方式でも変わりません。
画像は Files から purpose: "vision" でアップロード、または purpose を省略すると MIME から推論されます。
対応 MIME: image/png、image/jpeg、image/webp、image/gif。最大サイズ: 100 MiB。
Capability ゲート
Section titled “Capability ゲート”ビジョンリクエストは、対象モデルが vision capability を持たない場合は拒否されます — インラインの image_url パートでも、purpose がビジョンに対応する file_id 参照でも同様です。モデルと capability の一覧は Models を参照。