一把 API Key 打通文字、圖片、影片、語音與 Embedding — BazaarLink 全模態指南
文字對話、圖片生成與編輯、影片生成、語音合成(TTS)、語音轉文字(STT)、Embedding——每個模態走哪個端點、有哪些模型、怎麼計費、有什麼限制,一篇講完。
簡而言之
- 一個 base URL、一把 API key,涵蓋文字對話、圖片生成、圖片編輯、影片生成、語音合成(TTS)、語音轉文字(STT)、Embedding 七種能力。
- 文字走
/chat/completions(另支援 Anthropic 風格/messages與 OpenAI/responses),其餘模態各有 OpenAI-compatible 專用端點。 - 模型陣容跨供應商:影片有 Sora 2 Pro、Veo 3.1、Seedance 2.0、Wan 系列;圖片有 GPT-5.4 Image、Gemini Image、Qwen-Image;TTS 主打 qwen3-tts-flash。
- 計費方式依模態不同(token / 張數 / 實際交付秒數 / 字元),但全部從同一個餘額扣款、同一份帳單、可開統一發票。
- 誠實限制表在文末——先知道邊界在哪,再開始整合。
為什麼「一把 key」重要
預設路徑是這樣的:文字接一家、圖片接一家、影片再接一家、embedding 又一家——四個 SDK、四種驗證、四份海外帳單,然後才開始寫真正的功能。每加一個模態,採購和報帳流程就重跑一次。
整合成一個端點後:一個 base URL、一把 key、一份帳單(統一發票,支援個人 / 企業統編)、一個 /logs 看全部用量。新模型上線,改一個模型字串就能用。
每個模態走哪個端點
| 模態 | 端點 | 呼叫方式 |
|---|---|---|
| 文字對話 | POST /api/v1/chat/completions | OpenAI SDK 原生支援 |
| 文字(Anthropic 風格) | POST /api/v1/messages | Claude SDK 遷移零改動 |
| 文字(Responses API) | POST /api/v1/responses | OpenAI 新版介面 |
| 圖片生成 | POST /api/v1/images/generations | 文生圖 |
| 圖片編輯 | POST /api/v1/images/edits | 圖生圖、指令式編輯 |
| 影片生成 | POST /api/v1/videos → 輪詢 → 下載 | 非同步任務 |
| 語音合成 TTS | POST /api/v1/audio/speech | 回傳音訊串流 |
| 語音轉文字 STT | POST /api/v1/audio/transcriptions | multipart 上傳或 base64 JSON |
| Embedding | POST /api/v1/embeddings | OpenAI SDK 原生支援 |
每個模態有哪些模型
圖片生成 / 編輯:gpt-5.4-image-2、Gemini 3.x Image 系列、qwen/qwen-image-max、qwen/qwen-image-edit-max、Wan 2.x 文生圖系列、alibaba/z-image-turbo。
影片生成:openai/sora-2-pro、google/veo-3.1、bytedance/seedance-2.0(含 fast 版)、Wan 2.x 文生影 / 圖生影全家族——首尾幀、參考圖工作流見 圖片轉影片教學,各家比較見 AI 影片生成工具比較 2026。
語音:TTS 主打 qwen/qwen3-tts-flash(多音色、中文表現佳);STT 支援主流轉錄模型。
Embedding:text-embedding-3-small / text-embedding-3-large、qwen3-embedding-4b / 8b、gemini-embedding-001 等。
完整清單與即時單價見 BazaarLink Models。
計費方式差在哪
不同模態的自然計費單位不同,BazaarLink 直接沿用各模態的業界慣例:
| 模態 | 計費單位 | 備註 |
|---|---|---|
| 文字 | input / output token | 與各家官方相同的 per-MTok 結構 |
| 圖片 | 依模型按張數或 token | 單價標示在 /models 各模型頁 |
| 影片 | 實際交付秒數 | 只按最終產出的影片長度計費 |
| TTS | 輸入字元數 | 文案長度即費用,好抓預算 |
| STT | 依音檔時長 / 用量 | 依上游回報用量結算 |
| Embedding | input token | 沒有 output 費用 |
全部從同一個預付餘額扣款,不用分開儲值。
誠實限制表
先知道邊界,整合才不會踩雷:
| 限制 | 說明 |
|---|---|
| 圖片編輯不支援 mask | /v1/images/edits 是整圖指令式編輯,無局部遮罩修補 |
| 圖片編輯回傳以 URL 為主 | 不支援 b64_json 回傳格式 |
| 影片生成是非同步 | 建立任務 → 輪詢狀態 → 下載,不能同步等結果 |
| Embedding 無串流 | 一次請求一次回傳(業界皆然) |
| TTS 無上游用量封套 | 按輸入字元計費,平台端自行結算 |
| 各模型能力不一 | 例如部分影片模型只支援文生影、不支援圖生影,見各模型頁 |
從一個呼叫開始
文字(改兩個字串就能跑):
from openai import OpenAI
client = OpenAI(base_url="https://bazaarlink.ai/api/v1", api_key="sk-bl-...")
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "哈囉"}],
)
圖片生成:
img = client.images.generate(
model="qwen/qwen-image-max",
prompt="a watercolor painting of Taipei 101 at dusk",
)
print(img.data[0].url)
Embedding:
emb = client.embeddings.create(
model="text-embedding-3-small",
input="統一發票怎麼對獎?",
)
print(len(emb.data[0].embedding))
TTS(回傳音訊二進位):
curl https://bazaarlink.ai/api/v1/audio/speech \
-H "Authorization: Bearer $BAZAARLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "qwen/qwen3-tts-flash", "input": "歡迎使用 BazaarLink", "voice": "Cherry"}' \
-o hello.mp3
免費註冊(無需信用卡)即可開始。想比較各家文字模型的台幣成本,見價目系列:Claude、GPT-5、Gemini、DeepSeek。