BazaarLinkBazaarLink
登入
← 所有文章
發布時間 2026-09-28 · · 作者:BazaarLink · AI 搜尋 API · 網路搜尋 · RAG · 評估方法 · 新聞搜尋

AI 搜尋 API 怎麼運作?30 題實測教你評估

AI 搜尋 API 讓模型查到最新資料。用 30 題固定題庫實測,說明運作流程、深度與新聞模式的取捨,以及速度與成本怎麼看。

大型語言模型的知識停在訓練截止那天,問「最近一週的新聞」「這個月才公布的法規」這類問題,它只能猜。AI 搜尋 API 就是補上這一塊:先替模型去網路上查,再把整理好的結果交給模型回答。

這篇整理兩件事:搜尋 API 在一次對話裡實際怎麼運作,以及我們用一份固定題庫實測後,學到「該怎麼評估一個搜尋 API」。文中所有數字都來自同一次受控測試,測試條件寫在文末,方便你照著自己重做。

AI 搜尋 API 是怎麼運作的

一次帶搜尋的對話,大致分四步:

  1. 判斷要不要查:模型(或你的程式)看問題,決定需不需要即時資料。
  2. 送出查詢:把問題改寫成搜尋語句,呼叫搜尋 API,通常會指定要幾筆結果。
  3. 取回結果:搜尋 API 回傳一組網址、標題、內容摘要,有些還帶發布日期。
  4. 餵給模型:把這些內容放進提示詞,讓模型根據來源回答,並附上出處。

和一般的 Google 搜尋不同的是,回傳的對象是程式,不是人。所以評估重點不是「畫面好不好看」,而是三件事:找到的內容相不相關、新不新、夠不夠讓模型直接引用。

如果你只是想讓模型的回答帶上網路資料,不必自己串搜尋 API:BazaarLink 支援網路搜尋(:online),做法見網路搜尋功能說明。

怎麼評估搜尋 API:固定題庫、固定評分、先寫死再測

比較搜尋 API 最常見的錯誤,是「隨手問幾題,覺得這家比較準」。這種比較沒辦法重現,也很容易被記得最清楚的一兩題帶偏。我們這次的做法是:

  • 題庫在測試前就固定並公開存檔:共 30 題,其中 25 題繁體中文、5 題英文,涵蓋台灣新聞、法規、政府公告、醫療衛教、學術、在地商家與地名;8 題標記為「需要近期資料」。測試中途不換題、不改題。
  • 每題每個設定各查一次:不重試、不挑結果,並發上限 2,每次呼叫 30 秒逾時;每次都要求 5 筆結果。
  • 評分規則先寫成 rubric:每題一組 0–5 分的評分標準,由同一個固定的評審模型、同一份提示詞逐筆打分,不會因為題目或來源不同而換標準。
  • 每個數字都留原始資料:搜尋回應、評分回應、成本都逐筆存檔,日後可以回頭核對。

這套流程的重點是「可重現」:換一個搜尋 API、換一組設定,只要用同一份題庫與 rubric 重跑,就能得到可以並排比較的數字。

深度設定:兩倍成本,換來什麼?

多數搜尋 API 都有「搜尋深度」的選項:淺的比較快、比較便宜,深的會多做一輪內容擷取。我們在同一個搜尋 API 上比較了兩種深度(下表稱「標準」與「進階」),30 題一般題的結果如下:

標準進階
呼叫成功30/3030/30
相關性平均(0–5)3.2603.153
延遲 p501,998 ms5,061 ms
延遲 p954,033 ms7,014 ms
每次搜尋費用(BazaarLink 客戶價)約 $0.0096約 $0.0192

這份題庫裡,進階深度沒有帶來更高的平均相關性,卻多花了約兩倍的時間與費用。所以「越深越好」不是預設答案:先用便宜的設定跑你自己的題庫,確定不夠用,再往上升。

語言也有差異。標準深度在繁中題的相關性是 3.392、英文題是 2.600;進階深度則是 3.200 與 2.920。換句話說,你的使用者主要問什麼語言,就該用那個語言的題目去測,不要拿別人的英文測試結果來推論繁中表現。另外,繁中題有 96% 的結果來自台灣或繁體中文來源,英文題只有 24%,如果你需要在地來源,這一點值得單獨檢查。

新聞模式:拿得到日期,不等於答得對

問「最近一週發生什麼事」時,搜尋 API 最麻煩的是時效。我們把 8 題需要近期資料的題目,拆成兩種情況測:

一般模式:300 筆結果裡,沒有任何一筆帶有可解析的發布日期。這不代表內容過時,只是你無法從資料本身判斷新舊,程式也就沒辦法過濾。

新聞模式 + 時間範圍(限定最近一週或一個月):日期欄位變得可用,有日期的結果全部落在 30 天內。但是相關性出現很大的落差:

標準進階
有發布日期的結果36/4034/40
相關性平均(0–5,8 題)0.4751.900
台灣/繁中來源占比37.5%82.5%

兩個重點:

  1. 有日期不等於有用。 標準深度有 90% 的結果帶日期,但前幾個台灣新聞題幾乎都拿到不相關的國際新聞,相關性只有 0.475。
  2. 新聞題與一般題要分開評估。 進階深度在新聞題明顯較好(1.900),但仍低於一般題的 3 分以上水準。時效類問題比想像中難,別因為日期欄位有值就以為問題解決了。

實務上的做法是:程式先判斷問題是不是「需要近期資料」,一般題走便宜設定,新聞題才切到較深的設定並加上時間範圍,最後把日期與來源一起顯示給使用者。

速度與成本怎麼看

  • 看 p50 也要看 p95。 中位數看起來快,不代表偶爾不會慢:上面兩種深度的 p95 都比 p50 慢約 2 秒。搜尋通常在模型回答前完成,這段等待會直接加進使用者感受到的回覆時間。
  • 成本要連同模型 token 一起算。 搜尋費用只是一部分,把 5 筆結果塞進提示詞會增加輸入 token,這筆也要算進每次回答的成本。
  • 先估用量再決定方案。 很多團隊實際的搜尋量遠低於預期,免費額度就夠用。先量一個月真實的搜尋次數,再決定要不要付費升級。

給你的評估清單

  1. 先寫 20–30 題你自己的題庫,涵蓋你的語言、你的領域,並標出哪些題需要近期資料。
  2. 先寫好 rubric(什麼算相關、什麼算錯),再開始測。
  3. 每個設定用同一份題庫跑一次,保存原始回應。
  4. 分開看一般題與新聞題,分開看不同語言。
  5. 同時記錄 p50、p95 與每次費用。
  6. 結果只代表這次的題庫:題庫一換、搜尋 API 改版,就要重測。

常見問題

AI 搜尋 API 和一般搜尋引擎有什麼不同?

搜尋引擎的結果是給人看的頁面;搜尋 API 回傳的是給程式用的結構化資料(網址、標題、內容摘要、日期),方便直接放進模型的提示詞。

為什麼不直接讓模型「自己上網」?

模型本身不能連網。要讓它查資料,必須由你的程式或平台代為呼叫搜尋 API,再把結果交給模型,這也是為什麼「查得準不準」取決於搜尋 API,而不只是模型。

這份測試結果可以直接當作選購依據嗎?

不建議。這是一次 30 題的受控測試,適合用來學習評估方法與觀察取捨,不是所有語言、地區、題型的永久排名。請用自己的題庫重測。

我想讓模型的回答帶上網路資料,有更簡單的方式嗎?

有。BazaarLink 支援網路搜尋(:online),不需要自己串搜尋 API,詳見網路搜尋功能說明。

測試條件(供重現)

  • 30 題固定題庫(25 繁中、5 英文;8 題需要近期資料),題庫與 rubric 於測試前存檔。
  • 每題每個設定各查一次,每次要求 5 筆結果,並發上限 2,逾時 30 秒,不重試。
  • 評分:固定評審模型、固定提示詞,0–5 分。
  • 費用為 BazaarLink 網路搜尋的客戶價(以 2026 年 9 月 29 日的定價計),延遲為測試當下的實測值,僅供參考,不代表任何服務水準承諾。
  • 新聞模式補測:對 8 題近期題加入新聞主題與時間範圍(最近一週或一個月)。
  • 測試日期:2026 年 9 月 28 日。
立即體驗 BazaarLink

台幣計費・統一發票・主流 AI 模型・OpenAI 相容 API

免費註冊 / 登入企業採購洽詢
相關文章
Syrtis · Claude Code · Codex · token 用量 · 開源工具
Claude Code、Codex 用量費用怎麼看?開源 Syrtis 選單列監控介紹
Codex · 用量上限 · API 計費
Codex 額度與用量上限:怎麼查、何時重置,以及用完後怎麼辦
Google Antigravity · antigravity · anti gravity · AI agent · AI 開發工具
Google Antigravity 入門:從安裝到第一次 Agent 任務
客服
客服
您好!有什麼可以協助?
請留下訊息,我們會盡快回覆。