AI検索APIの仕組みと評価方法:30問の実測で解説
AI検索APIはモデルに最新情報を渡す仕組みです。30問の固定問題で実測し、動作の流れ、深度とニュースモードの違い、速度とコストの見方を解説します。
大規模言語モデルの知識は学習データの締め切り日で止まっています。「先週のニュース」や「今月公布された法令」のような質問には、推測でしか答えられません。この穴を埋めるのが AI検索API です。モデルの代わりにWebを検索し、整理した結果をモデルに渡して回答させます。
この記事では、検索APIが1回の会話の中で実際にどう動くのかと、固定問題セットで実測して分かった「検索APIの評価のしかた」をまとめます。記事中の数字はすべて同じ管理されたテストから得たもので、条件は末尾に記載しています。ご自身で再現するときの参考にしてください。
AI検索APIの仕組み
検索付きの会話は、おおむね次の4ステップです。
- 検索が必要か判断する:モデル(またはアプリ側のコード)が質問を見て、最新情報が要るか決めます。
- クエリを送る:質問を検索語に書き換え、検索APIを呼びます。通常は取得件数を指定します。
- 結果を受け取る:URL、タイトル、本文の抜粋が返ります。公開日が付くものもあります。
- モデルに渡す:結果をプロンプトに入れ、出典付きで回答させます。
通常のWeb検索と違い、結果を読むのは人ではなくプログラムです。そのため評価すべきなのは見た目ではなく、見つかった内容が関連しているか、新しいか、モデルがそのまま引用できるかの3点になります。
検索APIを自分で組み込まなくても、回答にWeb情報を加えたい場合は、BazaarLinkのWeb検索(:online)が使えます。詳しくはWeb検索の説明ページをご覧ください。
検索APIの評価方法:問題を固定し、採点基準を先に決めてから測る
検索APIの比較でよくある失敗は、「何問か試して、こちらのほうが正確そうだ」と判断することです。これでは再現できず、印象に残った一、二問に引きずられます。今回は次の方針で行いました。
- 問題はテスト前に固定して保存:全30問で、繁体字中国語25問、英語5問。台湾のニュース、法規、行政のお知らせ、医療情報、学術、地域の店舗や地名を含みます。うち8問は「最新情報が必要」と分類しました。途中で問題は入れ替えません。
- 1問につき設定ごとに1回だけ実行:再試行なし、結果の取捨選択なし。同時実行は最大2、1回あたり30秒でタイムアウト、毎回5件を要求します。
- 採点基準(ルーブリック)を先に作成:1問ごとに0〜5点の基準を用意し、同じ固定の評価モデルと同じプロンプトで1件ずつ採点します。
- すべての数字に生データを残す:検索レスポンス、採点レスポンス、コストを1件ずつ保存し、後から検証できるようにします。
ポイントは「再現できること」です。別の検索APIや別の設定に替えても、同じ問題とルーブリックで再実行すれば、並べて比較できる数字が得られます。
検索の深さ:コスト2倍で何が変わるか
多くの検索APIには「検索の深さ」の設定があります。浅いほうが速くて安く、深いほうはコンテンツの抽出を1段階多く行います。今回は同じ検索APIで2つの深さ(下表では「標準」と「詳細」)を比べました。一般の30問の結果は次のとおりです。
| 標準 | 詳細 | |
|---|---|---|
| 呼び出し成功 | 30/30 | 30/30 |
| 関連性の平均(0〜5) | 3.260 | 3.153 |
| レイテンシ p50 | 1,998 ms | 5,061 ms |
| レイテンシ p95 | 4,033 ms | 7,014 ms |
| 1回あたりの検索費用(BazaarLinkの顧客価格) | 約 $0.0096 | 約 $0.0192 |
この問題セットでは、詳細のほうが平均関連性が高くなることはなく、時間と費用は約2倍かかりました。「深いほど良い」は初期値にすべきではありません。まず安い設定で自分の問題を試し、足りないと分かってから上げるのが順序です。
言語による差もあります。標準は繁体字中国語の問題で3.392、英語の問題で2.600。詳細は3.200と2.920でした。ユーザーが主に使う言語の問題でテストする必要があり、他人の英語の結果から日本語や中国語の性能を推測してはいけません。また、繁体字中国語の問題では結果の96%が台湾または繁体字中国語のソースでしたが、英語の問題では24%でした。地域のソースが必要な場合は、この点を別に確認してください。
ニュースモード:日付が取れることと、正しく答えられることは別
「先週何があったか」を尋ねるとき、検索APIで最も厄介なのは鮮度です。最新情報が必要な8問を、2つの条件で試しました。
通常モード:300件の結果のうち、解析可能な公開日が付いたものは1件もありませんでした。内容が古いという意味ではありませんが、データだけでは新旧を判断できず、プログラムでの絞り込みもできません。
ニュースモード+期間指定(直近1週間または1か月):日付が使えるようになり、日付付きの結果はすべて30日以内でした。しかし関連性には大きな差が出ました。
| 標準 | 詳細 | |
|---|---|---|
| 公開日付きの結果 | 36/40 | 34/40 |
| 関連性の平均(0〜5、8問) | 0.475 | 1.900 |
| 台湾/繁体字中国語ソースの割合 | 37.5% | 82.5% |
ポイントは2つです。
- 日付があっても役に立つとは限らない。 標準では結果の90%に日付がありましたが、台湾のニュース問題の多くで無関係な海外ニュースが返り、関連性は0.475でした。
- ニュース系の問題は一般の問題と分けて評価する。 詳細はニュース問題で明らかに良い(1.900)ものの、一般問題の3点台には届きません。鮮度が必要な質問は想像以上に難しく、日付欄に値があるだけで解決したと考えないでください。
実務では、まずコードで「最新情報が必要な質問か」を判定し、一般の質問は安い設定、ニュースの質問だけ深い設定に切り替えて期間を指定し、日付と出典をあわせてユーザーに表示する構成が現実的です。
速度とコストの見方
- p50だけでなくp95も見る。 中央値が速くても、遅いケースはあります。上の2つの深さでは、p95はp50より約2秒遅くなりました。検索はモデルの回答前に終わるので、この待ち時間はそのままユーザーの体感の応答時間に加わります。
- モデルのトークン費用も合算する。 検索費用は一部にすぎません。5件の結果をプロンプトに入れると入力トークンが増え、その分も1回の回答コストに入ります。
- 利用量を見積もってからプランを決める。 実際の検索回数が想定よりずっと少なく、無料枠で足りるケースは多くあります。まず1か月分の実際の検索回数を計測してから、有料に上げるか決めてください。
評価チェックリスト
- 自分の問題を20〜30問作る。自分の言語・分野を含め、最新情報が必要な問題に印を付ける。
- 何が関連あり/なしかのルーブリックを先に書いてから測る。
- 設定ごとに同じ問題セットで1回実行し、生のレスポンスを保存する。
- 一般の問題とニュースの問題、言語ごとに分けて見る。
- p50、p95、1回あたりの費用を同時に記録する。
- 結果はそのときの問題セットだけを表す。問題やAPIが変わったら再テストする。
よくある質問
AI検索APIは通常の検索エンジンと何が違いますか?
検索エンジンの結果は人が読むページですが、検索APIはプログラム向けの構造化データ(URL、タイトル、本文の抜粋、日付)を返すため、モデルのプロンプトにそのまま入れられます。
モデルが「自分でWebを見る」ことはできないのですか?
モデル自体はネットに接続できません。アプリやプラットフォームが検索APIを呼び、結果をモデルに渡す必要があります。そのため、検索の精度は、モデルだけでなく検索APIにも左右されます。
このテスト結果をそのまま選定の根拠にしてよいですか?
おすすめしません。30問の管理されたテストであり、評価方法の理解やトレードオフの把握に向いていますが、すべての言語・地域・質問タイプの恒久的なランキングではありません。自分の問題で再テストしてください。
回答にWeb情報を加える、もっと簡単な方法はありますか?
あります。BazaarLinkのWeb検索(:online)なら、検索APIを自分で組み込む必要はありません。詳しくはWeb検索の説明ページをご覧ください。
テスト条件(再現用)
- 固定30問(繁体字中国語25、英語5、うち8問が最新情報必須)。問題とルーブリックはテスト前に保存。
- 1問につき設定ごとに1回、毎回5件を要求。同時実行最大2、タイムアウト30秒、再試行なし。
- 採点:固定の評価モデル・固定プロンプトで0〜5点。
- 費用はBazaarLinkのWeb検索の顧客価格(2026年9月29日時点)、レイテンシはテスト時の実測値であり、参考値です。いかなるサービス水準の保証でもありません。
- ニュースモードの追試:最新情報が必要な8問にニューストピックと期間(直近1週間または1か月)を指定。
- テスト日:2026年9月28日。