爬取網頁
從根網址探索網站連結圖並擷取內容。使用 Bearer API 金鑰,或將 api_key 放在 JSON body 作為相容性回退;支援 https://api.bazaarlink.ai/v1 與 https://bazaarlink.ai/api/v1。未知欄位會被忽略。回應包含成功頁面、response_time、usage.credits、我們加上的 usage.cost(依管理員設定的每 credit 價格計算)與 request_id。Tavily 的 timeout 範圍是 10–150 秒,但 BazaarLink 的有效上限是 90 秒;高於 90 的值會被降低到 90,以維持在邊緣代理 100 秒限制以下。 計費為 mapping 成本加 extraction 成本:10 個 basic 成功頁面是 1 + 2 = 3 credits;advanced extraction 使 extraction 部分加倍,instructions 使 mapping 部分加倍。失敗頁面不收費。實際 credits 會從共用每日免費額度扣除;若依 limit 預估超過剩餘額度,超出部分從餘額收費,無餘額則回傳 432 並建議降低 limit。 SDK 範例;請將金鑰放在環境變數或其他安全的伺服器端設定中。 Python: from tavily import TavilyClient client = TavilyClient(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = client.crawl("docs.tavily.com", instructions="Find Python SDK pages") JavaScript: import { tavily } from "@tavily/core" const tvly = tavily({ apiKey: process.env.BAZAARLINK_API_KEY, apiBaseURL: "https://api.bazaarlink.ai/v1" }) const response = await tvly.crawl("docs.tavily.com", { instructions: "Find Python SDK pages" }) LangChain (crawl only): from langchain_tavily import TavilyCrawl tool = TavilyCrawl(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = tool.invoke({"url": "docs.tavily.com", "instructions": "Find Python SDK pages"})
/v1/crawl驗證
Authorization必填在 Authorization 標頭以 Bearer token 傳入 API 金鑰。
Body
url必填要開始爬取的根網址;可省略 scheme,例如 docs.tavily.com。
"docs.tavily.com"instructions告訴爬蟲要尋找的內容;提供後可使用 chunks_per_source,並使每 10 個成功頁面的 mapping 成本變為 2 credits。
"Find Python SDK pages"chunks_per_source每個來源最多保留的短內容片段數;只有提供 instructions 時可用,範圍 1–5,預設 3。
3max_depth爬取深度,範圍 1–5,預設 1。
1max_breadth每一層每頁最多跟隨的連結數,範圍 1–500,預設 20。
20limit在停止前最多處理的連結總數,至少 1,預設 50。
50select_paths選取路徑 的正規表示式陣列;最多 50 個項目,每個正規表示式最多 200 個字元。
["^/docs/.*"]select_domains選取網域 的正規表示式陣列;最多 50 個項目,每個正規表示式最多 200 個字元。
["^docs\.example\.com$"]exclude_paths排除路徑 的正規表示式陣列;最多 50 個項目,每個正規表示式最多 200 個字元。
["^/private/.*"]exclude_domains排除網域 的正規表示式陣列;最多 50 個項目,每個正規表示式最多 200 個字元。
["^private\.example\.com$"]allow_external是否將外部網域連結納入結果,預設 true。
trueinclude_images是否擷取頁面中的圖片,預設 false。
falseextract_depth擷取深度;advanced 可處理更多表格與嵌入內容,並使每 5 個成功擷取的頁面擷取成本加倍。
basicadvanced"basic"format擷取內容格式:markdown 或純文字,預設 markdown。
markdowntext"markdown"include_favicon是否在每筆結果加入 favicon URL,預設 false。
falsetimeout等待爬取完成的秒數。Tavily 範圍是 10–150,但 BazaarLink 有效上限為 90 秒;超過 90 會降為 90。
90include_usage是否在回應中包含 usage,預設 false;包含時會顯示 credits 與 usage.cost。
false