爬取网页
从根 URL 探索网站链接图并提取成功页面的内容。支持 Bearer API 密钥,也支持将 api_key 放在 JSON body 中作为兼容性回退;https://api.bazaarlink.ai/v1 和 https://bazaarlink.ai/api/v1 均可使用。未知字段会被忽略。响应包含成功页面、response_time、usage.credits、我们附加的 usage.cost(credits 乘以管理员设置的每 credit 价格)和 request_id。Tavily 的 timeout 接受 10–150 秒,但 BazaarLink 的有效上限是 90 秒;超过 90 的值会降低到 90,以保持低于 100 秒的边缘代理限制。 计费为 mapping 成本加 extraction 成本:10 个 basic 成功页面是 1 + 2 = 3 credits;advanced extraction 会使 extraction 部分加倍,instructions 会使 mapping 部分加倍。失败页面免费。实际 credits 从共享的每日免费额度扣除;如果根据 limit 的估算超过剩余额度,超出部分从余额计费;没有余额则返回 432 并建议降低 limit。 SDK 示例;请将密钥放在环境变量或其他安全的服务端配置中。 Python: from tavily import TavilyClient client = TavilyClient(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = client.crawl("docs.tavily.com", instructions="Find Python SDK pages") JavaScript: import { tavily } from "@tavily/core" const tvly = tavily({ apiKey: process.env.BAZAARLINK_API_KEY, apiBaseURL: "https://api.bazaarlink.ai/v1" }) const response = await tvly.crawl("docs.tavily.com", { instructions: "Find Python SDK pages" }) LangChain (crawl only): from langchain_tavily import TavilyCrawl tool = TavilyCrawl(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = tool.invoke({"url": "docs.tavily.com", "instructions": "Find Python SDK pages"})
/v1/crawl验证
Authorization必填在 Authorization 标头以 Bearer token 传入 API 密钥。
Body
url必填开始爬取的根 URL;可以省略 scheme,例如 docs.tavily.com。
"docs.tavily.com"instructions告诉爬取器要查找的内容;提供后可使用 chunks_per_source,并使每 10 个成功页面的 mapping 部分变为 2 credits。
"Find Python SDK pages"chunks_per_source每个来源最多保留的短内容片段数;仅在提供 instructions 时可用,范围 1–5,默认 3。
3max_depth爬取深度,范围 1–5,默认 1。
1max_breadth每层每页最多跟随的链接数,范围 1–500,默认 20。
20limit停止前处理的链接总数,最小 1,默认 50。
50select_paths路径选择 的正则表达式数组;最多 50 个条目,每个表达式最多 200 个字符。
["^/docs/.*"]select_domains域名选择 的正则表达式数组;最多 50 个条目,每个表达式最多 200 个字符。
["^docs\.example\.com$"]exclude_paths路径排除 的正则表达式数组;最多 50 个条目,每个表达式最多 200 个字符。
["^/private/.*"]exclude_domains域名排除 的正则表达式数组;最多 50 个条目,每个表达式最多 200 个字符。
["^private\.example\.com$"]allow_external是否将外部域名链接纳入结果,默认 true。
trueinclude_images是否包含从页面提取的图片,默认 false。
falseextract_depth提取深度;advanced 可处理更多表格和嵌入内容,并使每 5 个成功页面的提取部分 credits 加倍。
basicadvanced"basic"format提取页面内容的格式:markdown 或纯文本,默认 markdown。
markdowntext"markdown"include_favicon是否在每条结果中包含 favicon URL,默认 false。
falsetimeout等待爬取完成的秒数。Tavily 范围为 10–150,但 BazaarLink 的有效上限是 90 秒;超过 90 会降低到 90。
90include_usage是否在响应中包含 usage,默认 false;包含时会显示 credits 和 usage.cost。
false