BazaarLinkBazaarLink
登入
文件API 参考SDK 参考Agent 应用AI Skills
网络搜索

提取网页内容

从单个 URL 或一次最多 20 个 URL 提取原始网页内容。成功的 URL 会出现在 results 中,每个 URL 的失败会出现在 failed_results 中;即使 HTTP 200 返回空的 results 数组,也必须检查这两个数组。输出顺序不保证。支持 query 重排、每个来源 1–5 个 chunks(仅在提供 query 时可用)、basic/advanced 提取、图片、favicon、markdown/text 格式,以及 1–60 秒的 timeout。未知请求字段会被忽略。 可以使用 Authorization: Bearer <key>,也可以为兼容 Tavily 在 JSON body 中传入 api_key。支持两个 BazaarLink base URL:https://api.bazaarlink.ai/v1 和 https://bazaarlink.ai/api/v1。每成功提取 5 个 URL,basic 收取 1 credit,advanced 收取 2 credits;失败 URL 免费。客户价格为 credits 乘以管理员设置的每 credit 价格,请查看 BazaarLink pricing page,并以响应中的 usage.cost 为准。免费额度与 search 共用每日 credits;每日免费额度用完且没有余额时返回 432。 cURL: `curl https://api.bazaarlink.ai/v1/extract -H "Authorization: Bearer $BAZAARLINK_API_KEY" -H "Content-Type: application/json" -d '{"urls":["https://example.com/article"]}'` Python: `TavilyClient(api_key=..., api_base_url="https://api.bazaarlink.ai/v1").extract(urls=[...])` JavaScript: `tavily({ apiKey, apiBaseURL })` LangChain: `TavilyExtract(api_base_url=...)`

POST/v1/extract

验证

Authorization必填
string · header

在 Authorization 标头以 Bearer token 传入 API 密钥。

Body

urls必填
string | string[]

要提取的 URL。可传单个字符串,或包含 1–20 个 URL 的数组。空数组或没有有效 URL 时返回 400。

string or array of 1–20 URLs
Example: ["https://example.com/article"]
query
string

用于重新排列提取内容块的用户意图。

Example: "key findings"
chunks_per_source
integer

每个来源返回的相关内容块数量上限。必须为 1–5,且仅在提供 query 时可用。

1–5; only with query
Example: 3
extract_depth
string

提取深度。advanced 可提取表格和嵌入内容,但延迟可能更高;basic 每 5 个成功 URL 收取 1 credit,advanced 收取 2 credits。

default: basic
basicadvanced
Example: "basic"
include_images
boolean

是否在每个成功结果中包含提取到的图片 URL。

default: false
Example: true
include_favicon
boolean

是否在每个成功结果中包含 favicon URL。

default: false
Example: true
format
string

提取内容的格式。markdown 保留 Markdown 结构,text 返回纯文本。

default: markdown
markdowntext
Example: "markdown"
timeout
number

等待提取完成的最长秒数,范围为 1–60。未指定时,basic 默认 10 秒,advanced 默认 30 秒。

1–60 seconds; default depends on extract_depth
Example: 30
include_usage
boolean

是否在响应中包含 credits 和 usage.cost。

default: false
Example: true
POST /v1/extract
curl https://api.bazaarlink.ai/v1/extract \
  -H "Authorization: Bearer $BAZAARLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "urls": ["https://example.com/article", "https://example.org/docs"],
    "query": "key findings",
    "chunks_per_source": 3,
    "extract_depth": "basic",
    "include_images": true,
    "include_favicon": true,
    "format": "markdown",
    "timeout": 30,
    "include_usage": true
  }'
响应示例

提取完成。请检查包含成功项目的 results 和包含每个 URL 失败情况的 failed_results。HTTP 200 可能返回空的 results 数组,输出顺序不保证。usage.credits 是 credit 用量;usage.cost 是 BazaarLink 向客户收取的美元价格,不是上游成本;request_id 是 BazaarLink 生成的请求 ID。

{
  "results": [
    {
      "url": "https://example.com/article",
      "raw_content": "Article content extracted as Markdown.",
      "images": [
        "https://example.com/image.jpg"
      ],
      "favicon": "https://example.com/favicon.ico"
    }
  ],
  "failed_results": [
    {
      "url": "https://example.org/unavailable",
      "error": "Failed to retrieve content"
    }
  ],
  "response_time": 0.42,
  "usage": {
    "credits": 1,
    "cost": 0
  },
  "request_id": "bl-extract-example-request"
}
客服
客服
您好!有什么可以协助?
请留下消息,我们会尽快回复。