Thu thập trang web
Khám phá đồ thị liên kết của website từ URL gốc và trích xuất nội dung của các trang thành công. Xác thực bằng Bearer API key hoặc truyền api_key trong JSON body làm phương án tương thích; hỗ trợ cả https://api.bazaarlink.ai/v1 và https://bazaarlink.ai/api/v1. Trường không nhận biết sẽ bị bỏ qua. Phản hồi gồm các trang thành công, response_time, usage.credits, usage.cost bổ sung của chúng tôi (credit nhân với đơn giá mỗi credit do quản trị viên đặt) và request_id. Tavily cho timeout 10–150 giây, nhưng giới hạn hiệu dụng của BazaarLink là 90 giây; giá trị trên 90 sẽ được hạ xuống 90 để nằm dưới giới hạn edge 100 giây. Chi phí là phần mapping cộng phần extraction: 10 trang basic thành công tốn 1 + 2 = 3 credit; advanced extraction nhân đôi phần extraction, còn instructions nhân đôi phần mapping. Trang thất bại được miễn phí. Credit thực tế trừ từ hạn mức miễn phí hằng ngày dùng chung; nếu ước tính theo limit vượt phần còn lại, phần vượt được tính vào số dư, hoặc trả 432 khi không có số dư và khuyên giảm limit. Ví dụ SDK; hãy giữ khóa trong biến môi trường hoặc một cấu hình an toàn phía máy chủ khác. Python: from tavily import TavilyClient client = TavilyClient(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = client.crawl("docs.tavily.com", instructions="Find Python SDK pages") JavaScript: import { tavily } from "@tavily/core" const tvly = tavily({ apiKey: process.env.BAZAARLINK_API_KEY, apiBaseURL: "https://api.bazaarlink.ai/v1" }) const response = await tvly.crawl("docs.tavily.com", { instructions: "Find Python SDK pages" }) LangChain (crawl only): from langchain_tavily import TavilyCrawl tool = TavilyCrawl(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = tool.invoke({"url": "docs.tavily.com", "instructions": "Find Python SDK pages"})
/v1/crawlXác thực
Authorizationbắt buộcAPI key dưới dạng bearer token trong header Authorization.
Body
urlbắt buộcURL gốc để thu thập; có thể bỏ scheme, ví dụ docs.tavily.com.
"docs.tavily.com"instructionsChỉ dẫn bằng ngôn ngữ tự nhiên; khi có, chunks_per_source khả dụng và phần mapping tốn 2 credit cho mỗi 10 trang thành công.
"Find Python SDK pages"chunks_per_sourceSố đoạn nội dung ngắn tối đa mỗi nguồn; chỉ dùng khi có instructions, từ 1 đến 5, mặc định 3.
3max_depthĐộ sâu thu thập tối đa, từ 1 đến 5, mặc định 1.
1max_breadthSố liên kết tối đa theo mỗi trang ở mỗi cấp, từ 1 đến 500, mặc định 20.
20limitTổng số liên kết xử lý trước khi dừng; tối thiểu 1, mặc định 50.
50select_pathsMảng mẫu regex cho chọn đường dẫn; tối đa 50 mục, mỗi mẫu dài tối đa 200 ký tự.
["^/docs/.*"]select_domainsMảng mẫu regex cho chọn miền; tối đa 50 mục, mỗi mẫu dài tối đa 200 ký tự.
["^docs\.example\.com$"]exclude_pathsMảng mẫu regex cho loại trừ đường dẫn; tối đa 50 mục, mỗi mẫu dài tối đa 200 ký tự.
["^/private/.*"]exclude_domainsMảng mẫu regex cho loại trừ miền; tối đa 50 mục, mỗi mẫu dài tối đa 200 ký tự.
["^private\.example\.com$"]allow_externalCó đưa liên kết ngoài miền vào kết quả cuối hay không, mặc định true.
trueinclude_imagesCó đưa hình ảnh trích xuất từ trang vào hay không, mặc định false.
falseextract_depthĐộ sâu trích xuất. advanced xử lý thêm bảng/nội dung nhúng và nhân đôi phần credit trích xuất cho mỗi 5 trang thành công.
basicadvanced"basic"formatĐịnh dạng nội dung trang: markdown hoặc văn bản thuần, mặc định markdown.
markdowntext"markdown"include_faviconCó đưa URL favicon vào mỗi kết quả hay không, mặc định false.
falsetimeoutSố giây chờ crawl. Tavily cho phép 10–150 nhưng giới hạn hiệu dụng của BazaarLink là 90 giây; giá trị trên 90 được hạ xuống 90.
90include_usageCó đưa usage vào phản hồi hay không, mặc định false; khi có sẽ có credits và usage.cost.
false