웹페이지 크롤링
루트 URL에서 웹사이트 링크 그래프를 탐색하고 성공한 페이지의 콘텐츠를 추출합니다. Bearer API 키 또는 호환성을 위해 JSON body의 api_key를 사용할 수 있으며 https://api.bazaarlink.ai/v1과 https://bazaarlink.ai/api/v1을 모두 지원합니다. 알 수 없는 필드는 무시됩니다. 응답에는 성공한 페이지, response_time, usage.credits, 관리자가 설정한 credit당 가격을 곱한 추가 필드 usage.cost, request_id가 포함됩니다. Tavily timeout 범위는 10~150초지만 BazaarLink의 유효 최대값은 90초입니다. 90초를 넘는 값은 90초로 낮춰 100초 엣지 제한보다 짧게 유지합니다. 요금은 mapping 비용과 extraction 비용의 합입니다. basic 성공 페이지 10개는 1 + 2 = 3 credit이며 advanced extraction은 extraction 부분을, instructions는 mapping 부분을 두 배로 합니다. 실패한 페이지는 무료입니다. 실제 credit은 공유 일일 무료 한도에서 차감됩니다. limit으로 계산한 예상치가 잔여 한도를 넘으면 초과분은 잔액에서 청구하고, 잔액이 없으면 432를 반환하며 limit을 낮추도록 안내합니다. SDK 예시입니다. 키는 환경 변수나 안전한 서버 측 설정에 보관하세요. Python: from tavily import TavilyClient client = TavilyClient(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = client.crawl("docs.tavily.com", instructions="Find Python SDK pages") JavaScript: import { tavily } from "@tavily/core" const tvly = tavily({ apiKey: process.env.BAZAARLINK_API_KEY, apiBaseURL: "https://api.bazaarlink.ai/v1" }) const response = await tvly.crawl("docs.tavily.com", { instructions: "Find Python SDK pages" }) LangChain (crawl only): from langchain_tavily import TavilyCrawl tool = TavilyCrawl(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = tool.invoke({"url": "docs.tavily.com", "instructions": "Find Python SDK pages"})
/v1/crawl인증
Authorization필수Authorization 헤더에 Bearer 토큰으로 API 키를 전달합니다.
Body
url필수크롤링을 시작할 루트 URL입니다. scheme은 생략할 수 있으며 예: docs.tavily.com.
"docs.tavily.com"instructions크롤링에 대한 자연어 지시입니다. 지정하면 chunks_per_source를 사용할 수 있고 성공 페이지 10개당 mapping 부분이 2 credit입니다.
"Find Python SDK pages"chunks_per_source소스당 최대 짧은 콘텐츠 청크 수입니다. instructions가 있을 때만 사용하며 1~5, 기본값 3입니다.
3max_depth최대 크롤링 깊이로 1~5, 기본값은 1입니다.
1max_breadth각 단계에서 페이지당 따라갈 최대 링크 수로 1~500, 기본값 20입니다.
20limit중지하기 전에 처리할 총 링크 수로 최소 1, 기본값 50입니다.
50select_paths경로 선택에 사용할 정규식 배열입니다. 최대 50개이며 각 패턴은 200자까지입니다.
["^/docs/.*"]select_domains도메인 선택에 사용할 정규식 배열입니다. 최대 50개이며 각 패턴은 200자까지입니다.
["^docs\.example\.com$"]exclude_paths경로 제외에 사용할 정규식 배열입니다. 최대 50개이며 각 패턴은 200자까지입니다.
["^/private/.*"]exclude_domains도메인 제외에 사용할 정규식 배열입니다. 최대 50개이며 각 패턴은 200자까지입니다.
["^private\.example\.com$"]allow_external외부 도메인 링크를 최종 결과에 포함할지 여부이며 기본값은 true입니다.
trueinclude_images페이지에서 추출한 이미지를 포함할지 여부이며 기본값은 false입니다.
falseextract_depth추출 깊이입니다. advanced는 더 많은 표와 임베디드 콘텐츠를 처리하며 성공 페이지 5개당 추출 credit 부분을 두 배로 합니다.
basicadvanced"basic"format추출된 페이지 콘텐츠 형식으로 markdown 또는 text이며 기본값은 markdown입니다.
markdowntext"markdown"include_favicon각 결과에 favicon URL을 포함할지 여부이며 기본값은 false입니다.
falsetimeout크롤링을 기다릴 시간(초)입니다. Tavily 범위는 10~150이지만 BazaarLink 유효 최대값은 90초이며 90 초과 값은 90으로 낮춥니다.
90include_usage응답에 usage를 포함할지 여부이며 기본값은 false입니다. 포함하면 credits와 usage.cost가 표시됩니다.
false