BazaarLinkBazaarLink
Anmelden
DokumentationAPI-ReferenzSDK-ReferenzAgentic-NutzungKI-Skills
Websuche

Webseiten crawlen

Erkunden Sie ab einer Stamm-URL den Linkgraphen einer Website und extrahieren Sie erfolgreiche Seiten. Authentifizieren Sie sich mit einem Bearer-API-Schlüssel oder übergeben Sie api_key als Kompatibilitätsfallback im JSON-Body; beide Basis-URLs werden unterstützt: https://api.bazaarlink.ai/v1 und https://bazaarlink.ai/api/v1. Unbekannte Felder werden ignoriert. Die Antwort enthält erfolgreiche Seiten, response_time, usage.credits, unser additives usage.cost (Credits mal vom Administrator festgelegter Preis pro Credit) und request_id. Tavily erlaubt timeout von 10 bis 150 Sekunden, aber das effektive Maximum bei BazaarLink beträgt 90 Sekunden; höhere Werte werden auf 90 gesenkt, damit das 100-Sekunden-Edge-Limit eingehalten wird. Die Abrechnung besteht aus Mapping- plus Extraktionskosten: 10 erfolgreiche Basic-Seiten kosten 1 + 2 = 3 Credits; advanced extraction verdoppelt den Extraktionsanteil und instructions den Mapping-Anteil. Fehlgeschlagene Seiten sind kostenlos. Tatsächliche Credits werden dem gemeinsamen täglichen Freikontingent entnommen; überschreitet die Schätzung aus limit den Rest, wird der Überschuss vom Guthaben abgerechnet oder ohne Guthaben mit 432 zurückgewiesen und ein kleineres limit empfohlen. SDK-Beispiele; speichern Sie den Schlüssel in einer Umgebungsvariable oder einer anderen sicheren serverseitigen Einstellung. Python: from tavily import TavilyClient client = TavilyClient(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = client.crawl("docs.tavily.com", instructions="Find Python SDK pages") JavaScript: import { tavily } from "@tavily/core" const tvly = tavily({ apiKey: process.env.BAZAARLINK_API_KEY, apiBaseURL: "https://api.bazaarlink.ai/v1" }) const response = await tvly.crawl("docs.tavily.com", { instructions: "Find Python SDK pages" }) LangChain (crawl only): from langchain_tavily import TavilyCrawl tool = TavilyCrawl(api_key="...", api_base_url="https://api.bazaarlink.ai/v1") response = tool.invoke({"url": "docs.tavily.com", "instructions": "Find Python SDK pages"})

POST/v1/crawl

Autorisierung

Authorizationerforderlich
string · header

API-Schlüssel als Bearer-Token im Authorization-Header.

Body

urlerforderlich
string

Stamm-URL für den Crawl; das Schema ist optional, zum Beispiel docs.tavily.com.

required; scheme optional
Example: "docs.tavily.com"
instructions
string

Natürlichsprachige Crawl-Anweisungen. Wenn gesetzt, ist chunks_per_source verfügbar und der Mapping-Anteil kostet 2 Credits je 10 erfolgreiche Seiten.

Example: "Find Python SDK pages"
chunks_per_source
integer

Maximale kurze Inhaltsabschnitte je Quelle; nur mit instructions verfügbar, 1 bis 5, Standard 3.

1-5; only with instructions; default: 3
Example: 3
max_depth
integer

Maximale Crawl-Tiefe, 1 bis 5, Standard 1.

1-5; default: 1
Example: 1
max_breadth
integer

Maximale Anzahl verfolgter Links je Seite und Ebene, 1 bis 500, Standard 20.

1-500; default: 20
Example: 20
limit
integer

Gesamtzahl der Links bis zum Stopp; mindestens 1, Standard 50.

minimum: 1; default: 50
Example: 50
select_paths
string[]

Regex-Muster für Pfadauswahl; höchstens 50 Einträge, jedes Muster maximal 200 Zeichen.

max 50 entries; max 200 characters per regex
Example: ["^/docs/.*"]
select_domains
string[]

Regex-Muster für Domainauswahl; höchstens 50 Einträge, jedes Muster maximal 200 Zeichen.

max 50 entries; max 200 characters per regex
Example: ["^docs\.example\.com$"]
exclude_paths
string[]

Regex-Muster für Pfadausschluss; höchstens 50 Einträge, jedes Muster maximal 200 Zeichen.

max 50 entries; max 200 characters per regex
Example: ["^/private/.*"]
exclude_domains
string[]

Regex-Muster für Dom Ausschluss; höchstens 50 Einträge, jedes Muster maximal 200 Zeichen.

max 50 entries; max 200 characters per regex
Example: ["^private\.example\.com$"]
allow_external
boolean

Ob Links externer Domains in die Ergebnisse aufgenommen werden; Standard true.

default: true
Example: true
include_images
boolean

Ob aus Seiten extrahierte Bilder enthalten werden; Standard false.

default: false
Example: false
extract_depth
string

Extraktionstiefe. advanced verarbeitet mehr Tabellen und eingebettete Inhalte und verdoppelt den Extraktionsanteil je 5 erfolgreiche Seiten.

default: basic
basicadvanced
Example: "basic"
format
string

Format des extrahierten Seiteninhalts: markdown oder Text, Standard markdown.

default: markdown
markdowntext
Example: "markdown"
include_favicon
boolean

Ob für jedes Ergebnis eine Favicon-URL enthalten wird; Standard false.

default: false
Example: false
timeout
number

Wartezeit für den Crawl in Sekunden. Tavily erlaubt 10–150, BazaarLinks effektives Maximum ist 90; höhere Werte werden auf 90 gesenkt.

Tavily: 10-150; BazaarLink default/effective maximum: 90 seconds; values above 90 are lowered to 90
Example: 90
include_usage
boolean

Ob usage in der Antwort enthalten ist; Standard false, mit credits und usage.cost bei true.

default: false
Example: false
POST /v1/crawl
curl https://api.bazaarlink.ai/v1/crawl   -H "Authorization: Bearer $BAZAARLINK_API_KEY"   -H "Content-Type: application/json"   -d '{
    "url": "docs.tavily.com",
    "instructions": "Find Python SDK pages",
    "limit": 20,
    "timeout": 90,
    "include_usage": true
  }'
Antwortbeispiele

Crawl abgeschlossen. results enthält erfolgreiche Seiten; usage.credits sind die tatsächlichen Credits und usage.cost ist der Kundenpreis nach dem vom Administrator festgelegten Satz.

{
  "base_url": "docs.tavily.com",
  "results": [
    {
      "url": "https://docs.tavily.com/welcome",
      "raw_content": "Welcome to the docs",
      "favicon": "https://docs.tavily.com/favicon.ico"
    }
  ],
  "response_time": 1.23,
  "usage": {
    "credits": 3,
    "cost": 0.03
  },
  "request_id": "crawl_123e4567-e89b-12d3-a456-426614174111"
}
Support
Support
Hi! How can we help you?
Send a message and we'll get back to you soon.