Năng lực GPU của bạn
Model và suy luận ở lại trên thiết bị của bạn
Hoạt ảnh minh họa. Agent kết nối chiều đi ra gateway nên không cần mở cổng vào. Trước hết hãy gắn byoc/<slug> với ID mô hình cục bộ trong phần Liên kết mô hình.
Model và môi trường suy luận ở trên thiết bị của bạn. Agent nối vào gateway, gateway chuyển việc của tài khoản bạn tới node của bạn, còn ứng dụng giữ một API.
Model và suy luận ở lại trên thiết bị của bạn
Có thể tiếp quản khi node của bạn đầy hoặc offline, theo cài đặt dự phòng (giá nền tảng)
Không tính phí model BazaarLink cho lưu lượng do node riêng xử lý
Cùng một endpoint, không cần sửa ứng dụng
Chọn backend cục bộ chạy model rồi truyền cấu hình kết nối cho Agent.
Backend mặc định tại http://localhost:11434.
Dùng --backend openai và --url với model ID local.
Dùng streaming OpenAI-compatible mà không đổi tên model.
Bạn quản lý file model, suy luận, phần cứng và runtime local.
Với traffic do node BYOC của bạn xử lý, BazaarLink không thu phí model; nếu bạn dùng kèm tính năng của nền tảng như tìm kiếm web, tính năng đó được tính theo giá nền tảng. Thiết bị và vận hành vẫn do bạn phụ trách.
Model local đi qua gateway nên code sản phẩm không cần transport layer riêng cho từng backend. Node hiện nhận request cho /v1/chat/completions, /v1/responses, /v1/messages và tạo ảnh (/v1/images).
Tác vụ chỉ được giao cho node gắn với tài khoản hoặc tổ chức đó và không vào pool hay thị trường compute dùng chung.
Agent chuyển request tạo ảnh đến /images/generations của backend bạn.
tools và tool_choice được chuyển đến backend của bạn, còn tool_calls trả về theo định dạng OpenAI (backend OpenAI-compatible và Ollama).
Model suy luận trả về phần suy nghĩ trong trường reasoning_content.
Trong trang Cài đặt dự phòng, chọn khóa API BazaarLink nào dùng node này. Khi node đầy, offline hoặc lỗi, request sẽ thử nguồn tiếp theo theo thứ tự dự phòng; request do model của nền tảng xử lý được tính theo giá nền tảng.
Request do node của bạn xử lý cũng có thể thêm :online để model tìm trên web trước khi trả lời: việc tìm kiếm diễn ra ở phía nền tảng, rồi kết quả được gửi cùng câu hỏi đến node của bạn. Phí model bằng 0; chỉ thu phí tìm kiếm theo giá nền tảng, nên tài khoản cần đủ số dư.
You manage the local logs for BYOC; before a request reaches your GPU, the platform entry still applies moderation, and sensitive-data filtering is available as an opt-in.
Platform moderation runs at the API entry (/v1/chat/completions, /v1/responses) before the request is processed; BYOC cannot disable it. Blocked requests do not reach your node.
This is opt-in: organization keys use the organization rule, while personal keys are enabled by the key owner at /content-filter. Once enabled, inbound prompts replace API keys (OpenAI/Anthropic/GitHub/Google/AWS), JWTs, private keys, credit-card numbers, and Taiwan national ID numbers with [REDACTED:TYPE] before the node; prompt injection is blocked (403, code: content_filter).
Enable at /content-filter@bazaarlink/byoc-agent v0.2.0 dùng giấy phép MIT. Hãy cài CLI toàn cục từ GitHub công khai; phiên bản npm registry sẽ ra sau. Authenticated chỉ xác nhận kết nối gateway. Mở /keys/byok?tab=byoc, ánh xạ canonical API ID như byoc/<lowercase-slug> tới đúng model ID mà backend local của bạn chấp nhận, rồi gọi canonical ID đó qua API.
Cài CLI MIT toàn cục từ GitHub công khai.
npm install -g github:Bazaarlinkorg/bazaarlink-byoc-agentNếu chưa có key, dùng register với email tài khoản của bạn.
bazaarlink-byoc register \
--email you@example.com \
--max-concurrent 4login gọi /auth/byoc/login và lưu key cùng token ngắn hạn vào cấu hình local.
bazaarlink-byoc login \
--key "byoc_..." \
--gateway "https://byoc-gateway.bazaarlink.ai" \
--input-price 0 \
--output-price 0Authenticated chỉ xác nhận kết nối gateway. Mở /keys/byok?tab=byoc, ánh xạ canonical API ID như byoc/<lowercase-slug> tới đúng model ID mà backend local của bạn chấp nhận, rồi gọi canonical ID đó qua API.
bazaarlink-byoc start
# Authenticated only confirms the gateway connection.
# In /keys/byok?tab=byoc, map byoc/<lowercase-slug> to exact backend ID.Các giá trị này khớp với CLI và metadata package hiện tại. Trước khi có phiên bản npm registry, hãy cài từ GitHub công khai.
CLI được cài toàn cục từ GitHub công khai; phiên bản npm registry sẽ ra sau.
--backend ollama là mặc định; thêm --ollama-url nếu dùng địa chỉ khác.
LM Studio, vLLM và llama.cpp dùng --backend openai; --url là bắt buộc.
Bạn có GPU host và local model, muốn tự quản lý model cùng môi trường suy luận nhưng vẫn giữ điểm vào API quen thuộc cho sản phẩm.
Bạn không muốn cho thuê compute nhàn rỗi hoặc gửi request vào node dùng chung. BYOC nối thiết bị, tài khoản và gateway của bạn.
Chuẩn bị máy chạy model cục bộ và BYOC key để kiểm tra compute, node và một điểm vào API phối hợp.
Quản lý node BYOC