Chat erstellen
Fordert eine Modellantwort für die angegebene Chat-Konversation an. Unterstützt sowohl Streaming- als auch Nicht-Streaming-Modi, mit einer OpenAI-kompatiblen Anfrage-/Antwortform über alle Modelle und Anbieter hinweg.
/api/v1/chat/completionsAutorisierung
AuthorizationerforderlichAPI-Schlüssel als Bearer-Token im Authorization-Header.
Body
modelerforderlichDas zu verwendende Modell, mit Provider-Präfix, z. B. "openai/gpt-4.1". Kurz-IDs gängiger Modellfamilien (z. B. "gpt-4o") werden automatisch zur vollständigen kanonischen ID ("openai/gpt-4o") aufgelöst; bereits kanonische Werte werden unverändert durchgereicht. Eine nicht erkannte Kurz-ID wird nicht zwangsweise umgeschrieben — die Modellauflösung liefert stattdessen einen klaren Model-not-found-Fehler.
"openai/gpt-4.1"messageserforderlichArray von Konversationsnachrichten, mindestens eine. Jede hat eine role (system/user/assistant/tool) und content.
modelsFallback-Modellliste — wird der Reihe nach versucht, nur verwendet, wenn die Kandidatengruppe des primären Modells erschöpft ist.
streamtrue streamt die Antwort als SSE; weggelassen oder false liefert eine einzelne JSON-Antwort.
temperatureSampling-Temperatur — höher ist zufälliger, niedriger ist deterministischer.
max_tokensMaximale Anzahl an Tokens, die die Antwort generieren darf.
max_completion_tokensAlias von max_tokens mit identischer Semantik.
top_pNucleus-Sampling-Schwellenwert.
top_kBegrenzt das Sampling auf die K wahrscheinlichsten Tokens.
frequency_penaltyBestraft Tokens basierend darauf, wie oft sie bereits aufgetreten sind.
presence_penaltyBestraft Tokens basierend darauf, ob sie überhaupt aufgetreten sind, unabhängig von der Anzahl.
repetition_penaltyWiederholungsstrafkoeffizient — ein separater Mechanismus von frequency/presence penalty.
min_pMindestwahrscheinlichkeitsschwelle relativ zum wahrscheinlichsten Token.
top_aEin weiterer dynamischer Cutoff-Sampling-Mechanismus, der den Schwellenwert durch das Quadrat der höchsten Wahrscheinlichkeit skaliert.
seedDeterministischer Sampling-Seed; nicht alle Provider garantieren Reproduzierbarkeit.
nAnzahl der zu generierenden Antworten.
stopSequenzen, bei denen die Generierung stoppt, bis zu 4.
toolsListe der Tool-/Funktionsdefinitionen, die das Modell aufrufen kann.
tool_choiceSteuert, ob/wie das Modell zum Aufrufen eines Tools gezwungen wird.
parallel_tool_callsOb parallele Tool-Aufrufe erlaubt sind, wenn tools bereitgestellt werden. Standard true. Nur für Modelle der OpenAI-Familie — wird stillschweigend entfernt, wenn das Zielmodell nicht von OpenAI stammt, kein Fehler.
response_formatSchränkt das Ausgabeformat ein, z. B. {type:"json_object"} oder {type:"json_schema"} mit einem JSON Schema.
logit_biasOrdnet Token-IDs Bias-Werten [-100, 100] zu, die vor dem Sampling addiert werden. Nur für Modelle der OpenAI-Familie — wird stillschweigend entfernt, wenn das Zielmodell nicht von OpenAI stammt, kein Fehler.
logprobsGibt Log-Wahrscheinlichkeiten jedes Ausgabe-Tokens zurück. Nur für Modelle der OpenAI-Familie — wird stillschweigend entfernt, wenn das Zielmodell nicht von OpenAI stammt, kein Fehler.
top_logprobsAnzahl der wahrscheinlichsten zurückzugebenden Tokens pro Position (erfordert logprobs: true). Nur für Modelle der OpenAI-Familie — wird stillschweigend entfernt, wenn das Zielmodell nicht von OpenAI stammt, kein Fehler.
userEndbenutzer-Kennung für Überwachung und Missbrauchserkennung. Hat keine Auswirkung auf die Abrechnung. Nur für Modelle der OpenAI-Familie — wird stillschweigend entfernt, wenn das Zielmodell nicht von OpenAI stammt, kein Fehler.
reasoningDenk-Steuerungsobjekt für Reasoning-Modelle (z. B. {effort, max_tokens}).
reasoning_effortFlaches Kurzformfeld für reasoning.effort.
lowmediumhighimage_configOptionen für Bildgenerierung/-bearbeitung (verwendet, wenn modalities image enthält).
modalitiesAngeforderte Ausgabemodalitäten. Bei image erfolgt Routing über den Bildgenerierungs-Dispatch-Pfad.
textimagepluginsArray von Plugins (z. B. {id:"web"} für Websuche). Nur auf manchen Modellrouten unterstützt, sonst wirkungslos; die Modellvariante :online injiziert automatisch {id:"web"}, ebenfalls nur auf unterstützenden Routen.