Redundanz und Failover
Die Completions-API kann automatisch von einem Modell auf ein anderes Failover durchführen, wenn ein Anbieteraufruf fehlschlägt. Sie definieren eine geordnete Kette – ein Primärmodell plus bis zu zwei Fallbacks – und SecureAI probiert sie nacheinander aus, bis eines erfolgreich ist. Dies gibt Ihnen Widerstandsfähigkeit gegen Anbieterausfälle, Ratenbegrenzungen und Zeitüberschreitungen, ohne dass Ihr eigener Code eine Wiederholungslogik erfordert. Redundanz ist sowohl auf dem klassischen/chat/completions Endpunkt als auch auf dem OpenAI-kompatiblen /v1/chat/completions Endpunkt verfügbar.
Wie eine Kette definiert ist
Es gibt drei Möglichkeiten, eine Kette anzufordern (in der Reihenfolge der Reihenfolge):
Eine Kette kann höchstens 3 verschiedene Modelle enthalten. Doppelte Einträge werden ausgeblendet. Jeder Ketteneintrag kann eine einfache Modellzeichenfolge oder ein Objekt mit Zeitüberschreitungen pro Versuch sein:
models und fallback_models nicht in derselben Anfrage kombinieren.
Kettenweite Optionen (redundancy)
Zeitüberschreitungen pro Versuch (festgelegt in einem
models[]-Eintrag) überschreiben die kettenweiten Werte für diesen Versuch.
Failover-Trigger
Ein fehlgeschlagener Versuch wird einem dieser Gründe zugeordnet; Ein Failover findet nur statt, wenn der Grund in Ihreron-Liste enthalten ist und noch ein anderes Modell in der Kette vorhanden ist:
Fehler, die nicht wiederholbar sind, lösen nie einen Failover aus – zum Beispiel eine absichtliche Gateway-Ratenbegrenzung/Token-Budget-Blockierung, ein offener Leistungsschalter oder eine Ablehnung einer Richtlinie/Validierung. Ein Fallback würde genauso scheitern oder die Blockierung ist gewollt.
Streaming-Verhalten
Bei Streaming-Anfragen ist Failover nur möglich, bevor das erste Inhaltstoken eintrifft. SecureAI ruft den Upstream-Stream bis zum ersten Token ab (begrenzt durchfirst_token_timeout_ms); Wenn dies fehlschlägt, erfolgt ein Failover auf das nächste Modell. Sobald das erste Token an Ihren Client gesendet wurde, ist das Bereitstellungsmodell gesperrt – eine spätere Unterbrechung während des Streams wird als error-Frame und nicht als Failover angezeigt.
Was du zurückbekommst
Wenn eine Kette mit mehreren Modellen ausgeführt wird, enthält die Antwort einen Failover-Bericht: – Klassischer Endpunkt:metadata.failover
– OpenAI-kompatibler Endpunkt: secureai.failover
metadata.served_model / secureai.served_model sagt Ihnen, welches Modell tatsächlich geantwortet hat, und requested_model ist das erste Modell in der Kette. Bei einer Einzelmodell-Anfrage (Legacy-Anfrage) wird kein Failover-Bericht erstellt.
Wenn die ganze Kette versagt
Wenn jeder Versuch fehlschlägt, gibt die Anfrage einen Fehler zurück, der alle Versuche auflistet:- 429, wenn jeder Fehler eine Ratenbegrenzung darstellte.
- 502 sonst.
code: "all_models_failed" zurück.
Admin-Standardeinstellungen (failoverDefaults)
Ein Administrator kann eine Standardkette an einen API-Schlüssel anhängen, sodass Aufrufer ein Failover erhalten, ohne bei jeder Anfrage eine Kette zu senden. Die unter Admin → API-Schlüssel konfigurierte Nutzlast wird validiert und geklemmt:
models: bis zu 3 verschiedene Modellnamen.timeout_ms: 1000–300000.first_token_timeout_ms: 500–60000. –on: jede Teilmenge der vier Trigger.
model: "a" sendet und a in failoverDefaults.models vorhanden ist, beginnt die Kette an der Position von a und wird durch die verbleibenden Standardwerte fortgesetzt.
Sicherheit & Abrechnung pro Versuch
Jeder Versuch ist ein vollständiger, unabhängiger Aufruf über den SMLTP-Wrapper – Richtliniendurchsetzung, Egress-/Residency-Governance und das Signed Entitlement Token Mint werden alle pro Versuch erneut ausgeführt, gebunden an das Modell dieses Versuchs und die genauen Anforderungsbytes. Die Abrechnung spiegelt das Modell wider, das die Antwort tatsächlich bereitgestellt hat. Jedes Failover gibt außerdem einapi:model_failover-Sicherheitsereignis (das an alle abonnierten Webhooks übermittelt wird) und einen Audit-Log-Eintrag aus.
Verwandte
- Chat-Abschluss
- OpenAI-kompatibler Endpunkt
- Policy Check – Vorschau des Zugriffs der gesamten Kette, ohne Punkte auszugeben.
- Webhooks – abonnieren Sie
api:model_failover.

