Skip to main content

Semantik

  • Zustandslos. Es wird nichts gespeichert, und dies ist die einzige Route ohne endUserId – kein Endnutzer ist beteiligt.
  • Limits. Bis zu 96 Inputs pro Call, jeweils höchstens 8.192 Zeichen.
  • Deterministische Reihenfolge. Vektoren sind einheitsnormiert und werden in Eingabereihenfolge zurückgegeben.
  • Auth. Ein cint_-Integration-Key mit memory:read.

Model-Pinning

model ist ein Pin, kein Selektor. Der Endpunkt bedient genau ein Modell, das in jeder Response gemeldet wird. Jeder andere gepinnter Name liefert 400 model_not_served – Vektoren aus einem anderen Modell werden niemals stillschweigend substituiert. Pinne das Modell immer dann, wenn deine Vektoren kompatibel zu einem bestehenden Index bleiben müssen; ein ungepinnter Call bekommt stets das aktuell bediente Modell.

Metering

Die Nutzung wird als Embed-Tokens gemessen (~4 Zeichen pro Token) und erscheint in deiner Plattform-Usage-Ansicht. Vollständiges Request-/Response-Schema: API-Referenz.