Zum Inhalt springenNeuChat und Code sind in der PreviewAuf die Warteliste

Cache

Zahlen Sie nie zweimal für dieselbe Antwort.

Kommt eine Request, die Sie schon bedient haben, erneut herein, spielt Cache die gespeicherte Antwort zurück und überspringt das Modell vollständig, die Wiederholung ist also fast sofort und kostet fast nichts. Exaktes Matching passiert automatisch, semantisches Matching fängt Umformulierungen, und ein Hit kürzt die ganze Pipeline ab.

exakt · semantisch · sofort

Ein Hit überspringt das Modell, die Firewall und das Retrieval.

Ihr Verkehr wiederholt sich. Sie zahlen jedes Mal den vollen Preis.

Dieselben Fragen kommen wieder und wieder, oft Wort für Wort, und jede läuft die ganze Pipeline und rechnet eine frische Model Call ab. Sie zahlen volle Latenz und volle Kosten, um Antworten neu zu berechnen, die Sie vor Minuten schon erzeugt haben. Ein selbstgebauter Cache muss dann noch entscheiden, was sicher zu speichern ist und wann es veraltet.

Wie es funktioniert

Matchen, dann abkürzen.

Schalten Sie ihn an, und das Cachen passiert automatisch. Der Cache schlüsselt auf die Request, wie Sie sie geschickt haben, bevor irgendein anderer Service läuft.

  1. 01ExaktExakt matchenEin Schlüssel wird aus der Request gebaut, wie sie geschickt wurde: Modell, Messages, Sampling-Parameter und etwaige Tools. Eine identische Request bekommt die gespeicherte Response.
  2. 02SemantischEine Umformulierung matchenBei einem exakten Miss embeddet die Plattform den Prompt und sucht ein Beinahe-Duplikat innerhalb einer Ähnlichkeitsschwelle, die Sie setzen, damit auch Umformulierungen treffen. Höhere Schwelle für strengere Treffer.
  3. 03AbkürzenDie Pipeline abkürzenEin Hit kommt sofort zurück, bevor Retrieval, Memory, die Firewall oder das Modell laufen. Das ist es, was einen Hit sowohl billig als auch schnell macht.

Vier Einstellungen, und die letzte begrenzt, wie alt eine Antwort werden kann.

Warum es anders ist

Ein Cache, der weiß, wann nicht.

Ein grober Cache gibt veraltete oder falsche Antworten zurück und zerstört Vertrauen. Dieser ist vorsichtig damit, was er speichert, wie lange er es behält, und was ein Hit überspringt.

  • Nur Reproduzierbares, standardmäßig

    Temperature 0 oder ein Seed. Eine Request, die um Variation gebeten hat, bekommt jedes Mal eine frische Antwort, außer Sie entscheiden sich ausdrücklich fürs Cachen volatiler Responses.

  • Exakt ist exakt

    Exaktes Matching gibt nie eine falsche Antwort zurück. Semantisches Matching ist optional und auf eine Schwelle abgestimmt, Sie tauschen Präzision gegen Trefferrate also nur, wenn Sie es wollen.

  • Begrenzt und löschbar

    Eine TTL begrenzt, wie alt eine Antwort werden kann, und Cache leeren erzeugt alles auf einmal neu, wenn sich stromaufwärts ein Prompt-Template, ein Korpus oder ein Modell ändert.

  • Ehrlich zur Abkürzung

    Ein Hit überspringt die Firewall und den Router, weil die gespeicherte Antwort sie bereits passiert hat. Neue Policy gilt für frische Requests, oder nachdem Sie den Cache geleert haben.

Schnell und günstig

Ohne die Fußangeln.

Deterministisch by Default

Nur reproduzierbare Requests werden gecacht, also die mit temperature 0 oder festem Seed. Volatile Requests gehen unberührt durch, außer Sie entscheiden sich fürs Cachen.

Abgetrennt und begrenzt

Ihr Cache ist auf Ihre Organisation begrenzt, wird nie über Tenants geteilt, und ist durch eine TTL begrenzt, die Sie von 1 Stunde bis 30 Tage setzen. Leeren Sie ihn, wann Sie wollen.

Günstiger und schneller

Ein Hit bucht eine kleine Cache-Position und spart die Inference-Position. Diese gesparte Position ist Ihre Ersparnis, und die Antwort kommt in Millisekunden zurück.

FAQ

Fragen zum Cache.

Gibt er je eine falsche Antwort zurück?
Exaktes Matching kann das nicht: die Request muss identisch sein. Semantisches Matching ist optional, und Sie setzen die Ähnlichkeitsschwelle, ab der eine Umformulierung zählt.
Was wird gecacht?
Standardmäßig nur reproduzierbare Requests, also temperature 0 oder ein fester Seed. Eine Request, die um Variation gebeten hat, geht unberührt durch, außer Sie entscheiden sich dafür.
Wie alt kann eine Antwort werden?
So alt wie die TTL, die Sie setzen, von 1 Stunde bis 30 Tage. Cache leeren erzeugt alles auf einmal neu, wenn sich stromaufwärts etwas ändert.
Wird unser Cache mit jemandem geteilt?
Nein. Er ist auf Ihre Organisation begrenzt und wird nie über Tenants geteilt.
Überspringt ein Hit die Sicherheitsprüfungen?
Ja, und mit Absicht: die gespeicherte Antwort hat sie bereits passiert. Neue Policy gilt für frische Requests, oder nachdem Sie den Cache geleert haben.

Hier anfangen

Hören Sie auf, dieselben Antworten neu zu berechnen.

Legen Sie einen Key an, schalten Sie Cache ein, und bedienen Sie Ihren Wiederholungsverkehr in Millisekunden aus einer gespeicherten Antwort.