Observability
Sehen Sie genau, wohin jede Request geht.
Observability erfasst zu jeder Request eine Trace: wie lange sie dauerte, was sie kostete, welches Modell und welcher Provider sie bediente, und welche Stufen der Pipeline liefen. Jede Stufe ist ein eigener gemessener Span, eine Trace ist also eine echte Aufschlüsselung dessen, wohin die Zeit ging. Das Erfassen passiert nach der Response und kostet daher nie Latenz.
Trace · Spans · Metrics
Eine Trace pro Request, ein Span für jede Stufe.
Wenn eine Request langsam ist oder zu viel kostet, raten Sie.
Eine Request läuft durch Memory, Retrieval, die Firewall, das Routing und das Modell, und alles, was Sie sehen, ist eine Zahl am Ende. War es der Retrieval-Schritt, die Firewall, oder das Modell selbst? Ohne eine Aufschlüsselung pro Stufe können Sie es nicht sagen, also können Sie weder den langsamen noch den teuren Teil mit Sicherheit beheben.
Wie es funktioniert
Tracen, aufschlüsseln, aggregieren.
Schalten Sie es ein, und das Erfassen beginnt bei der nächsten Call, mit der Sample Rate, die Sie wählen. Das Erfassen passiert vor der Rückgabe einer normalen Response und nach dem letzten Chunk einer gestreamten, es verzögert also nie das erste Byte, auf das Ihre Nutzerin wartet.
- 01TracenEine Trace pro RequestJede Request erzeugt eine Trace mit einem Span für jede Stufe, die lief: Memory, RAG, Firewall, Routing, Inference und Restore. Fehlgeschlagene Requests werden ebenfalls getraced, mit ihrem Status.
- 02AufschlüsselnDen Wasserfall öffnenÖffnen Sie eine Trace für einen Span-Wasserfall: ein Balken pro Stufe, in der Länge nach ihrer Dauer, fehlgeschlagene Stufen in Rot. Es ist sofort klar, ob die Zeit ins Retrieval, in die Firewall oder ins Modell ging.
- 03AggregierenZusammenzählenDer Tab Metrics fasst Ihre Traces über einen Zeitraum zusammen: Requests gesamt, Error Rate, Ausgaben, p50- und p95-Latenz, und die Aufschlüsselung nach Modell und Provider. Lesen ist immer kostenlos.
Das alles zu lesen ist kostenlos, so oft Sie auch hinschauen.
Warum es anders ist
Tracing, das Sie anlassen können.
Manches Tracing verlangsamt jede Request, leckt sensible Inhalte in ein Fremdtool, oder rechnet Ihnen das Anschauen der eigenen Daten in Rechnung. Dieses tut nichts davon.
Null zusätzliche Latenz
Das Erfassen wird in eine Queue gelegt, nachdem die Response zurückgegangen ist, die Call, auf die Ihre Nutzerin wartet, wird dadurch also nie langsamer.
Sicher zu erfassen
Traces bleiben auf EU-Infrastruktur, wie der Rest der Plattform. Timings und Status sind immer nur Metadaten, erfasste Inhalte werden überall dort pseudonymisiert, wo die Firewall läuft, und Sie können das Erfassen pro Workspace abschalten.
Kostenlos zu lesen, günstig zu behalten
Sie zahlen einmal pro erfasster Trace und nie fürs Lesen. Sampling und ein fester Aufbewahrungszeitraum halten Volumen und Speicher in Grenzen.
Fehler sind sichtbar
Eine Sperre durch die Firewall, eine abgewiesene Route außerhalb der EU, ein Fehler wegen aufgebrauchter Credits oder ein Providerfehler erzeugen jeweils eine Trace, Sie sehen Fehler also so deutlich wie Erfolge.
Einblick
Den Sie anlassen können.
Kostet Sie nie eine Antwort
Eine Trace wird geschrieben, bevor eine normale Response zurückgeht, und nach dem letzten Chunk einer gestreamten, das erste Byte wird also nie verzögert. Sollte das Erfassen einmal fehlschlagen, wird das geloggt und Ihre Request bleibt unberührt.
Timings immer, Inhalte nach Wahl
Spans erfassen immer Stufennamen, Timings und Status. Was jede Stufe bekam, wird ebenfalls erfasst, außer Sie schalten es ab, pseudonymisiert überall dort, wo die Firewall läuft.
Pro Trace abgerechnet, Lesen kostenlos
Eine abrechenbare Position pro erfasster Trace, und Traces und Dashboards zu lesen ist immer kostenlos. Sampeln Sie einen Teil des Verkehrs, um das Volumen bei hohem Durchsatz zu steuern.
FAQ
Fragen zu Observability.
- Verlangsamt Tracing eine Request?
- Nein. Das Erfassen wird in eine Queue gelegt, nachdem die Response zurückgegangen ist, und nach dem letzten Chunk einer gestreamten, das erste Byte wird also nie verzögert.
- Wird der Inhalt von Prompts gespeichert?
- Timings und Status sind nur Metadaten und werden immer erfasst. Was jede Stufe bekam, wird erfasst, außer Sie schalten es ab, und es wird überall dort pseudonymisiert, wo die Firewall läuft.
- Was kostet es, ein Dashboard anzuschauen?
- Nichts. Sie zahlen einmal pro erfasster Trace und nie fürs Lesen.
- Werden fehlgeschlagene Requests getraced?
- Ja. Eine Sperre durch die Firewall, eine abgewiesene Route außerhalb der EU, ein Fehler wegen aufgebrauchter Credits oder ein Providerfehler erzeugen jeweils eine Trace, mit ihrem Status.
- Können wir nur einen Teil des Verkehrs tracen?
- Ja. Setzen Sie eine Sample Rate, um das Volumen zu steuern, und genau das tun Teams mit hohem Durchsatz üblicherweise.
Hier anfangen
Schalten Sie die Trace ein.
Legen Sie einen Key an, schalten Sie Observability ein, und sehen Sie ab der nächsten Call jede Request Stufe für Stufe aufgeschlüsselt.