Observability
Zie precies waar elke request heen gaat.
Observability legt van elke request een trace vast: hoe lang hij duurde, wat hij kostte, welk model en welke provider hem bediende, en welke stappen in de pipeline draaiden. Elke stap is een eigen getimede span, dus een trace is een echte uitsplitsing van waar de tijd heen ging. Het vastleggen gebeurt ná de response, dus het kost nooit latency.
trace · spans · metrics
Eén trace per request, een span voor elke stap.
Als een request traag is of te veel kost, ben je aan het gokken.
Een request loopt door memory, retrieval, de firewall, routing en het model, en alles wat je ziet is één getal aan het eind. Was het de retrievalstap, de firewall, of het model zelf? Zonder een uitsplitsing per stap kun je het niet zien, dus kun je het trage of het dure deel niet met enige zekerheid aanpakken.
Hoe het werkt
Tracen, uitsplitsen, optellen.
Zet het aan en het vastleggen begint bij de volgende call, tegen het samplepercentage dat je kiest. Het vastleggen gebeurt vóór een gewone response teruggaat en na de laatste chunk van een gestreamde, dus het houdt de eerste byte waar je gebruiker op wacht nooit op.
- 01TracenEén trace per requestElke request levert één trace met een span voor elke stap die draaide: memory, RAG, firewall, routing, inference en restore. Mislukte requests worden ook getraced, met hun status erbij.
- 02UitsplitsenOpen de watervalOpen een trace voor een span-waterval: één balk per stap, op lengte naar hoe lang hij duurde, mislukte stappen in rood. Het is meteen duidelijk of de tijd naar retrieval, de firewall of het model ging.
- 03OptellenTel het opHet tabblad Metrics telt je traces op over een periode: totaal aantal requests, error rate, uitgaven, p50- en p95-latency, en de uitsplitsing per model en provider. Lezen is altijd gratis.
Dit alles lezen is gratis, hoe vaak je ook kijkt.
Waarom het anders is
Tracing die je aan kunt laten staan.
Sommige tracing vertraagt elke request, lekt gevoelige content naar een tool van derden, of rekent je af om naar je eigen data te kijken. Deze doet dat geen van drieën.
Nul extra latency
Het vastleggen wordt in de wachtrij gezet nadat de response is teruggegaan, dus de call waar je gebruiker op wacht wordt er nooit door vertraagd.
Veilig om vast te leggen
Traces blijven op EU-infrastructuur, net als de rest van het platform. Timings en status zijn altijd alleen metadata, vastgelegde content wordt gepseudonimiseerd overal waar de firewall draait, en je kunt het vastleggen per workspace uitzetten.
Gratis te lezen, goedkoop te bewaren
Je wordt één keer per vastgelegde trace afgerekend en nooit voor het lezen. Sampling en een vaste bewaartermijn houden volume en opslag in toom.
Fouten zijn zichtbaar
Een blokkade door de firewall, een geweigerde route buiten de EU, een fout wegens onvoldoende credits of een fout bij de provider leveren elk een trace op, dus je ziet fouten net zo duidelijk als successen.
Inzicht
Dat je aan kunt laten staan.
Kost je nooit een antwoord
Een trace wordt geschreven voordat een gewone response teruggaat, en na de laatste chunk van een gestreamde, dus de eerste byte wordt nooit opgehouden. Faalt het vastleggen ooit, dan wordt dat gelogd en blijft je request ongemoeid.
Timings altijd, content naar keuze
Spans leggen altijd stapnamen, timings en status vast. Wat elke stap kreeg wordt ook vastgelegd tenzij je dat uitzet, gepseudonimiseerd overal waar de firewall draait.
Per trace afgerekend, lezen gratis
Eén afrekenpost per vastgelegde trace, en traces en dashboards lezen is altijd gratis. Sample een deel van je verkeer om het volume in toom te houden bij hoge aantallen.
FAQ
Vragen over Observability.
- Vertraagt tracing een request?
- Nee. Het vastleggen wordt in de wachtrij gezet nadat de response is teruggegaan, en na de laatste chunk van een gestreamde, dus de eerste byte wordt nooit opgehouden.
- Wordt de inhoud van prompts opgeslagen?
- Timings en status zijn alleen metadata en worden altijd vastgelegd. Wat elke stap kreeg wordt vastgelegd tenzij je dat uitzet, en het wordt gepseudonimiseerd overal waar de firewall draait.
- Wat kost het om naar een dashboard te kijken?
- Niets. Je wordt één keer per vastgelegde trace afgerekend en nooit voor het lezen.
- Worden mislukte requests getraced?
- Ja. Een blokkade door de firewall, een geweigerde route buiten de EU, een fout wegens onvoldoende credits of een fout bij de provider leveren elk een trace op, met hun status erbij.
- Kunnen we maar een deel van het verkeer tracen?
- Ja. Zet een samplepercentage om het volume in toom te houden, en dat is precies wat teams met veel verkeer meestal doen.
Begin hier
Zet de trace aan.
Maak een key aan, zet Observability aan, en zie vanaf de volgende call elke request stap voor stap uitgesplitst.