Inference API
Wijs je OpenAI-client naar de EU.
De Akumi Inference API is OpenAI-compatible en draait op EU-infrastructuur. Wijzig één base_url en je bestaande code draait op EU-resident modellen: chat, tools, streaming en structured output, per gebruik afgerekend en vastgelegd vanaf de eerste token.
één base_url · jouw client · ongewijzigd
De regel met het commentaar is de enige die verandert.
Wijzig één regel. Houd je hele stack.
Geen nieuwe SDK, geen rewrite, geen migratieproject. Houd de OpenAI-client waarmee je al bouwt, wijs hem naar Akumi, en voeg je key toe. Chat, function calling, streaming en JSON mode gedragen zich precies zoals nu, alleen op EU-resident modellen en met één afgerekende factuur.
Hoe het werkt
Veel modellen, één endpoint.
De model router zet elk model achter dezelfde base_url. Kies een EU-resident model, of sta er onder je policy een extern toe. Stel routingregels in, automatische fallback, en breng je eigen provider keys mee.
- 01PolicyRouteer per dataklasseBepaal per dataklasse welke modellen zijn toegestaan, met je kroonjuwelen vastgezet op EU-only.
- 02FallbackOverleef een hapering bij een providerEen hapering bij een provider valt terug op het volgende toegestane model, zodat een request zelden gewoon faalt.
- 03KeysBreng je eigen keys meeGebruik je eigen provider-credentials wanneer je wilt, afgerekend en vastgelegd op één plek.
Het model is gewoon een string. Welke strings je mag sturen is je policy.
Compatible
Je stack draait ongewijzigd.
De endpoints, request bodies en responses komen overeen met de OpenAI API, dus de libraries, frameworks en tools die je al gebruikt werken gewoon.
Chat Completions
POST /v1/chat/completions met het volledige message- en parameteroppervlak dat je al stuurt.
Streaming
Server-sent events per token, dezelfde response als bij stream=true.
Tools en function calling
Definieer tools, laat het model ze aanroepen, en stuur bij met tool_choice. Tool-content wordt ook gecontroleerd.
Structured output
response_format met een JSON-schema voor betrouwbare, getypeerde responses waar je code op kan bouwen.
Embeddings
POST /v1/embeddings op EU-gehoste modellen voor search, clustering en retrieval.
Eigen /v1/process
Een eigen endpoint voor als je de volledige Akumi-pipeline in de response wilt, inclusief residency en services.
Waarom het anders is
Betaal voor tokens, niet voor seats.
Basisinference wordt per token en per request afgerekend. Elke service die je aanzet rekent op een eigen regel af, zodat de factuur leest als het werk dat het platform echt deed. Geen seats, geen minima, geen verrassingstiers.
Per token en per request
Basisinference wordt op echt gebruik afgerekend en gaat van prepaid credits.
Per service
Firewall, Recall, Router en Cache rekenen elk apart af, op de calls waarop ze draaiden.
Eén transparante factuur
Eén grootboek met credits en detail per regel, exporteerbaar voor finance en compliance.
EU als default
Vastgelegd bij elke call.
EU-resident inference
Requests worden bediend op EU-infrastructuur. Inference en opslag blijven in de EU, zonder blootstelling aan de CLOUD Act.
Egress guard
Routing naar een model buiten de EU wordt geblokkeerd tenzij je het expliciet toestaat, met persoonsgegevens gepseudonimiseerd voordat er iets weggaat.
Vastgelegd vanaf de eerste token
Elke request wordt afgerekend en naar een audit trail met alleen metadata geschreven, met model, regio en services. Geef compliance het log.
FAQ
Vragen over de Inference API.
- Moet ik mijn code aanpassen?
- Eén regel. Het is een OpenAI-compatible endpoint, dus je wijzigt de base_url en houdt je bestaande client. Chat, tools, streaming en structured output werken zoals ze deden.
- Welke modellen kan ik aanroepen?
- EU-resident modellen standaard, en externe waar je policy dat toestaat. Het model is een string in de request, en GET /v1/models laat zien wat je mag sturen.
- Waar draait een request echt?
- Op EU-infrastructuur, tenzij je een specifiek model daarbuiten hebt toegestaan. Elke response draagt de regio die hem bediend heeft.
- Hoe wordt er afgerekend?
- Per token en per request, van prepaid credits, met elke service die je aanzet op een eigen regel. Geen seats en geen minima.
- Wat wordt er over mijn requests opgeslagen?
- Alleen metadata: wat er draaide, wanneer, in welke regio en onder welke policy. De inhoud van prompts wordt nooit opgeslagen.
Begin hier
Begin met één base_url.
Maak een key aan, wijs je client naar Akumi, en bouw vandaag op EU-resident modellen.