Naar de inhoudNieuwChat en Code zijn in previewMeld je aan

Inference API

Wijs je OpenAI-client naar de EU.

De Akumi Inference API is OpenAI-compatible en draait op EU-infrastructuur. Wijzig één base_url en je bestaande code draait op EU-resident modellen: chat, tools, streaming en structured output, per gebruik afgerekend en vastgelegd vanaf de eerste token.

één base_url · jouw client · ongewijzigd

De regel met het commentaar is de enige die verandert.

Wijzig één regel. Houd je hele stack.

Geen nieuwe SDK, geen rewrite, geen migratieproject. Houd de OpenAI-client waarmee je al bouwt, wijs hem naar Akumi, en voeg je key toe. Chat, function calling, streaming en JSON mode gedragen zich precies zoals nu, alleen op EU-resident modellen en met één afgerekende factuur.

Hoe het werkt

Veel modellen, één endpoint.

De model router zet elk model achter dezelfde base_url. Kies een EU-resident model, of sta er onder je policy een extern toe. Stel routingregels in, automatische fallback, en breng je eigen provider keys mee.

  1. 01PolicyRouteer per dataklasseBepaal per dataklasse welke modellen zijn toegestaan, met je kroonjuwelen vastgezet op EU-only.
  2. 02FallbackOverleef een hapering bij een providerEen hapering bij een provider valt terug op het volgende toegestane model, zodat een request zelden gewoon faalt.
  3. 03KeysBreng je eigen keys meeGebruik je eigen provider-credentials wanneer je wilt, afgerekend en vastgelegd op één plek.

Het model is gewoon een string. Welke strings je mag sturen is je policy.

Compatible

Je stack draait ongewijzigd.

De endpoints, request bodies en responses komen overeen met de OpenAI API, dus de libraries, frameworks en tools die je al gebruikt werken gewoon.

  • Chat Completions

    POST /v1/chat/completions met het volledige message- en parameteroppervlak dat je al stuurt.

  • Streaming

    Server-sent events per token, dezelfde response als bij stream=true.

  • Tools en function calling

    Definieer tools, laat het model ze aanroepen, en stuur bij met tool_choice. Tool-content wordt ook gecontroleerd.

  • Structured output

    response_format met een JSON-schema voor betrouwbare, getypeerde responses waar je code op kan bouwen.

  • Embeddings

    POST /v1/embeddings op EU-gehoste modellen voor search, clustering en retrieval.

  • Eigen /v1/process

    Een eigen endpoint voor als je de volledige Akumi-pipeline in de response wilt, inclusief residency en services.

Waarom het anders is

Betaal voor tokens, niet voor seats.

Basisinference wordt per token en per request afgerekend. Elke service die je aanzet rekent op een eigen regel af, zodat de factuur leest als het werk dat het platform echt deed. Geen seats, geen minima, geen verrassingstiers.

  • Per token en per request

    Basisinference wordt op echt gebruik afgerekend en gaat van prepaid credits.

  • Per service

    Firewall, Recall, Router en Cache rekenen elk apart af, op de calls waarop ze draaiden.

  • Eén transparante factuur

    Eén grootboek met credits en detail per regel, exporteerbaar voor finance en compliance.

EU als default

Vastgelegd bij elke call.

EU-resident inference

Requests worden bediend op EU-infrastructuur. Inference en opslag blijven in de EU, zonder blootstelling aan de CLOUD Act.

Egress guard

Routing naar een model buiten de EU wordt geblokkeerd tenzij je het expliciet toestaat, met persoonsgegevens gepseudonimiseerd voordat er iets weggaat.

Vastgelegd vanaf de eerste token

Elke request wordt afgerekend en naar een audit trail met alleen metadata geschreven, met model, regio en services. Geef compliance het log.

FAQ

Vragen over de Inference API.

Moet ik mijn code aanpassen?
Eén regel. Het is een OpenAI-compatible endpoint, dus je wijzigt de base_url en houdt je bestaande client. Chat, tools, streaming en structured output werken zoals ze deden.
Welke modellen kan ik aanroepen?
EU-resident modellen standaard, en externe waar je policy dat toestaat. Het model is een string in de request, en GET /v1/models laat zien wat je mag sturen.
Waar draait een request echt?
Op EU-infrastructuur, tenzij je een specifiek model daarbuiten hebt toegestaan. Elke response draagt de regio die hem bediend heeft.
Hoe wordt er afgerekend?
Per token en per request, van prepaid credits, met elke service die je aanzet op een eigen regel. Geen seats en geen minima.
Wat wordt er over mijn requests opgeslagen?
Alleen metadata: wat er draaide, wanneer, in welke regio en onder welke policy. De inhoud van prompts wordt nooit opgeslagen.

Begin hier

Begin met één base_url.

Maak een key aan, wijs je client naar Akumi, en bouw vandaag op EU-resident modellen.