Zum Inhalt springenNeuChat und Code sind in der PreviewAuf die Warteliste

Inference API

Richten Sie Ihren OpenAI-Client auf die EU.

Die Akumi Inference API ist OpenAI-kompatibel und läuft auf EU-Infrastruktur. Ändern Sie eine base_url, und Ihr bestehender Code läuft auf EU-residenten Modellen: Chat, Tools, Streaming und Structured Output, nach Nutzung abgerechnet und ab dem ersten Token erfasst.

eine base_url · Ihr Client · unverändert

Die Zeile mit dem Kommentar ist die einzige, die sich ändert.

Eine Zeile ändern. Den ganzen Stack behalten.

Kein neues SDK, kein Rewrite, kein Migrationsprojekt. Behalten Sie den OpenAI-Client, mit dem Sie ohnehin bauen, richten Sie ihn auf Akumi, und legen Sie Ihren Key dazu. Chat, Function Calling, Streaming und JSON Mode verhalten sich genau wie heute, nur auf EU-residenten Modellen und mit einer abgerechneten Rechnung.

Wie es funktioniert

Viele Modelle, ein Endpoint.

Der Model Router stellt jedes Modell hinter dieselbe base_url. Wählen Sie ein EU-residentes Modell, oder erlauben Sie unter Ihrer Policy ein externes. Setzen Sie Routing-Regeln, automatischen Fallback, und bringen Sie eigene Provider Keys mit.

  1. 01PolicyNach Datenklasse routenEntscheiden Sie je Datenklasse, welche Modelle zulässig sind, mit Kronjuwelen fest auf EU-only.
  2. 02FallbackEinen Aussetzer beim Anbieter überstehenEin Aussetzer beim Anbieter fällt auf das nächste zulässige Modell zurück, damit eine Request selten einfach scheitert.
  3. 03KeysEigene Keys mitbringenNutzen Sie eigene Provider-Credentials, wenn Sie wollen, abgerechnet und erfasst an einer Stelle.

Das Modell ist nur ein String. Welche Strings Sie schicken dürfen, ist Ihre Policy.

Kompatibel

Ihr Stack läuft unverändert.

Die Endpoints, Request Bodies und Responses entsprechen der OpenAI API, die Libraries, Frameworks und Tools, die Sie ohnehin nutzen, funktionieren also einfach.

  • Chat Completions

    POST /v1/chat/completions mit der vollen Message- und Parameterfläche, die Sie ohnehin schicken.

  • Streaming

    Server-Sent Events Token für Token, dieselbe Response wie bei stream=true.

  • Tools und Function Calling

    Tools definieren, das Modell sie aufrufen lassen, und mit tool_choice steuern. Tool-Inhalte werden ebenfalls geprüft.

  • Structured Output

    response_format mit JSON-Schema für verlässliche, typisierte Responses, auf die Ihr Code bauen kann.

  • Embeddings

    POST /v1/embeddings auf EU-gehosteten Modellen für Suche, Clustering und Retrieval.

  • Eigenes /v1/process

    Ein eigenes Endpoint, wenn Sie die volle Akumi-Pipeline in der Response wollen, samt Residency und Services.

Warum es anders ist

Zahlen Sie für Tokens, nicht für Seats.

Basis-Inference wird pro Token und pro Request abgerechnet. Jeder Service, den Sie zuschalten, rechnet auf einer eigenen Zeile ab, damit die Rechnung sich liest wie die Arbeit, die die Plattform wirklich getan hat. Keine Seats, keine Mindestbeträge, keine Überraschungs-Tiers.

  • Pro Token und Request

    Basis-Inference wird nach echter Nutzung abgerechnet und geht von vorausbezahlten Credits.

  • Pro Service

    Firewall, Recall, Router und Cache rechnen jeweils einzeln ab, auf den Calls, auf denen sie liefen.

  • Eine transparente Rechnung

    Ein Credit-Hauptbuch mit Detail je Zeile, exportierbar für Finance und Compliance.

EU als Voreinstellung

Bei jeder Call erfasst.

EU-residente Inference

Requests werden auf EU-Infrastruktur bedient. Inference und Speicher bleiben in der EU, ohne CLOUD-Act-Risiko.

Egress Guard

Routing zu einem Modell außerhalb der EU wird blockiert, solange Sie es nicht ausdrücklich erlauben, mit personenbezogenen Daten pseudonymisiert, bevor etwas hinausgeht.

Erfasst ab dem ersten Token

Jede Request wird abgerechnet und in eine Audit Trail aus reinen Metadaten geschrieben, mit Modell, Region und Services. Geben Sie Compliance das Log.

FAQ

Fragen zur Inference API.

Muss ich meinen Code ändern?
Eine Zeile. Es ist ein OpenAI-kompatibles Endpoint, Sie ändern die base_url und behalten Ihren bestehenden Client. Chat, Tools, Streaming und Structured Output verhalten sich wie vorher.
Welche Modelle kann ich aufrufen?
EU-residente Modelle standardmäßig, und externe dort, wo Ihre Policy sie erlaubt. Das Modell ist ein String in der Request, und GET /v1/models zeigt, was Sie schicken dürfen.
Wo läuft eine Request tatsächlich?
Auf EU-Infrastruktur, außer Sie haben ein bestimmtes Modell außerhalb erlaubt. Jede Response trägt die Region, die sie bedient hat.
Wie wird abgerechnet?
Pro Token und Request, von vorausbezahlten Credits, mit jedem zugeschalteten Service auf einer eigenen Zeile. Keine Seats und keine Mindestbeträge.
Was wird über meine Requests gespeichert?
Nur Metadaten: was lief, wann, in welcher Region und unter welcher Policy. Der Inhalt von Prompts wird nie gespeichert.

Hier anfangen

Fangen Sie mit einer base_url an.

Legen Sie einen Key an, richten Sie Ihren Client auf Akumi, und laufen Sie heute auf EU-residenten Modellen.