Vergleich
Akumi vs offene Modelle selbst hosten
Mistral oder Llama auf eigenen GPUs zu betreiben klingt nach der saubersten Residency-Antwort, bis Sie es durchrechnen. Es ist ein Serving-Stack, ein GPU-Budget, das abrechnet, ob jemand einen Request schickt oder nicht, eine Rufbereitschaft und eine Schicht aus Controls, die Sie weiterhin selbst schreiben. Akumi gibt Ihnen die EU-residente Antwort ohne die Flotte, und Residency, die Sie pro Request nachweisen können statt pro Rechenzentrum.
Sie kaufen ein Modell, keine Plattform.
Ein Open-Weights-Modell selbst zu hosten ist die Antwort, die im Meeting am saubersten klingt, und als technische Position ist sie vollständig stimmig. Sie brauchen trotzdem einen Ort für Ihre Dokumente und etwas, das sie abruft, ohne ein Team in die Antworten eines anderen Teams zu tragen. Sie müssen weiterhin personenbezogene Daten maskieren, Prompt Injection abfangen und einen Nachweis erzeugen, den eine Aufsichtsbehörde akzeptiert. Und unter allem liegt eine GPU-Rechnung, die kommt, ob in dem Monat jemand einen Request geschickt hat oder nicht.
Die zwei verglichenen Dinge
Was beides tatsächlich ist.
Beide geben Ihnen EU-Residency. Sie unterscheiden sich darin, wer das betreibt, was sie liefert.
Akumi
Eine gemanagte EU-residente KI-Plattform hinter einem OpenAI-kompatiblen Endpoint. EU-residente Modelle, eine Firewall, ein Knowledge Graph für Retrieval und Memory, ein Response Cache und Observability pro Request, alles nutzungsbasiert abgerechnet. Nichts bereitzustellen, zu patchen oder zu skalieren, und Residency pro Request in einem Audit Trail festgehalten, der nur Metadaten enthält.
Selbst hosten
Sie betreiben Open-Weights-Modelle auf Hardware, die Sie kontrollieren, meist mit einem Inference-Server wie vLLM davor. Sie wählen die Modelle, die Quantisierung und die Serving-Topologie, und Ihnen gehören Kapazitätsplanung, Upgrades, Verfügbarkeit und alles oberhalb der Completion: Retrieval, Isolation, Redaction, Caching und Audit.
Nebeneinander
Volle Kontrolle, und die Rechnung vollständig bei Ihnen.
| Kriterium | Akumi | Selbst gehostet |
|---|---|---|
| Residency-Nachweis | EU-resident als Standard, und pro Request nachweisbar: jeder Call hält Modell, Provider und Region fest, die ihn bedient haben. | Absolut durch die Bauweise, wobei der Audit Trail und der Nachweis für Ihre Aufsichtsbehörde Ihnen zum Bauen bleiben. |
| Betriebsaufwand | Keiner. Serving, Skalierung, Upgrades und Kapazität gehören uns. | Ihnen: GPU-Kapazität, Inference-Server, Modell-Upgrades, und jemand, der den Pager trägt. |
| Form der Kosten | Nutzungsbasierte Credits. Läuft nichts, kostet nichts. | Feste GPU-Ausgaben, ob jemand einen Request schickt oder nicht, plus die Engineers, die alles am Laufen halten. |
| Die Schicht über dem Modell | Firewall, Egress-Policy, Audit Trail und Retrieval bereits gebaut und abgerechnet. | Jedes Teil bleibt Ihnen zu bauen, zu testen und richtig zu halten, während Modelle und Regulierung sich bewegen. |
| Retrieval | Memory aus Gesprächen und Ihre Dokumente teilen sich einen Knowledge Graph. Jede Collection ist eine eigene Partition, und jede Response trägt die Quellen, die sie genutzt hat. | Open Weights zu bedienen bringt Ihnen ein Modell, keine Wissensschicht. Der Store, die Ingestion, das Ranking und die Trennung zwischen Teams liegen alle noch vor Ihnen. |
| Mit Modellen Schritt halten | Ein kuratiertes Roster hinter einem Endpoint. Neue Modelle kommen getestet und bepreist, und der Wechsel ist ein String. | Jedes Upgrade ist ein Projekt: neue Weights, neue Serving-Konfiguration, neue Benchmarks und ein Rollback-Plan. |
| Zeit bis Produktion | Minuten. Anmeldung, Key, eine base_url. | Wochen bis Monate, je nach Beschaffung, Lieferzeiten der Hardware und wie viel vom Stack schon existiert. |
- Residency-NachweisAkumiEU-resident als Standard, und pro Request nachweisbar: jeder Call hält Modell, Provider und Region fest, die ihn bedient haben.Selbst gehostetAbsolut durch die Bauweise, wobei der Audit Trail und der Nachweis für Ihre Aufsichtsbehörde Ihnen zum Bauen bleiben.
- BetriebsaufwandAkumiKeiner. Serving, Skalierung, Upgrades und Kapazität gehören uns.Selbst gehostetIhnen: GPU-Kapazität, Inference-Server, Modell-Upgrades, und jemand, der den Pager trägt.
- Form der KostenAkumiNutzungsbasierte Credits. Läuft nichts, kostet nichts.Selbst gehostetFeste GPU-Ausgaben, ob jemand einen Request schickt oder nicht, plus die Engineers, die alles am Laufen halten.
- Die Schicht über dem ModellAkumiFirewall, Egress-Policy, Audit Trail und Retrieval bereits gebaut und abgerechnet.Selbst gehostetJedes Teil bleibt Ihnen zu bauen, zu testen und richtig zu halten, während Modelle und Regulierung sich bewegen.
- RetrievalAkumiMemory aus Gesprächen und Ihre Dokumente teilen sich einen Knowledge Graph. Jede Collection ist eine eigene Partition, und jede Response trägt die Quellen, die sie genutzt hat.Selbst gehostetOpen Weights zu bedienen bringt Ihnen ein Modell, keine Wissensschicht. Der Store, die Ingestion, das Ranking und die Trennung zwischen Teams liegen alle noch vor Ihnen.
- Mit Modellen Schritt haltenAkumiEin kuratiertes Roster hinter einem Endpoint. Neue Modelle kommen getestet und bepreist, und der Wechsel ist ein String.Selbst gehostetJedes Upgrade ist ein Projekt: neue Weights, neue Serving-Konfiguration, neue Benchmarks und ein Rollback-Plan.
- Zeit bis ProduktionAkumiMinuten. Anmeldung, Key, eine base_url.Selbst gehostetWochen bis Monate, je nach Beschaffung, Lieferzeiten der Hardware und wie viel vom Stack schon existiert.
Die Rechnung
Die GPU-Rechnung kommt, ob jemand sie genutzt hat oder nicht.
Nutzungsbasierte Preise und reservierte Kapazität verhalten sich sehr verschieden, und der Unterschied ist kein Rundungsfehler. Ein selbst gehostetes Deployment, das auf Ihre stärkste Stunde ausgelegt ist, wird auch in jeder ruhigen Stunde bezahlt: nachts, am Wochenende und in den Monaten, in denen das Feature live ist, die Adoption aber noch wächst. Legen Sie es stattdessen auf den Durchschnitt aus, dann treffen Ihre Nutzer in der Spitzenstunde auf eine Warteschlange.
Akumi rechnet pro Token und pro Request ab, also kostet eine ruhige Woche nichts und eine Launch-Woche skaliert ohne Beschaffungsgespräch. Ein Cache Hit entfernt die Inference-Position vollständig, also folgt die Rechnung der Arbeit statt der Kapazität, die Sie vorsorglich reserviert haben.
| Kriterium | Akumi | Selbst gehostet |
|---|---|---|
| Ruhige Phasen | Nichts. Sie zahlen für Requests, nicht für reservierte Kapazität. | Die vollen Kosten, unabhängig von der Auslastung. |
| Eine plötzliche Spitze | Aufgefangen. Skalierung ist unsere Sorge. | Eine Warteschlange, oder Kapazität, die Sie vorab kauften und ganzjährig zahlten. |
| Wem die Rechnung folgt | Geleisteter Arbeit, aufgeschlüsselt pro Request und pro Service. | Reservierter Hardware, plus den Menschen, die sie gesund halten. |
- Ruhige PhasenAkumiNichts. Sie zahlen für Requests, nicht für reservierte Kapazität.Selbst gehostetDie vollen Kosten, unabhängig von der Auslastung.
- Eine plötzliche SpitzeAkumiAufgefangen. Skalierung ist unsere Sorge.Selbst gehostetEine Warteschlange, oder Kapazität, die Sie vorab kauften und ganzjährig zahlten.
- Wem die Rechnung folgtAkumiGeleisteter Arbeit, aufgeschlüsselt pro Request und pro Service.Selbst gehostetReservierter Hardware, plus den Menschen, die sie gesund halten.
Die anderen zwei Drittel
Ein Modell zu bedienen ist das leichte Drittel.
Ein Modell auf eigener Hardware Token zurückgeben zu lassen ist ein gelöstes Problem, und eine gute Engineerin hat es in einer Woche am Laufen. Die übrigen zwei Drittel sind der Teil, der das Quartal kostet: ein Document Store und ein Ingestion-Pfad, Retrieval, das gut genug rankt, um nützlich zu sein, Isolation, damit die Dokumente einer Kundin nie in der Antwort einer anderen auftauchen, Maskierung personenbezogener Daten vor dem Egress, Injection-Scanning über allem, was ein Tool zurückgibt, ein Cache, und ein Audit Trail, der spezifisch genug ist, dass jemand sagen kann, wo ein bestimmter Request lief.
Nichts davon ist exotisch, und alles davon ist tragend. Es ist auch der Teil, der weiter Aufmerksamkeit braucht, denn die Angriffe ändern sich, die Modelle ändern sich und die Pflichten ändern sich.
| Kriterium | Akumi | Selbst gehostet |
|---|---|---|
| Token zurückbekommen | Enthalten. | Eine Woche Arbeit, und der ehrlich vergnügliche Teil. |
| Retrieval und Isolation | Ein Knowledge Graph, pro Workspace partitioniert, bevor die Query gebaut wird. | Ein Store, ein Ingestion-Pfad, Ranking, und die Isolationslogik zwischen Tenants. |
| Redaction und Injection | Die Firewall auf demselben Request, standardmäßig aktiv. | Ihnen zu schreiben, und Ihnen aktuell zu halten, während Angriffe sich weiterentwickeln. |
| Audit und Nachweis | Aufzeichnung nur mit Metadaten zu Modell, Provider und Region, pro Request. | Ihnen zu entwerfen, zu speichern, aufzubewahren und zu verteidigen. |
- Token zurückbekommenAkumiEnthalten.Selbst gehostetEine Woche Arbeit, und der ehrlich vergnügliche Teil.
- Retrieval und IsolationAkumiEin Knowledge Graph, pro Workspace partitioniert, bevor die Query gebaut wird.Selbst gehostetEin Store, ein Ingestion-Pfad, Ranking, und die Isolationslogik zwischen Tenants.
- Redaction und InjectionAkumiDie Firewall auf demselben Request, standardmäßig aktiv.Selbst gehostetIhnen zu schreiben, und Ihnen aktuell zu halten, während Angriffe sich weiterentwickeln.
- Audit und NachweisAkumiAufzeichnung nur mit Metadaten zu Modell, Provider und Region, pro Request.Selbst gehostetIhnen zu entwerfen, zu speichern, aufzubewahren und zu verteidigen.
Modellwechsel
Jedes neue Modell ist wieder eine Migration.
Modellgenerationen wechseln schnell, und auf selbst gehosteter Infrastruktur ist jeder Wechsel ein Projekt statt einer Konfigurationsänderung: neue Weights zu bewerten, Serving-Parameter neu abzustimmen, Durchsatz und Speicher neu zu messen, Qualität gegen die eigene Workload neu zu benchmarken, und ein Rollback-Plan für den Fall, dass es auf eine Weise schlechter ist, die die Benchmarks übersehen haben. Teams, die hier zurückfallen, betreiben irgendwann still ein Modell, das ein Jahr älter ist als das des Wettbewerbs.
| Kriterium | Akumi | Selbst gehostet |
|---|---|---|
| Ein neueres Modell übernehmen | Einen String ändern, Ihre Evals fahren, das alte als Fallback behalten. | Weights, Serving-Konfiguration, neu abstimmen, neu benchmarken und ein Rollback-Plan. |
| Zurückfallen | Schwierig, weil der Wechsel fast nichts kostet. | Üblich, weil jedes Upgrade mit Produktarbeit konkurriert. |
| Zwei parallel betreiben | Etwas Traffic auf beide leiten und aus denselben Trace-Daten vergleichen. | Doppelte Kapazität, oder eine Serving-Topologie, die beide hosten kann. |
- Ein neueres Modell übernehmenAkumiEinen String ändern, Ihre Evals fahren, das alte als Fallback behalten.Selbst gehostetWeights, Serving-Konfiguration, neu abstimmen, neu benchmarken und ein Rollback-Plan.
- ZurückfallenAkumiSchwierig, weil der Wechsel fast nichts kostet.Selbst gehostetÜblich, weil jedes Upgrade mit Produktarbeit konkurriert.
- Zwei parallel betreibenAkumiEtwas Traffic auf beide leiten und aus denselben Trace-Daten vergleichen.Selbst gehostetDoppelte Kapazität, oder eine Serving-Topologie, die beide hosten kann.
Die ehrliche Antwort
Die eigentliche Frage ist, was Sie betreiben wollen.
Wählen Sie Akumi, wenn
- Sie EU-Residency als Ergebnis wollen, nicht als Infrastrukturprojekt.
- Ihr Team Produktfeatures liefern sollte statt Inference-Server zu betreiben.
- Ihre Nutzung schwankt und Zahlen für unbenutzte GPUs schwer zu begründen ist.
- Sie die Controls an Tag eins wollen statt in einem späteren Sprint.
- Ihre Compliance-Frist früher kommt als Ihre Hardware.
Wählen Sie Selbsthosting, wenn
- Ihre Anforderung ausdrücklich lautet, dass die Weights auf eigener Hardware laufen.
- Ihr Volumen groß, stetig und vorhersehbar genug ist, dass reservierte Kapazität nutzungsbasierte Abrechnung schlägt.
- Sie bereits GPU-Infrastruktur betreiben und eine weitere Workload kaum zusätzlich kostet.
- Sie die Engineering-Zeit haben, die Schicht über dem Modell zu bauen und zu halten, und sie besitzen wollen.
FAQ
Fragen, die gestellt werden.
- Ist Selbsthosting günstiger als eine gemanagte Plattform?
- Das hängt fast vollständig an der Auslastung. Selbst gehostete Kapazität ist ein fester Kostenblock, der kommt, ob jemand einen Request schickt oder nicht, also belohnt sie großes, stetiges, vorhersehbares Volumen. Nutzungsbasierte Preise belohnen schwankende oder wachsende Workloads. Der Vergleich, den man vergisst, ist die Engineering-Zeit.
- Läuft Akumi auf EU-Infrastruktur?
- Ja. Anwendung, Daten und Modelle sind EU-resident, und Routing außerhalb der EU wird an einem Guard blockiert, der schließt, sofern Sie es nicht ausdrücklich erlauben. Jeder Request hält Modell, Provider und Region fest, die ihn bedient haben.
- Kann ich Open-Weights-Modelle wie Mistral auf Akumi nutzen?
- Ja. Das EU-residente Roster ist um sie herum gebaut, bedient hinter demselben OpenAI-kompatiblen Endpoint wie alles andere, also bekommen Sie offene Modelle, ohne den Serving-Stack zu betreiben, der sie ausführt.
- Was, wenn ich später doch selbst hosten will?
- Die API ist OpenAI-kompatibel, ein Wechsel in beide Richtungen ist also eine base_url-Änderung statt einer Neuentwicklung. Auf Akumi zu starten, während ein Selbsthosting-Projekt noch auf der Roadmap steht, ist ein vernünftiger Weg, eine Compliance-Frist zu halten, die früher kommt als Ihre Hardware.
- Brauchen wir trotzdem eine Vektordatenbank?
- Nein, und Akumi auch nicht. Retrieval läuft auf einem Knowledge Graph statt auf einem Vector Store: Memory aus Gesprächen und Ihre Dokumente teilen sich ein Substrat, eine Antwort kann also den Beziehungen zwischen ihnen folgen, statt zu hoffen, dass ein einzelner Chunk die ganze Kette enthält.
- Wer ist für Modell-Upgrades verantwortlich?
- Auf Akumi wir. Neue Modelle kommen getestet und bepreist hinter demselben Endpoint, und der Wechsel ist eine String-Änderung mit dem vorherigen Modell als Fallback.
- Wie wird Nutzung abgerechnet?
- Basis-Inference wird pro Token und pro Request abgerechnet, und jeder Service rechnet auf einer eigenen Zeile ab, wenn er läuft, also sind Firewall, Retrieval, Routing und Cache separat sichtbar. Ein Cache Hit überspringt die Inference-Position vollständig.
Andere Optionen abwägen?
Holen Sie sich die Residency-Antwort diese Woche.
Steht Selbsthosting auf der Roadmap, kommt die Compliance-Frist aber früher, dann starten Sie jetzt auf Akumi. Die API ist ohnehin OpenAI-kompatibel, ein späterer Wechsel ist also eine base_url.