Vergelijking
Akumi vs open modellen zelf hosten
Mistral of Llama op je eigen GPUs draaien klinkt als het schoonste residency-antwoord, tot je het doorrekent. Het is een serving-stack, een GPU-budget dat rekent of er nu iemand een request stuurde of niet, een piketdienst, en een laag controls die je nog steeds zelf moet schrijven. Akumi geeft je het EU-resident antwoord zonder de vloot, en residency die je per request kunt aantonen in plaats van per datacenter.
Het levert je een model op, geen platform.
Een open-weights model zelf hosten is het antwoord dat in een vergadering het schoonst klinkt, en als technische stellingname is het volledig consistent. Je hebt nog steeds ergens plek nodig voor je documenten en iets om ze op te halen zonder het ene team in de antwoorden van het andere te laten lekken. Je moet nog steeds persoonsgegevens maskeren, prompt injection vangen, en een record produceren dat een toezichthouder accepteert. En onder dat alles ligt een GPU-rekening die komt of er nu iemand die maand een request stuurde of niet.
De twee dingen die vergeleken worden
Wat elk precies is.
Allebei geven ze je EU-residency. Ze verschillen in wie het ding beheert dat het levert.
Akumi
Een managed EU-resident AI-platform achter één OpenAI-compatible endpoint. EU-resident modellen, een firewall, een knowledge graph voor retrieval en memory, een response cache en observability per request, allemaal per gebruik afgerekend. Niets aan te maken, te patchen of te schalen, en residency per request vastgelegd in een audit trail met alleen metadata.
Zelf hosten
Je draait open-weights modellen op hardware die je zelf beheert, meestal met een inference-server als vLLM ervoor. Jij kiest de modellen, de quantisatie en de serving-topologie, en jij hebt de capaciteitsplanning, de upgrades, de uptime en alles boven de completion: retrieval, scheiding, redactie, caching en audit.
Naast elkaar
Volledige controle, en de rekening volledig van jou.
| Onderdeel | Akumi | Zelf gehost |
|---|---|---|
| Residency-bewijs | EU-resident standaard, en aantoonbaar per request: elke call legt het model, de provider en de regio vast die hem bediende. | Absoluut door de constructie, met de audit trail en het bewijs voor je toezichthouder aan jou om te bouwen. |
| Operationele last | Geen. Bedienen, schalen, upgrades en capaciteit zijn van ons. | Van jou: GPU-capaciteit, inference-servers, modelupgrades, en iemand die de pieper draagt. |
| Vorm van de kosten | Credits op gebruik. Draait er niets, dan kost er niets. | Vaste GPU-uitgaven of er nu iemand een request stuurt of niet, plus de engineers die het overeind houden. |
| De laag boven het model | Firewall, egress-policy, audit trail en retrieval al gebouwd en afgerekend. | Elk onderdeel is van jou om te bouwen, te testen en correct te houden terwijl modellen en regelgeving bewegen. |
| Retrieval | Memory uit gesprekken en je documenten delen één knowledge graph. Elke collection is een eigen partitie, en elke response draagt de bronnen die hij gebruikte. | Open weights bedienen levert je een model op, geen knowledge-laag. De store, het inlezen, het ranken en de scheiding tussen teams liggen allemaal nog voor je. |
| Modellen bijhouden | Een samengestelde roster achter één endpoint. Nieuwe modellen komen getest en geprijsd binnen, en wisselen is een string. | Elke upgrade is een project: nieuwe weights, nieuwe serving-config, nieuwe benchmarks, en een terugvalplan. |
| Tijd tot productie | Minuten. Aanmelden, key, één base_url. | Weken tot maanden, afhankelijk van inkoop, levertijden van hardware, en hoeveel van de stack al bestaat. |
- Residency-bewijsAkumiEU-resident standaard, en aantoonbaar per request: elke call legt het model, de provider en de regio vast die hem bediende.Zelf gehostAbsoluut door de constructie, met de audit trail en het bewijs voor je toezichthouder aan jou om te bouwen.
- Operationele lastAkumiGeen. Bedienen, schalen, upgrades en capaciteit zijn van ons.Zelf gehostVan jou: GPU-capaciteit, inference-servers, modelupgrades, en iemand die de pieper draagt.
- Vorm van de kostenAkumiCredits op gebruik. Draait er niets, dan kost er niets.Zelf gehostVaste GPU-uitgaven of er nu iemand een request stuurt of niet, plus de engineers die het overeind houden.
- De laag boven het modelAkumiFirewall, egress-policy, audit trail en retrieval al gebouwd en afgerekend.Zelf gehostElk onderdeel is van jou om te bouwen, te testen en correct te houden terwijl modellen en regelgeving bewegen.
- RetrievalAkumiMemory uit gesprekken en je documenten delen één knowledge graph. Elke collection is een eigen partitie, en elke response draagt de bronnen die hij gebruikte.Zelf gehostOpen weights bedienen levert je een model op, geen knowledge-laag. De store, het inlezen, het ranken en de scheiding tussen teams liggen allemaal nog voor je.
- Modellen bijhoudenAkumiEen samengestelde roster achter één endpoint. Nieuwe modellen komen getest en geprijsd binnen, en wisselen is een string.Zelf gehostElke upgrade is een project: nieuwe weights, nieuwe serving-config, nieuwe benchmarks, en een terugvalplan.
- Tijd tot productieAkumiMinuten. Aanmelden, key, één base_url.Zelf gehostWeken tot maanden, afhankelijk van inkoop, levertijden van hardware, en hoeveel van de stack al bestaat.
De rekening
De GPU-rekening komt of iemand hem gebruikte of niet.
Prijzen op gebruik en gereserveerde capaciteit gedragen zich heel verschillend, en het verschil is geen afrondingsfout. Een zelf gehoste opstelling op maat van je drukste uur betaal je ook tijdens elk rustig uur: 's nachts, in het weekend, en in de maanden dat de feature live is maar de adoptie nog groeit. Zet hem op het gemiddelde en het drukke uur is waar je gebruikers een wachtrij tegenkomen.
Akumi rekent per token en per request af, dus een rustige week kost niets en een lanceerweek schaalt zonder inkoopgesprek. Een cache hit haalt de inference-post helemaal weg, dus de rekening volgt het werk in plaats van de capaciteit die je voor de zekerheid reserveerde.
| Onderdeel | Akumi | Zelf gehost |
|---|---|---|
| Rustige periodes | Niets. Je betaalt voor requests, niet voor gereserveerde capaciteit. | De volle kosten, wat de bezetting ook is. |
| Een plotselinge piek | Opgevangen. Schalen is onze zorg. | Een wachtrij, of capaciteit die je vooraf kocht en het hele jaar betaalde. |
| Wat de rekening volgt | Gedaan werk, uitgesplitst per request en per service. | Gereserveerde hardware, plus de mensen die hem gezond houden. |
- Rustige periodesAkumiNiets. Je betaalt voor requests, niet voor gereserveerde capaciteit.Zelf gehostDe volle kosten, wat de bezetting ook is.
- Een plotselinge piekAkumiOpgevangen. Schalen is onze zorg.Zelf gehostEen wachtrij, of capaciteit die je vooraf kocht en het hele jaar betaalde.
- Wat de rekening volgtAkumiGedaan werk, uitgesplitst per request en per service.Zelf gehostGereserveerde hardware, plus de mensen die hem gezond houden.
De andere twee derde
Een model bedienen is het makkelijke derde deel.
Een model tokens laten teruggeven op je eigen hardware is een opgelost probleem, en een goede engineer heeft het in een week draaien. De overige twee derde zijn het deel dat het kwartaal kost: een documentstore en een inleespad, retrieval dat goed genoeg rankt om nuttig te zijn, scheiding zodat de documenten van de ene klant nooit in het antwoord van een andere opduiken, maskeren van persoonsgegevens vóór egress, injection-scanning over alles wat een tool teruggeeft, een cache, en een audit trail die specifiek genoeg is dat iemand kan zeggen waar een bepaalde request draaide.
Niets daarvan is exotisch, en alles ervan is dragend. Het is ook het deel dat aandacht blijft vragen, want de aanvallen veranderen, de modellen veranderen en de verplichtingen veranderen.
| Onderdeel | Akumi | Zelf gehost |
|---|---|---|
| Tokens terugkrijgen | Inbegrepen. | Een week werk, en het oprecht leuke deel. |
| Retrieval en scheiding | Een knowledge graph, per workspace gepartitioneerd voordat de query wordt opgebouwd. | Een store, een inleespad, ranking, en de scheidingslogica tussen tenants. |
| Redactie en injection | De firewall op dezelfde request, standaard aan. | Van jou om te schrijven, en van jou om actueel te houden terwijl aanvallen evolueren. |
| Audit en bewijs | Record met alleen metadata van model, provider en regio, per request. | Van jou om te ontwerpen, op te slaan, te bewaren en te verdedigen. |
- Tokens terugkrijgenAkumiInbegrepen.Zelf gehostEen week werk, en het oprecht leuke deel.
- Retrieval en scheidingAkumiEen knowledge graph, per workspace gepartitioneerd voordat de query wordt opgebouwd.Zelf gehostEen store, een inleespad, ranking, en de scheidingslogica tussen tenants.
- Redactie en injectionAkumiDe firewall op dezelfde request, standaard aan.Zelf gehostVan jou om te schrijven, en van jou om actueel te houden terwijl aanvallen evolueren.
- Audit en bewijsAkumiRecord met alleen metadata van model, provider en regio, per request.Zelf gehostVan jou om te ontwerpen, op te slaan, te bewaren en te verdedigen.
Modelverloop
Elk nieuw model is weer een migratie.
Modelgeneraties wisselen snel, en op zelf gehoste infrastructuur is elke wissel een project in plaats van een configwijziging: nieuwe weights om te beoordelen, serving-parameters om opnieuw af te stellen, doorvoer en geheugen om opnieuw te meten, kwaliteit om opnieuw te benchmarken tegen je eigen workload, en een terugvalplan voor als het slechter is op een manier die de benchmarks misten. Teams die hierop achterlopen draaien stilletjes een model dat een jaar ouder is dan dat van hun concurrent.
| Onderdeel | Akumi | Zelf gehost |
|---|---|---|
| Een nieuwer model in gebruik nemen | Wijzig een string, draai je evals, houd het oude als fallback. | Weights, serving-config, opnieuw afstellen, opnieuw benchmarken en een terugvalplan. |
| Achterlopen | Moeilijk, want wisselen kost bijna niets. | Gebruikelijk, want elke upgrade concurreert met productwerk. |
| Twee naast elkaar draaien | Stuur wat verkeer naar elk en vergelijk uit dezelfde tracedata. | Dubbele capaciteit, of een serving-topologie die er twee kan hosten. |
- Een nieuwer model in gebruik nemenAkumiWijzig een string, draai je evals, houd het oude als fallback.Zelf gehostWeights, serving-config, opnieuw afstellen, opnieuw benchmarken en een terugvalplan.
- AchterlopenAkumiMoeilijk, want wisselen kost bijna niets.Zelf gehostGebruikelijk, want elke upgrade concurreert met productwerk.
- Twee naast elkaar draaienAkumiStuur wat verkeer naar elk en vergelijk uit dezelfde tracedata.Zelf gehostDubbele capaciteit, of een serving-topologie die er twee kan hosten.
Het eerlijke antwoord
De echte vraag is wat je wilt beheren.
Kies Akumi als
- Je EU-residency als uitkomst wilt, niet als infrastructuurproject.
- Je team producten hoort te bouwen in plaats van inference-servers te beheren.
- Je gebruik wisselt, en betalen voor stilstaande GPUs lastig te verdedigen is.
- Je wilt dat de controls er op dag één zijn in plaats van in een latere sprint.
- Je compliance-deadline eerder komt dan je hardware.
Kies zelf hosten als
- Je eis specifiek is dat de weights draaien op hardware die je zelf bezit.
- Je volume groot, stabiel en voorspelbaar genoeg is dat gereserveerde capaciteit gunstiger is dan afrekenen op gebruik.
- Je al GPU-infrastructuur beheert en één workload erbij marginaal weinig kost.
- Je de engineeringtijd hebt om de laag boven het model te bouwen en te houden, en die wilt bezitten.
FAQ
Vragen die mensen stellen.
- Is zelf hosten goedkoper dan een managed platform?
- Dat hangt vrijwel volledig van de bezetting af. Zelf gehoste capaciteit is een vaste kostenpost die komt of er nu iemand een request stuurt of niet, dus hij beloont groot, stabiel, voorspelbaar volume. Afrekenen op gebruik beloont wisselende of groeiende workloads. De vergelijking die mensen vergeten is de engineeringtijd.
- Draait Akumi op EU-infrastructuur?
- Ja. De applicatie, de data en de modellen zijn EU-resident, en routing buiten de EU wordt geblokkeerd door een guard die dichtvalt tenzij je het expliciet toestaat. Elke request legt het model, de provider en de regio vast die hem bediende.
- Kan ik open-weights modellen zoals Mistral op Akumi gebruiken?
- Ja. De EU-resident roster draait om hen, bediend achter hetzelfde OpenAI-compatible endpoint als al het andere, dus je krijgt open modellen zonder de serving-stack te beheren die ze draait.
- En als ik later toch zelf wil gaan hosten?
- De API is OpenAI-compatible, dus in beide richtingen bewegen is een base_url in plaats van een rewrite. Op Akumi beginnen terwijl een zelfhostingproject nog op de roadmap staat is een redelijke manier om een compliance-deadline te halen die eerder komt dan je hardware.
- Hebben we nog een vector database nodig?
- Nee, en Akumi ook niet. Retrieval draait op een knowledge graph in plaats van een vector store: memory uit gesprekken en je documenten delen één substraat, dus een antwoord kan de relaties ertussen volgen in plaats van te hopen dat één chunk de hele keten bevat.
- Wie is verantwoordelijk voor modelupgrades?
- Op Akumi wij. Nieuwe modellen komen getest en geprijsd binnen achter hetzelfde endpoint, en wisselen is een stringwijziging met het vorige model als fallback.
- Hoe wordt gebruik afgerekend?
- Basisinference per token en per request, en elke service rekent op een eigen regel af wanneer hij draait, dus de firewall, retrieval, routing en de cache zijn allemaal apart zichtbaar. Een cache hit slaat de inference-post helemaal over.
Andere opties afwegen?
Krijg het residency-antwoord deze week.
Staat zelf hosten op de roadmap maar komt de compliance-deadline eerder, begin dan nu op Akumi. De API is hoe dan ook OpenAI-compatible, dus later verhuizen is een base_url.