← Blog

EU-hosting findes — men regn cache-økonomien med

Mads Kristiansen

CTO, Liviate

Der er én linje i din AI-regning, som næsten ingen taler om — og den kan være forskellen på €500 og €5.000 om måneden for præcis samme arbejdsbyrde. Den hedder caching. Og her i EU har den et underligt hul, der rammer lige præcis de dyreste modeller.

Dette er et public service-indlæg: en kortlægning af, hvem der faktisk har caching, hvem der ikke har, og hvad du konkret skal tjekke, før du vælger en EU-udbyder.

Hvad caching egentlig betyder for din regning

Når du sender et kald til en LLM, skal modellen "læse" hele din prompt — system-prompten, værktøjsskemaerne, RAG-dokumenterne, samtalehistorikken — fra bunden, hver eneste gang.

Caching betyder, at udbyderen gemmer beregningen af den del af prompten, der ikke ændrer sig mellem kald, og genbruger den. For agenter, chat og RAG er typisk 70–90 % af input-tokens gentaget kontekst. Uden caching betaler du fuld pris for de samme tokens igen og igen. Med caching betaler du en brøkdel.

Konsekvensen er voldsom. Se bare på Moonshots egen K3-API:

Uden cache-hit Med cache-hit
Input $3,00 / 1M tokens $0,30 / 1M tokens
Rabat 90 %

Samme model, samme tokens — ti gange dyrere, hvis cachen ikke er der.

Kortlægningen: hvem har caching, hvem har ikke

Her er status per august 2026, verificeret på udbydernes egne prissider og dokumentation.

Har caching med reel rabat:

Udbyder Mekanisme Rabat
Moonshot (Kimi) Automatisk context caching 90 % ($0,30 vs $3,00)
DeepSeek Context caching på disk, cache-hit/miss op til 98 %
Anthropic Prompt caching (automatisk + eksplicit) ~90 % ved læsning
OpenAI Automatisk prompt caching 50 %
Google Gemini Implicit + eksplicit context caching varierer
Mistral prompt_cache_key 90 % (10 % af inputpris)

Har det ikke — eller kun inkonsekvent:

Udbyder Status
Nebius — Kimi K3 Cached-pris = input-pris ($3,00 = $3,00). Ingen rabat.
Nebius — GLM-5.2, MiniMax-M3, Kimi K2.7 Code Ingen cached-pris opgivet overhovedet
HostYourAI — Kimi K3 Ingen cached-pris; kun input/output
OVHcloud AI Endpoints Ikke dokumenteret
Scaleway Generative APIs (delt) Åben feature-request — findes kun implicit på dedikerede deployments

Det mærkelige mønster

Læg mærke til, hvor hullet er. Hos Nebius er det ikke sådan, at de slet ikke kan finde ud af caching:

Nebius-model Input Cached input Rabat
GLM-5 $1,00 $0,10 90 %
Kimi K2.5 $0,50 $0,05 90 %
DeepSeek V4 Pro $1,75 $0,15 91 %
Hermes-4-405B $1,00 $0,10 90 %
Kimi K3 $3,00 $3,00 0 %
GLM-5.2 $1,40 ingen
Kimi K2.7 Code $0,95 ingen

De billige modeller får caching. De nyeste, dyreste frontier-modeller får den ikke. Det er præcis omvendt af, hvad du som kunde har brug for — for 10 % rabat på en $0,10-model er ligegyldig, mens 0 % rabat på en $3,00-model er en regning, der eksploderer.

Regne-eksemplet: hvad koster hullet dig egentlig?

Lad os tage en helt typisk agent: en support-/RAG-agent med 200K tokens fælles kontekst (system-prompt, værktøjsskemaer og dokumentation), der kører 10.000 kald om måneden. Hvert kald sender den samme 200K kontekst plus 5K nyt input, og producerer 5K output.

Token-type Mængde / måned
Cachebar kontekst (gentages hvert kald) 2.000 M tokens
Nyt input (varierer pr. kald) 50 M tokens
Output 50 M tokens

Nu regner vi den samme arbejdsbyrde hos to udbydere — Moonshot (med automatisk cache) og Nebius (K3 uden cache):

Post Moonshot (90 % cache) Nebius (ingen cache)
Cachebar input 2.000 M × $0,30 = $600 2.000 M × $3,00 = $6.000
Nyt input 50 M × $3,00 = $150 50 M × $3,00 = $150
Output 50 M × $15 = $750 50 M × $15 = $750
Total / måned $1.500 $6.900

Samme model, samme tokens, samme kvalitet — 4,6 gange dyrere. Forskellen på $5.400 om måneden (≈ $65.000 om året) kommer udelukkende fra den manglende cache.

Og bemærk: jo mere kontekst du genbruger — større RAG-korpus, længere agent-historik — jo værre bliver regnestykket, fordi rabatten aldrig rammer de gentagne tokens.

Hvorfor sker det?

Der er en teknisk-økonomisk grund, og den er værd at kende:

En fælles KV-cache-pool kræver, at udbyderen holder store mængder VRAM bundet i "gemte præfikser" på tværs af alle sine kunder — døgnet rundt. For en 2,8T-parameter model som K3 (1,56 TB checkpoint) er den VRAM ekstremt dyr. At holde cachen varm for en hel tenant-pulje er i praksis at afstå inference-kapacitet, man ellers kunne sælge for $3/M token.

Så der er et reelt incitament til at springe cachen over på netop de modeller, hvor den koster mest at drive — og lade regningen lande hos kunden. Problemet er bare, at det er usynligt: der står stadig "transparent per-token pricing" på forsiden, og intet i API-svaret fortæller dig, at du lige betalte fuld pris for 50.000 tokens, du allerede havde betalt for i forrige kald.

Det her er også et argument for self-hosting

Og her bliver det relevant for os, der selv hoster: den billigste cache er din egen.

Når du kører en open-weight model i fx vLLM, får du automatisk prefix caching gratis — KV-cachen er din, den koster dig ingenting per token, og den bliver ikke taget fra dig, fordi en anden tenant har brug for VRAM'en. Du ejer besparelsen i stedet for at håbe på, at udbyderen giver dig den.

For en cache-tung arbejdsbyrde (agent-løkker, lang samtalehistorik, RAG over faste dokumenter) kan den forskel alene gøre self-hosting billigere end en "billig" hosted API — selv før du regner data-residens med.

Tjeklisten: 5 spørgsmål før du vælger en AI-udbyder

  1. Findes der en cached-pris? Kig efter "cached input", "cache hit" eller "prefix caching" på prissiden. Mangler linjen, så antag fuld pris.
  2. Er den automatisk eller eksplicit? Automatisk (Moonshot, OpenAI, Anthropic) kræver intet af dig. Eksplicit (Mistral, DeepSeek) kræver en nøgle/header — ellers får du ingen rabat.
  3. Hvor stor er rabatten — og på hvilke modeller? 90 % rabat på en billig model betyder intet, hvis din dyre frontier-model står uden.
  4. Rapporterer de cache-hits i svaret? (cached_tokens, prompt_cache_hit_tokens) Hvis ikke, kan du ikke engang måle, om cachen virker.
  5. Mål din egen cache-hit-rate. Send den samme prefix to gange og sammenlign fakturerede tokens. Det er det eneste bevis, der tæller.

Bundlinjen

EU-hosting af open-weight-modeller er ægte, og det bliver bedre. Mistral beviser, at en europæisk udbyder sagtens kan levere caching med 90 % rabat. Men lige nu er der et systematisk hul på netop de nyeste og dyreste modeller — og det er et hul, du betaler for i stilhed, fordi "transparent per-token pricing" ikke viser dig cachen.

Så næste gang nogen præsenterer en EU-host med en flot $/token-pris: spørg, hvad den cached pris er. Hvis der ikke er noget svar, er prisen ikke den, du tror.

Vil du tale om, hvad der reelt blokerer jeres AI-initiativer?

Mads Kristiansen tager gerne en uforpligtende snak.

Book et møde →