Der er én linje i din AI-regning, som næsten ingen taler om — og den kan være forskellen på €500 og €5.000 om måneden for præcis samme arbejdsbyrde. Den hedder caching. Og her i EU har den et underligt hul, der rammer lige præcis de dyreste modeller.
Dette er et public service-indlæg: en kortlægning af, hvem der faktisk har caching, hvem der ikke har, og hvad du konkret skal tjekke, før du vælger en EU-udbyder.
Hvad caching egentlig betyder for din regning
Når du sender et kald til en LLM, skal modellen "læse" hele din prompt — system-prompten, værktøjsskemaerne, RAG-dokumenterne, samtalehistorikken — fra bunden, hver eneste gang.
Caching betyder, at udbyderen gemmer beregningen af den del af prompten, der ikke ændrer sig mellem kald, og genbruger den. For agenter, chat og RAG er typisk 70–90 % af input-tokens gentaget kontekst. Uden caching betaler du fuld pris for de samme tokens igen og igen. Med caching betaler du en brøkdel.
Konsekvensen er voldsom. Se bare på Moonshots egen K3-API:
| Uden cache-hit | Med cache-hit | |
|---|---|---|
| Input | $3,00 / 1M tokens | $0,30 / 1M tokens |
| Rabat | — | 90 % |
Samme model, samme tokens — ti gange dyrere, hvis cachen ikke er der.
Kortlægningen: hvem har caching, hvem har ikke
Her er status per august 2026, verificeret på udbydernes egne prissider og dokumentation.
Har caching med reel rabat:
| Udbyder | Mekanisme | Rabat |
|---|---|---|
| Moonshot (Kimi) | Automatisk context caching | 90 % ($0,30 vs $3,00) |
| DeepSeek | Context caching på disk, cache-hit/miss | op til 98 % |
| Anthropic | Prompt caching (automatisk + eksplicit) | ~90 % ved læsning |
| OpenAI | Automatisk prompt caching | 50 % |
| Google Gemini | Implicit + eksplicit context caching | varierer |
| Mistral | prompt_cache_key |
90 % (10 % af inputpris) |
Har det ikke — eller kun inkonsekvent:
| Udbyder | Status |
|---|---|
| Nebius — Kimi K3 | Cached-pris = input-pris ($3,00 = $3,00). Ingen rabat. |
| Nebius — GLM-5.2, MiniMax-M3, Kimi K2.7 Code | Ingen cached-pris opgivet overhovedet |
| HostYourAI — Kimi K3 | Ingen cached-pris; kun input/output |
| OVHcloud AI Endpoints | Ikke dokumenteret |
| Scaleway Generative APIs (delt) | Åben feature-request — findes kun implicit på dedikerede deployments |
Det mærkelige mønster
Læg mærke til, hvor hullet er. Hos Nebius er det ikke sådan, at de slet ikke kan finde ud af caching:
| Nebius-model | Input | Cached input | Rabat |
|---|---|---|---|
| GLM-5 | $1,00 | $0,10 | 90 % |
| Kimi K2.5 | $0,50 | $0,05 | 90 % |
| DeepSeek V4 Pro | $1,75 | $0,15 | 91 % |
| Hermes-4-405B | $1,00 | $0,10 | 90 % |
| Kimi K3 | $3,00 | $3,00 | 0 % |
| GLM-5.2 | $1,40 | — | ingen |
| Kimi K2.7 Code | $0,95 | — | ingen |
De billige modeller får caching. De nyeste, dyreste frontier-modeller får den ikke. Det er præcis omvendt af, hvad du som kunde har brug for — for 10 % rabat på en $0,10-model er ligegyldig, mens 0 % rabat på en $3,00-model er en regning, der eksploderer.
Regne-eksemplet: hvad koster hullet dig egentlig?
Lad os tage en helt typisk agent: en support-/RAG-agent med 200K tokens fælles kontekst (system-prompt, værktøjsskemaer og dokumentation), der kører 10.000 kald om måneden. Hvert kald sender den samme 200K kontekst plus 5K nyt input, og producerer 5K output.
| Token-type | Mængde / måned |
|---|---|
| Cachebar kontekst (gentages hvert kald) | 2.000 M tokens |
| Nyt input (varierer pr. kald) | 50 M tokens |
| Output | 50 M tokens |
Nu regner vi den samme arbejdsbyrde hos to udbydere — Moonshot (med automatisk cache) og Nebius (K3 uden cache):
| Post | Moonshot (90 % cache) | Nebius (ingen cache) |
|---|---|---|
| Cachebar input | 2.000 M × $0,30 = $600 | 2.000 M × $3,00 = $6.000 |
| Nyt input | 50 M × $3,00 = $150 | 50 M × $3,00 = $150 |
| Output | 50 M × $15 = $750 | 50 M × $15 = $750 |
| Total / måned | $1.500 | $6.900 |
Samme model, samme tokens, samme kvalitet — 4,6 gange dyrere. Forskellen på $5.400 om måneden (≈ $65.000 om året) kommer udelukkende fra den manglende cache.
Og bemærk: jo mere kontekst du genbruger — større RAG-korpus, længere agent-historik — jo værre bliver regnestykket, fordi rabatten aldrig rammer de gentagne tokens.
Hvorfor sker det?
Der er en teknisk-økonomisk grund, og den er værd at kende:
En fælles KV-cache-pool kræver, at udbyderen holder store mængder VRAM bundet i "gemte præfikser" på tværs af alle sine kunder — døgnet rundt. For en 2,8T-parameter model som K3 (1,56 TB checkpoint) er den VRAM ekstremt dyr. At holde cachen varm for en hel tenant-pulje er i praksis at afstå inference-kapacitet, man ellers kunne sælge for $3/M token.
Så der er et reelt incitament til at springe cachen over på netop de modeller, hvor den koster mest at drive — og lade regningen lande hos kunden. Problemet er bare, at det er usynligt: der står stadig "transparent per-token pricing" på forsiden, og intet i API-svaret fortæller dig, at du lige betalte fuld pris for 50.000 tokens, du allerede havde betalt for i forrige kald.
Det her er også et argument for self-hosting
Og her bliver det relevant for os, der selv hoster: den billigste cache er din egen.
Når du kører en open-weight model i fx vLLM, får du automatisk prefix caching gratis — KV-cachen er din, den koster dig ingenting per token, og den bliver ikke taget fra dig, fordi en anden tenant har brug for VRAM'en. Du ejer besparelsen i stedet for at håbe på, at udbyderen giver dig den.
For en cache-tung arbejdsbyrde (agent-løkker, lang samtalehistorik, RAG over faste dokumenter) kan den forskel alene gøre self-hosting billigere end en "billig" hosted API — selv før du regner data-residens med.
Tjeklisten: 5 spørgsmål før du vælger en AI-udbyder
- Findes der en cached-pris? Kig efter "cached input", "cache hit" eller "prefix caching" på prissiden. Mangler linjen, så antag fuld pris.
- Er den automatisk eller eksplicit? Automatisk (Moonshot, OpenAI, Anthropic) kræver intet af dig. Eksplicit (Mistral, DeepSeek) kræver en nøgle/header — ellers får du ingen rabat.
- Hvor stor er rabatten — og på hvilke modeller? 90 % rabat på en billig model betyder intet, hvis din dyre frontier-model står uden.
- Rapporterer de cache-hits i svaret? (
cached_tokens,prompt_cache_hit_tokens) Hvis ikke, kan du ikke engang måle, om cachen virker. - Mål din egen cache-hit-rate. Send den samme prefix to gange og sammenlign fakturerede tokens. Det er det eneste bevis, der tæller.
Bundlinjen
EU-hosting af open-weight-modeller er ægte, og det bliver bedre. Mistral beviser, at en europæisk udbyder sagtens kan levere caching med 90 % rabat. Men lige nu er der et systematisk hul på netop de nyeste og dyreste modeller — og det er et hul, du betaler for i stilhed, fordi "transparent per-token pricing" ikke viser dig cachen.
Så næste gang nogen præsenterer en EU-host med en flot $/token-pris: spørg, hvad den cached pris er. Hvis der ikke er noget svar, er prisen ikke den, du tror.