Hvor tæt er open-weight modeller egentlig på frontier? Svaret afhænger af hvordan du måler
I juni udgav Jamie Dborin fra inference-firmaet Doubleword et blogindlæg med en opsigtsvækkende forudsigelse: En frontier open-source LLM vil blive udgivet den 3. december 2026. Overskriften var selvfølgelig provokerende ment – men analysen bag den rammer et centralt punkt i debatten om åbne vs. lukkede modeller i denne sommer.
Forudsigelsen kommer fra et plot, der florerer på Twitter/X og viser afstanden mellem de bedste åbne vægte-modeller og de lukkede frontier-modeller på Artificial Analysis Intelligence Index – et samlet indeks, der forsøger at vurdere modellernes samlede kapacitet. Hvis man tegner en trendlinje gennem gabet og forlænger den frem i tiden, krydser den nul omkring den 3. december i år.
Men som Dborin selv understreger med et glimt i øjet – inden man likviderer pensionen og flytter til en fjern ø – er det ikke hele billedet.
Én benchmark kan snyde dig
Det store problem er, at ét enkelt indeks ikke giver et fuldstændigt billede af en models evner. Derfor gentog Doubleword analysen på 18 forskellige benchmarks fra Artificial Analysis – lige fra matematik og kodning til agentiske opgaver og terminalarbejde.
Resultatet er tankevækkende:
| Måling | Resultat |
|---|---|
| Intelligence Index alene | Gab lukkes omkring dec. 2026 |
| Gennemsnit over alle 18 benchmarks | Næsten fladt – lige under 5 måneder bagud hele perioden |
| Kodningsindeks | Fra 15 måneder bagud til kun 1–2 måneder |
| De fleste øvrige benchmarks | Moderat stigende gab over tid |
Med andre ord: Hvis du kun kigger på ét indeks, kan du forudsige "open source-singulariteten" til jul – men hvis du kigger på tværs af mange målinger, ligger åbne modeller konsekvent omkring fem måneder bagud, og gabet er måske endda ved at vokse igen uden for kodning.
Baggrunden: hvor står vi egentlig i sommeren 2026?
De seneste uger har budt på en række markante open-weight udgivelser – Kimi K3 fra Moonshot AI (2,8 billioner parametre), GLM-5.2 fra Z.ai og Qwen3.8-Max fra Alibaba. Det er værd at sætte dem i kontekst:
Frontier-gabet er reelt lille. Ifølge State of Open Source AI-rapporten (juli 2026) scorer den stærkeste lukkede model (Claude Opus 5) 61 på Artificial Analysis Intelligence Index v4.1 mod den stærkeste åbne model (Kimi K3) med 57. Kimi K3 ligger altså nummer fire samlet set – foran tre af de største lukkede laboratorier. Epoch Capabilities Index viser samme billede: Kimi K3 på 156 mod GPT‑5.6 Sol på 162 – et gab på seks point, cirka én udgivelsescyklus.
Men det afhænger af typen af opgave. På frontend-kodning fører åbne modeller faktisk an (Kimi K3 debuterede først på LMArenas Frontend Code Arena). På agentisk terminalarbejde er det tæt løb (88,3 mod Sols 88,8). Til gengæld har lukkede modeller stadig en klar kant inden for dyb ræsonnering, lang-kontekst-pålidelighed og professionel vidensbearbejdning.
Et uafhængigt LessWrong-studie peger desuden på noget vigtigt: På private benchmarks, hvor data ikke er offentligt tilgængelige, er åbne modeller stadig omkring 8–10 måneder bagud – mens gabet kun er 4–6 måneder på offentlige benchmarks. Det antyder en del benchmark-overfitting blandt de åbne modeller.
Hvorfor betyder det noget?
Der er mindst tre grunde til, at dette emne fortjener opmærksomhed:
Måleproblemet er reelt
Historien illustrerer, hvor svært det er at måle LLM-kvalitet overhovedet. Alt efter hvilket indeks du vælger, får du vidt forskellige konklusioner om, hvor tæt åben kildekode er på frontier-niveauet. Det betyder konkret noget for virksomheder, der skal vælge modelleverandør – og for debatten om regulering, der bygger på disse tal.
Økonomien har allerede flyttet sig
Selvom frontier-gabet består teknisk set, handler produktionen allerede i høj grad om åbne vægte-modeller ifølge rapporten: De syv mest anvendte modeller målt på tokenvolumen på OpenRouter har alle åbne vægte, og majoriteten af produktions-tokens rutes nu gennem dem. Prisfaldet har været dramatisk – inferensprisen faldt cirka 50× over tre år. Når man kan nå inden for få point af frontier-niveauet til en brøkdel af prisen (Kimi K3 koster cirka en tredjedel), bliver regnestykket hurtigt interessant for de fleste workloads.
Suverænitetsvinklen
For europæiske virksomheder peger tendensen direkte ind i debatten om AI-suverænitet og EU-hosted infrastruktur (som vi også har dækket her på bloggen tidligere). Hvis de bedste modellers evner kan hentes ned som åbne vægte og køres lokalt eller hos europæiske hostingudbydere frem for via amerikanske API'er eller cloud-tjenester med dataoverførsel til tredjelande – så ændrer det compliance-billedet markant under både GDPR og EU's AI Act.
Konklusion
Doublewords analyse leverer ikke et endeligt svar – tværtimod demonstrerer den elegant, hvor let det er at narre sig selv med ét tal alene. Det mest ærlige billede lige nu ser sådan ud:
Åbne vægte-modeller har reelt indhentet frontieren inden for kodning og agentiske opgaver til nær-paritet – men ligger stadig flere måneder bagud samlet set, især når man måler bredt eller på private benchmarks, der ikke kan trænes imod.
Uanset hvilken side man falder ned på i "open source-singulariteten"-debatten, så understreger historien én ting klart: Fremtidens modelvalg handler mindre om "åben vs. lukket" som sort/hvid-spørgsmål og mere om at matche den rigtige model til den rigtige opgave – med øje for både kapabiliteter, pris og datajurisdiktion.