← Blog

Mistral Shieldstral: en open-weight sikkerhedsvogter til billeder og tekst

Mads Kristiansen

CTO, Liviate

Mistral har frigivet Shieldstral, en 3 milliarder parameter stor multimodal sikkerhedsklassifikator under Apache 2.0-licens. Modellen er ikke en chatbot, men en guard model: den vurderer, om tekst eller billeder overtræder en given sikkerhedspolitik.

Én model, mange politikker

Det særlige ved Shieldstral er dens fleksibilitet. I stedet for en foruddefineret liste over farlige kategorier stiller operatøren et ja/nej-spørgsmål ved inference-tidspunktet. Eksempler kan være:

  • "Promoverer dette indhold fysisk vold?"
  • "Er dette billede sikkert at vise for et barn?"
  • "Nægtede assistenten at svare på denne forespørgsel?"

Det betyder, at én og samme model kan bruges til prompt-klassifikation, response-moderation, refusal detection og toksicitetsanalyse — uden omtræning.

Sådan fungerer den

Input består af tre dele:

  1. — kontekst, strictness og eventuel definition af usikkert indhold
  2. — det konkrete ja/nej-spørgsmål
  3. — tekst, billede eller et prompt-response-par

Modellen returnerer logits for "ja" og "nej", som normaliseres til en kontinuerlig sikkerhedsscore. Jo højere score, jo større sandsynlighed for overtrædelse.

Lille, men stærk

Med kun 3 milliarder parametre kan Shieldstral køre på en enkelt 16 GB NVIDIA GPU. Alligevel matcher eller overgår den guard-modeller op til syv gange større på tekst-sikkerhed, og den sætter ny state-of-the-art på multimodal moderation ifølge Mistral selv.

Træningsmetode

Modellen er trænet på omkring 54,1 millioner samples fra mange forskellige kilder med forskellige taxonomier. Nøglen er kontrastive træningspar: tekst omskrives, så den overtræder én politik uden at overtræde en lignende. Det tvinger modellen til at lære de præcise forskelle mellem politikker frem for at gætte på faste labels.

Til billeddelen suppleres med generelle vision-datasæt, da usikre billeder ikke kan syntetiseres lige så let som tekst.

Open-source sikkerhed som strategi

Mistral er stiftende medlem af Open Secure AI Alliance sammen med blandt andre NVIDIA. Frigivelsen af Shieldstral som åben vægt passer ind i en bredere dagsorden: hvis sikkerhedsværktøjerne er åbne, kan flere virksomheder og forskere bygge pålidelige guardrails uden at være låst til en enkelt udbyders fortolkning af "sikkerhed".

Hvorfor det betyder noget

Efterhånden som open-weight-modeller nærmer sig frontier-ydeevne, bliver sikkerhedsaspektet mere presserende. Shieldstral viser, at open-source-bevægelsen ikke kun handler om at frigive store sprogmodeller — den handler også om at udstyre operatører med værktøjer til at kontrollere dem.

Kilder

Vil du tale om, hvad der reelt blokerer jeres AI-initiativer?

Mads Kristiansen tager gerne en uforpligtende snak.

Book et møde →