Mistral har frigivet Shieldstral, en 3 milliarder parameter stor multimodal sikkerhedsklassifikator under Apache 2.0-licens. Modellen er ikke en chatbot, men en guard model: den vurderer, om tekst eller billeder overtræder en given sikkerhedspolitik.
Én model, mange politikker
Det særlige ved Shieldstral er dens fleksibilitet. I stedet for en foruddefineret liste over farlige kategorier stiller operatøren et ja/nej-spørgsmål ved inference-tidspunktet. Eksempler kan være:
- "Promoverer dette indhold fysisk vold?"
- "Er dette billede sikkert at vise for et barn?"
- "Nægtede assistenten at svare på denne forespørgsel?"
Det betyder, at én og samme model kan bruges til prompt-klassifikation, response-moderation, refusal detection og toksicitetsanalyse — uden omtræning.
Sådan fungerer den
Input består af tre dele:
— kontekst, strictness og eventuel definition af usikkert indhold— det konkrete ja/nej-spørgsmål— tekst, billede eller et prompt-response-par
Modellen returnerer logits for "ja" og "nej", som normaliseres til en kontinuerlig sikkerhedsscore. Jo højere score, jo større sandsynlighed for overtrædelse.
Lille, men stærk
Med kun 3 milliarder parametre kan Shieldstral køre på en enkelt 16 GB NVIDIA GPU. Alligevel matcher eller overgår den guard-modeller op til syv gange større på tekst-sikkerhed, og den sætter ny state-of-the-art på multimodal moderation ifølge Mistral selv.
Træningsmetode
Modellen er trænet på omkring 54,1 millioner samples fra mange forskellige kilder med forskellige taxonomier. Nøglen er kontrastive træningspar: tekst omskrives, så den overtræder én politik uden at overtræde en lignende. Det tvinger modellen til at lære de præcise forskelle mellem politikker frem for at gætte på faste labels.
Til billeddelen suppleres med generelle vision-datasæt, da usikre billeder ikke kan syntetiseres lige så let som tekst.
Open-source sikkerhed som strategi
Mistral er stiftende medlem af Open Secure AI Alliance sammen med blandt andre NVIDIA. Frigivelsen af Shieldstral som åben vægt passer ind i en bredere dagsorden: hvis sikkerhedsværktøjerne er åbne, kan flere virksomheder og forskere bygge pålidelige guardrails uden at være låst til en enkelt udbyders fortolkning af "sikkerhed".
Hvorfor det betyder noget
Efterhånden som open-weight-modeller nærmer sig frontier-ydeevne, bliver sikkerhedsaspektet mere presserende. Shieldstral viser, at open-source-bevægelsen ikke kun handler om at frigive store sprogmodeller — den handler også om at udstyre operatører med værktøjer til at kontrollere dem.