Mistral je 4. augusta objavio open weights za Shieldstral 1.0, classifier (klasifikator, sistem za kategorizaciju zahtjeva) s 3 milijarde parametara koji tekst i slike ocjenjuje prema policy-ju zadatom u promptu. Licenca je Apache 2.0, komercijalna upotreba dozvoljena, a model u BF16 formatu staje u 16GB VRAM-a na jednom GPU-u; hostovani endpoint i cijene nigdje nisu dokumentovani. Na 3 od 9 benchmarka koje je Mistral objavio Shieldstral gubi od konkurentskih modela.

Šta se desilo

Model je objavljen na Hugging Faceu, uz najavu na Mistralovom sajtu. Baza je Ministral-3-3B-Base-2512, slike obrađuje nativni Pixtral vision encoder. Treniran je na oko 54,1 miliona uzoraka i na sekvencama do 32k tokena; model card navodi da je 256k teoretski podržano, ali preporučuje da ostanete u opsegu na kojem je model treniran. Naveden je i spisak od 12 jezika (en, fr, es, de, it, pt, nl, zh, ja, ko, ar, ru).

Umjesto da predviđa fiksne kategorije, Shieldstral odgovara na jedno da/ne pitanje o dokumentu. Prompt ima fiksni system dio i user poruku s tri polja: <Instruct> (okvir, strogost strict/moderate/lenient, opcionalne kandidat-kategorije), <Query> (jedno pitanje) i <Document> (tekst, slika ili oboje). Pri inferenciji se sa zadnje pozicije uzima top-20 logprobs, iz njih se izvlače vrijednosti logits za yes i no, pa se normaliziraju u vjerovatnoću:

P(unsafe) = exp(l_yes) / (exp(l_yes) + exp(l_no))

Rezultat je kontinuirana vrijednost iz jednog forward passa, a podrazumijevana granica je 0,5. Mistral tu ocjenu naziva “calibrated”, ali kalibracijska kriva nije objavljena. Promjena policy-ja ne zahtijeva ponovno treniranje – mijenjate tekst u promptu.

Zašto je važno

Policy kao prompt nije novost. GPT-OSS-Safeguard već radi moderaciju uslovljenu policy-jem, a modeli iste namjene (Llama Guard 4, WildGuard, ShieldGemma, Qwen3Guard, OmniGuard, LlavaGuard) postojali su prije ovog izdanja. Novo je kombinacija veličine i modaliteta – model od 3B s open weights koji pokriva i slike – plus čitanje vrijednosti logits kao izvor kontinuirane ocjene umjesto generisanog teksta.

Mistral tvrdi da model “matches or outperforms open guard models up to 7× its size”. Sedmostruka razlika odnosi se na GPT-OSS-Safeguard 20B, ali agregatne F1 vrijednosti ne stoje ni na najavi ni na model cardu – jedini izvor koji ih navodi je sekundarni (the-decoder.com). Po tom izvoru je tekstualni agregat izjednačen, 84,9% prema 84,9%: izjednačenje, ne pobjeda. Za tekst i slike isti izvor navodi 83,8%, ispred OmniGuard 7B (77,6%) i LlavaGuard 7B (71,6%). Evaluacije je proveo Mistral, na javnim skupovima s uzorcima izuzetim iz treniranja, i do 13. augusta 2026. nema nezavisne replikacije.

Po pojedinačnim benchmarkima iz model carda Shieldstral vodi na HarmBench promptovima (99,4% prema 94,5% za GPT-OSS), ToxicChatu (84,1% prema 51,0% za WildGuard), Aegis v2 odgovorima (87,2% prema 75,2% za GPT-OSS), VLGuardu (97,7% prema 88,5% za OmniGuard) i UnsafeBenchu (81,8% prema 72,6% za OmniGuard). Gubi na tri: Aegis v2 promptovi (86,2% prema 86,3% za Nemotron), XSTest Harm (93,5% prema 93,8% za GPT-OSS) i XSTest odbijanja (94,6% prema 94,9% za GPT-OSS). Razlike su male, ali Mistralova tvrdnja se temelji na agregatnom rezultatu, ne na pojedinačnim benchmarcima – a taj agregat ima samo jedan, sekundarni izvor.

Šta to znači u praksi

Podržani su vLLM ≥0.26.0 (preporučeno), llama.cpp s GGUF-om, SGLang i Transformers preko MistralCommonBackenda; za fino podešavanje (fine-tuning) Axolotl. Bitno ograničenje: ocjena je izvedena iz dvije vrijednosti logits, pa vam treba okruženje za inferenciju koje izlaže logprobs. Ako vam sloj iznad modela vraća samo tekst, tu vrijednost ne možete dobiti.

Nema objavljenih brojeva o brzini inferencije, niti podataka o kvalitetu nakon kvantizacije, iako je GGUF podržan. Da li jedan forward pass može pokriti više kategorija iz jednog policy-ja nije dokumentovano. Dva izvora se i ne poklapaju na jednom mjestu: najava višejezičnost navodi kao budući rad, dok model card tvrdi 12 podržanih jezika i navodi PolyGuard rezultat. To pitanje ostaje otvoreno.

Za tim koji danas plaća API za moderaciju, ovo je model od 3B koji možete držati lokalno hostovanim (self-hosted) na jednoj kartici sa 16GB VRAM-a, sa zaštitnim ogradama (guardrails) definisanim kao verzionirani tekst prompta. Prije bilo kakve odluke pročitajte sekciju s ograničenjima u model cardu – najava je ne sadrži.

Izvori