Il nuovo strumento di sicurezza di Mistral legge le vostre regole e le applica istantaneamente

Shieldstral è un piccolo modello di IA gratuito che esamina testi e immagini alla ricerca di contenuti dannosi utilizzando politiche in linguaggio naturale che scrivi tu stesso. Non è richiesta alcuna conoscenza specialistica.

AI2Day Newsdesk4 min read
A glowing digital switchboard or routing diagram rendered in deep blues and amber, with branching pathways lit at different intensities diverging from a central
Share

Punti chiave

  • Mistral AI ha rilasciato Shieldstral, un modello di moderazione dei contenuti open-source con 3 miliardi di parametri, nel 2025.
  • Il modello eguaglia o supera i modelli concorrenti fino a sette volte più grande sui benchmark di sicurezza standard.
  • A differenza della maggior parte degli strumenti di moderazione, accetta regole di sicurezza in linguaggio naturale al momento dell'uso, senza necessità di riaddestramento.
  • Esamina testi, immagini o una combinazione di entrambi attraverso un'unica interfaccia.
  • Shieldstral funziona su una singola scheda grafica consumer da 16GB ed è gratuito secondo la licenza Apache 2.0.

La moderazione dei contenuti, il compito di decidere cosa un sistema di IA dovrebbe e non dovrebbe dire o mostrare, ha un segreto sgradevole. La maggior parte degli strumenti che svolgono questo lavoro codifica le loro regole in modo permanente. Cambia le regole e devi ricostruire tutto da zero.

Mistral AI sta cercando di risolvere il problema.

L'azienda ha rilasciato Shieldstral questa settimana: un modello di sicurezza dei contenuti, un software che giudica se testi o immagini violano una determinata politica, che apprende le tue regole al volo. Digiti una domanda in linguaggio naturale, ad esempio "Questo contenuto promuove l'autolesionismo?" Il modello la legge, legge il contenuto e restituisce un punteggio da zero a uno che indica la probabilità di una violazione. Niente codice. Niente riaddestramento.

Perché questo è importante per chiunque al di fuori di un laboratorio di IA?

Ogni app che utilizza un chatbot di IA o un generatore di immagini ha bisogno di un qualche tipo di filtro di sicurezza. I team che costruiscono quelle app attualmente affrontano una scelta difficile: utilizzare un filtro rigido e pronto all'uso che potrebbe non adattarsi ai loro utenti, o spendere mesi e denaro significativo per costruirne uno personalizzato.

Shieldstral offre una terza opzione. Una piattaforma di salute mentale potrebbe dirgli di segnalare qualsiasi cosa che romantizzi il suicidio. Un servizio di educazione per bambini potrebbe dirgli di bloccare le parolacce leggere che uno strumento di ricerca sulla sicurezza informatica ignorerebbe. Stesso modello, regole diverse, niente attese.

Poiché la politica vive in una frase semplice piuttosto che nelle impostazioni interne del modello, il cambio delle regole richiede secondi.

Quanto è piccolo piccolo, e ha importanza?

Molto piccolo, e sì, ha importanza. Shieldstral ha 3 miliardi di parametri, i pesi numerici che definiscono come una rete neurale pensa. I modelli di sicurezza concorrenti con prestazioni simili o inferiori possono avere 21 miliardi di parametri o più. I modelli più grandi hanno bisogno di hardware più grande e più costoso.

Shieldstral funziona su una singola scheda grafica con 16 gigabyte di memoria, il tipo che si trova in un PC gaming di fascia media. Questo lo rende alla portata degli sviluppatori e delle aziende più piccole che non possono permettersi fatture di cloud computing in scala.

I risultati dei benchmark pubblicati da Mistral mostrano il modello che eguaglia o batte i rivali più grandi nella sicurezza del testo, nella sicurezza delle immagini, nel rilevare quando un'IA ha rifiutato erroneamente una richiesta e nell'adattarsi a politiche personalizzate. Tutti i campioni di valutazione sono stati trattenuti dall'addestramento, il che significa che il modello non li aveva visti prima del test.

Capacità Risultato di Shieldstral rispetto ai rivali
Sicurezza del testo Eguaglia modelli fino a 7x più grandi
Sicurezza multimodale (immagine + testo) Risultato migliore tra i modelli open testati
Adattabilità della politica personalizzata Eguaglia modelli più grandi
Hardware necessario Singola GPU da 16GB

Cosa fa esattamente, passo dopo passo?

Ogni richiesta al modello ha tre parti. Primo, un'istruzione: il contesto e il livello di severità, più una definizione opzionale di cosa conta come non sicuro. Secondo, una domanda sì o no sul contenuto. Terzo, il contenuto stesso, che può essere un prompt scritto, una risposta del modello o un'immagine.

Il modello produce un singolo punteggio di probabilità. Gli sviluppatori possono impostare una soglia, ad esempio 0,8, e segnalare automaticamente qualsiasi cosa al di sopra.

Shieldstral è rilasciato con la licenza Apache 2.0, il che significa che chiunque può scaricarlo, usarlo e costruirvi sopra senza pagare un canone.

Domande comuni

Un'azienda non tecnica può effettivamente usare questo?

L'utilizzo del modello richiede ancora un certo lavoro di sviluppo software per collegarlo a un prodotto esistente. Tuttavia, poiché le politiche sono frasi semplici piuttosto che codice, un team di prodotto può scrivere e adattare le regole da solo senza coinvolgere un ingegnere di machine learning ogni volta.

Questo modello è testato su contenuti dannosi reali?

Mistral dice che Shieldstral è stato addestrato su un mix di dati reali e sintetici che coprono diverse categorie di danno, e che tutti i campioni di benchmark sono stati trattenuti dall'addestramento. L'azienda nota che i dati sulla sicurezza visiva sono scarsi e che sono stati adottati passaggi aggiuntivi per filtrare gli esempi di immagini etichettate erroneamente.

Il fatto di essere open-source crea dei rischi?

I modelli aperti possono essere scaricati e modificati da chiunque, compresi gli attori malintenzionati che cercano di rimuovere i filtri di sicurezza da altri sistemi. È una vera tensione in questo spazio. Mistral non ha affrontato pubblicamente questa preoccupazione specifica nelle note di rilascio di Shieldstral.

© 2026 AI2Day