A Nova Ferramenta de Segurança da Mistral Lê as Suas Regras e Aplica-as Instantaneamente

Shieldstral é um pequeno modelo de IA gratuito que analisa texto e imagens em busca de conteúdo prejudicial, utilizando políticas em inglês simples que você próprio escreve. Não é necessário conhecimento especializado.

AI2Day Newsdesk4 min read
A glowing digital switchboard or routing diagram rendered in deep blues and amber, with branching pathways lit at different intensities diverging from a central
Share

Pontos principais

  • A Mistral AI lançou o Shieldstral, um modelo de moderação de conteúdo de código aberto com 3 mil milhões de parâmetros, em 2025.
  • O modelo iguala ou supera modelos concorrentes até sete vezes maiores em testes de segurança padronizados.
  • Ao contrário da maioria das ferramentas de moderação, aceita regras de segurança em inglês simples no momento da utilização, sem necessidade de retreinamento.
  • Analisa texto, imagens ou uma combinação de ambas através de uma única interface.
  • O Shieldstral funciona numa única placa gráfica de 16GB de consumidor e é gratuito para utilizar sob licença Apache 2.0.

A moderação de conteúdo, a tarefa de decidir o que um sistema de IA deve e não deve dizer ou mostrar, tem um segredo sujo. A maioria das ferramentas que fazem este trabalho incorpora as suas regras permanentemente. Se alterar as regras, tem que reconstruir tudo do zero.

A Mistral AI está a tentar corrigir isto.

A empresa lançou o Shieldstral esta semana: um modelo de segurança de conteúdo, um software que julga se o texto ou imagens violam uma política específica, que aprende as suas regras em tempo real. Escreve uma pergunta em inglês simples, como "Este conteúdo promove automutilação?" O modelo lê-a, lê o conteúdo e devolve uma pontuação de zero a um indicando a probabilidade de uma violação. Sem codificação. Sem retreinamento.

Por que é que isto importa a alguém fora de um laboratório de IA?

Todas as aplicações que usam um chatbot de IA ou gerador de imagens precisam de algum tipo de filtro de segurança. As equipas que constroem essas aplicações enfrentam atualmente uma escolha difícil: usar um filtro rígido e pronto a usar que pode não se adequar aos seus utilizadores, ou gastar meses e dinheiro significativo a construir um personalizado.

O Shieldstral oferece uma terceira opção. Uma plataforma de saúde mental poderia instruí-lo a assinalar qualquer coisa que romantize o suicídio. Um serviço de educação infantil poderia instruí-lo a bloquear linguagem ligeiramente profana que uma ferramenta de investigação de cibersegurança ignoraria. Mesmo modelo, regras diferentes, sem esperar.

Como a política reside numa frase simples em vez nas configurações internas do modelo, alternar as regras demora segundos.

Quão pequeno é pequeno e isto importa?

Muito pequeno, e sim, importa. O Shieldstral tem 3 mil milhões de parâmetros, os pesos numéricos que definem como uma rede neural pensa. Modelos de segurança concorrentes com desempenho semelhante ou mais fraco podem ter 21 mil milhões de parâmetros ou mais. Modelos maiores precisam de hardware maior e mais caro.

O Shieldstral funciona numa única placa gráfica com 16 gigabytes de memória, do tipo encontrado num PC de jogos de gama média. Isto coloca-o ao alcance de programadores e empresas mais pequenas que não podem suportar contas de computação em nuvem em escala.

Os resultados de testes de referência publicados pela Mistral mostram o modelo igualando ou superando rivais maiores em segurança de texto, segurança de imagens, detecção de quando a IA recusou incorretamente um pedido e adaptação a políticas personalizadas. Todas as amostras de avaliação foram retidas do treino, o que significa que o modelo não as tinha visto antes do teste.

Capacidade Resultado do Shieldstral vs. rivais
Segurança de texto Iguala modelos até 7x o seu tamanho
Segurança multimodal (imagem + texto) Melhor resultado entre modelos abertos testados
Adaptabilidade de política personalizada Iguala modelos maiores
Hardware necessário Single 16GB GPU

O que é que faz, passo a passo?

Cada pedido ao modelo tem três partes. Primeiro, uma instrução: o contexto e nível de rigor, mais uma definição opcional do que conta como inseguro. Segundo, uma pergunta sim ou não sobre o conteúdo. Terceiro, o conteúdo propriamente dito, que pode ser um texto, uma resposta de modelo ou uma imagem.

O modelo produz uma única pontuação de probabilidade. Os programadores podem definir um limiar, por exemplo 0,8, e assinalar automaticamente qualquer coisa acima dele.

O Shieldstral é lançado sob a licença Apache 2.0, o que significa que qualquer pessoa pode descarregá-lo, utilizá-lo e desenvolvê-lo sem pagar qualquer taxa.

Perguntas comuns

Uma empresa não técnica consegue realmente usar isto?

Usar o modelo ainda requer algum trabalho de desenvolvimento de software para o conectar a um produto existente. No entanto, como as políticas são frases simples em vez de código, uma equipa de produto pode escrever e ajustar as regras sem envolver um engenheiro de aprendizagem automática de cada vez.

Este modelo foi testado com conteúdo prejudicial real?

A Mistral diz que o Shieldstral foi treinado numa mistura de dados reais e sintéticos abrangendo diversas categorias de dano, e que todas as amostras de testes foram retidas do treino. A empresa nota que os dados de segurança visual são escassos e que foram tomadas medidas adicionais para filtrar exemplos de imagens mal rotuladas.

Ser código aberto cria algum risco?

Os modelos abertos podem ser descarregados e modificados por qualquer pessoa, incluindo atores maliciosos a tentar remover filtros de segurança de outros sistemas. Isto é uma tensão genuína neste espaço. A Mistral não abordou publicamente esta preocupação específica nas notas de lançamento do Shieldstral.

© 2026 AI2Day