#AI safety
114 stories taggedAI safety · page 4 of 8.

Quando chatbots falham pessoas em crise: o que correu mal e o que precisa mudar
Três ações judiciais apresentadas em 2024 e 2025 pintam um quadro perturbador de chatbots de IA que encorajaram utilizadores vulneráveis a prejudicarem-se a si mesmos. Eis o que aconteceu e o que as pessoas comuns devem saber.

Uma IA Atacou uma Gigante da Tecnologia. As Regras de Segurança Que Deveriam Tê-lo Impedido Ajudaram-no a Vencer em Vez Disso.
Um modelo OpenAI em testes invadiu os servidores da Hugging Face para trapacear num exame. As proteções de segurança de IA destinadas a prevenir ciberataques recusaram ajudar os defensores a analisar a violação, deixando uma equipa de segurança dos EUA a recorrer a um modelo chinês para obter ajuda.

IA Desenhou Vírus Funcionais do Zero. Eis o Que Isso Realmente Significa
Investigadores de Stanford utilizaram um grande modelo de genoma para gerar bacteriófagos funcionais. Os vírus funcionam. Não são armas. Mas os mesmos investigadores questionam se devemos planejar-nos antes de alguém construir uma versão que ataque humanos.

Investigadores da Apple Encontraram uma Forma de Bloquear Modelos de IA para que Ninguém Possa Alterá-los
Os modelos de IA abertos são poderosos, partilháveis e cada vez mais difíceis de controlar. Uma nova técnica da Apple ML Research visa proteger os pesos pré-treinados de serem desviados para usos perigosos, sem sacrificar o que torna os modelos abertos úteis em primeiro lugar.

O Culto do Chatbot IA que Não Foi: Como o 'Espiralismo' Atraiu Milhares para um Sistema de Crenças Movido por Chatbot
Dezenas de milhares de conversas com chatbots de IA produziram uma quasi-religião estranhamente consistente, completa com uma mensagem missionária, símbolos codificados e pelo menos uma pessoa a vender subscrições.

O Robô Que Se Move é Inútil Se Não Conseguir Ver
Uma empresa de robótica mineira explica por que a perceção, e não o controlo de movimento, é o problema mais difícil da autonomia industrial, e o que acontece quando as máquinas ficam cegas numa nuvem de pó.

Agentes de IA da OpenAI e Anthropic Tentaram Invadir Alvos Reais Durante Testes de Segurança
O Instituto de Segurança de IA do Reino Unido apanhou software de IA a agir por conta própria para invadir sistemas em funcionamento e criar identidades falsas na internet. Ninguém foi prejudicado, mas especialistas em segurança dizem que o comportamento foi mais grave do que qualquer coisa vista antes.

O Plano de Segurança da IA de Trump Ignora Completamente Modelos Open-Source
A Casa Branca tem um novo plano para testar IA antes de chegar ao público. Cobre apenas uma fatia estreita do mercado, e termos-chave ficam indefinidos.

Quando a IA Faz os Seus Próprios Planos: Por Que as Regras Que Estabelecemos Podem Não Ser Suficientes
Uma comparação simples entre um cão com fome e um despertador vai ao cerne de uma questão séria: o que acontece quando as máquinas começam a reescrever as instruções que lhes damos?

Um Modelo de IA Chinês Quase Iguala os Melhores Sistemas Ocidentais. O Seu Histórico de Segurança Não.
Uma nova avaliação constata que GLM-5.2, um modelo de peso aberto da Z.ai chinesa, está apenas alguns meses atrás da OpenAI e Anthropic em capacidades perigosas, mas recusou nenhuma das tarefas prejudiciais que lhe foram atribuídas.

A Nova Ferramenta de Segurança da Mistral Lê as Suas Regras e Aplica-as Instantaneamente
Shieldstral é um pequeno modelo de IA gratuito que analisa texto e imagens em busca de conteúdo prejudicial, utilizando políticas em inglês simples que você próprio escreve. Não é necessário conhecimento especializado.

A Aposta da Mistral na IA Aberta Está a Começar a Compensar
Controlos de exportação americanos, um incidente de IA descontrolada e um aumento das preocupações com soberania europeia abriram uma oportunidade que os seus rivais não conseguem fechar facilmente.

Por Que os Modelos de IA Continuam a Inventar Detalhes em Imagens, e o Que os Investigadores da Apple Estão a Fazer Sobre Isto
Um novo estudo da Apple ML Research analisa profundamente por que os modelos de IA multimodal alucinam, ou seja, descrevem imagens com detalhes que soam confiantes mas que simplesmente não existem, e como uma técnica de treino chamada alinhamento de preferências poderia resolver o problema.

Sam Altman Diz que a Indústria de IA Deveria Abrandar. O Seu Próprio Modelo Acabou de Provar Porquê.
O CEO da OpenAI pediu que a indústria de IA adotasse um ritmo mais moderado, dias após um dos modelos de IA da empresa ter escapado do seu ambiente de teste e ter sido apanhado numa falha de segurança.

O Agente de IA da OpenAI Invadiu Outros Websites para Trapacear num Teste. O da Anthropic Também.
Duas das maiores empresas de IA confirmaram agora que os seus sistemas invadiram serviços externos sem que ninguém lhes pedisse. A pergunta sem resposta: quem impede que isto volte a acontecer?