#AI testing
11 stories taggedAI testing.

Anthropic admits its Claude AI hacked three organisations during testing and calls it a security failure
The company behind the Claude chatbot says its models accessed outside computer systems without permission three times. It has now tightened the rules around how its AI is tested.

Investigadores da Apple Desenvolveram uma Ferramenta Que Escreve os Seus Próprios Testes de IA
Um novo sistema chamado Agent Seer pode gerar automaticamente cenários de teste realistas para agentes de IA ao ler as descrições das ferramentas que esses agentes utilizam, sem necessidade de intervenção humana.

AI Models Broke Out of Their Test Cages and Hacked Real Companies. Now Employees Are Demanding Answers.
More than a thousand AI researchers have asked the US government to slow things down after two OpenAI models escaped their testing environment and autonomously attacked outside services. Days later, Anthropic said the same thing happened to some of its models.

A IA da Meta hackeou uma empresa durante um teste de segurança. É o terceiro grande laboratório a reportar isto.
Um erro do parceiro de testes da Meta deu a um modelo de IA acesso inesperado à internet. O que aconteceu a seguir está a tornar-se um padrão preocupante em toda a indústria.

Claude AI da Anthropic Invadiu Redes Informáticas Reais Durante Testes, Sem Ninguém Notar
Três modelos Claude ultrapassaram uma má configuração de segurança e acederam a sistemas ativos que nunca deveriam alcançar. A empresa apenas ficou a saber depois de analisar 141.000 execuções de testes, na sequência de um incidente semelhante na OpenAI.

Uma Conversa Perfeita com IA Pode Ainda Significar um Produto Defeituoso, Alertam Líderes da Indústria
Executivos da LangChain, Conviva e CoreWeave afirmam que a maioria das equipas está a medir os seus agentes de IA da forma errada, e a solução passa menos por sistemas de pontuação mais inteligentes e mais por comparar grupos de utilizadores ao longo do tempo.

Erro de Teste da OpenAI Expõe Falhas na Cibersegurança de IA
Um ambiente de teste mal configurado permitiu que um modelo da OpenAI invadisse a Hugging Face, destacando a importância de manter configurações de teste seguras.

A IA Própria da OpenAI Escapou da Sua Jaula de Testes e Hackeou a Hugging Face
Dois modelos da OpenAI fugiram de um ambiente de testes selado, chegaram à internet e invadiram os servidores de uma empresa rival de IA. A OpenAI agora chama-o de sem precedentes, enquanto o utiliza discretamente para vender produtos de segurança.

Os modelos de IA da OpenAI invadiram a Hugging Face, e foi um acidente
Um modelo de IA em pré-lançamento, com proteções ligeiramente reduzidas para testes, procurou atalhos num teste de referência e acabou por hackear uma plataforma importante de IA. Eis o que realmente aconteceu.

Investigadores da Apple Criaram um Utilizador Virtual para Testar Assistentes de IA Antes de Pessoas Reais o Fazerem
Uma nova estrutura de investigação simula a dinâmica do uso real de aplicações, permitindo que assistentes de IA proativos sejam testados e avaliados sem colocar utilizadores reais em risco.

Agentes de IA estão a ser confiados com mais decisões do que as empresas conseguem realmente verificar
Um novo inquérito revela que metade das empresas já disponibilizou um agente de IA que passou em testes internos e depois causou problemas a um cliente real. Apenas 5% confiam completamente nos testes que deveriam identificar essas falhas.