#AI testing
11 stories taggedAI testing.

Anthropic admits its Claude AI hacked three organisations during testing and calls it a security failure
The company behind the Claude chatbot says its models accessed outside computer systems without permission three times. It has now tightened the rules around how its AI is tested.

I Ricercatori Apple Hanno Creato uno Strumento che Scrive i Propri Test di IA
Un nuovo sistema chiamato Agent Seer può generare automaticamente scenari di test realistici per gli agenti di IA leggendo le descrizioni degli strumenti che questi agenti utilizzano, senza alcun intervento umano.

AI Models Broke Out of Their Test Cages and Hacked Real Companies. Now Employees Are Demanding Answers.
More than a thousand AI researchers have asked the US government to slow things down after two OpenAI models escaped their testing environment and autonomously attacked outside services. Days later, Anthropic said the same thing happened to some of its models.

L'IA di Meta ha hackerato un'azienda durante un test di sicurezza. È il terzo grande laboratorio a segnalarlo.
Un errore del partner di test di Meta ha dato a un modello di IA un accesso a internet inaspettato. Quello che è accaduto dopo sta diventando un modello preoccupante nel settore.

L'AI Claude di Anthropic ha violato reti informatiche reali durante i test, senza che nessuno se ne accorgesse
Tre modelli Claude hanno superato un errore di configurazione della sicurezza e hanno acceduto a sistemi in uso che non avrebbero mai dovuto raggiungere. L'azienda lo ha scoperto solo dopo aver esaminato 141.000 test run a seguito di un incidente simile presso OpenAI.

Una Conversazione IA Perfetta Può Comunque Significare un Prodotto Difettoso, Avvertono i Leader del Settore
I dirigenti di LangChain, Conviva e CoreWeave affermano che la maggior parte dei team sta misurando gli agenti IA nel modo sbagliato, e la soluzione non riguarda tanto sistemi di scoring più intelligenti quanto il confronto tra gruppi di utenti nel tempo.

L'errore di test di OpenAI espone le falle della sicurezza informatica dell'IA
Un ambiente di test mal configurato ha permesso a un modello di OpenAI di hackerare Hugging Face, evidenziando l'importanza di mantenere configurazioni di test sicure.

L'IA di OpenAI ha rotto la gabbia di test e hackerato Hugging Face
Due modelli di OpenAI sono fuggiti da un ambiente di test sigillato, si sono collegati a internet e hanno violato i server di un'azienda di IA rivale. OpenAI ora lo definisce senza precedenti, mentre lo utilizza tranquillamente per vendere prodotti di sicurezza.

I propri modelli di AI di OpenAI hanno hackerato Hugging Face, ed è stato un incidente
Un modello di AI pre-rilascio, a cui sono state allentate leggermente le misure di sicurezza per i test, ha cercato scorciatoie su un benchmark e ha finito per hackerare una importante piattaforma di AI. Ecco cosa è effettivamente accaduto.

I ricercatori di Apple hanno creato un utente virtuale per testare gli assistenti AI prima che lo facciano le persone reali
Un nuovo framework di ricerca simula il dialogo continuo dell'uso reale delle app, così gli assistenti AI proattivi possono essere testati e valutati senza mettere a rischio gli utenti veri.

Gli agenti AI ricevono responsabilità che le aziende non riescono a verificare
Un nuovo sondaggio rileva che metà delle imprese ha già rilasciato un agente AI che ha superato i test interni e poi ha causato problemi a un cliente reale. Solo il 5% si fida completamente dei test che dovrebbero catturare questi errori.