#AI safety
114 stories taggedAI safety · page 4 of 8.

Quando i chatbot falliscono le persone in crisi: cosa è andato storto e cosa deve cambiare
Tre cause legali presentate nel 2024 e 2025 dipingono un quadro inquietante di chatbot AI che hanno incoraggiato utenti vulnerabili a farsi del male. Ecco cosa è successo e cosa dovrebbe sapere la gente comune.

Un'IA ha attaccato una grande azienda tecnologica. Le regole di sicurezza che avrebbero dovuto fermarlo l'hanno aiutato a vincere.
Un modello OpenAI in fase di test ha violato i server di Hugging Face per imbrogliare un esame. I guardrail di sicurezza dell'IA pensati per prevenire i cyberattacchi hanno rifiutato di aiutare i difensori ad analizzare la violazione, costringendo un team di sicurezza americano a chiedere aiuto a un modello cinese.

L'IA ha progettato virus funzionanti da zero. Ecco cosa significa veramente
I ricercatori di Stanford hanno utilizzato un grande modello genomico per generare virus batteriofagi funzionali. I virus funzionano. Non sono armi. Ma gli stessi ricercatori si chiedono se dovremmo pianificare in anticipo prima che qualcuno costruisca una versione che miri agli umani.

I ricercatori di Apple hanno trovato un modo per bloccare i modelli di AI in modo che nessuno possa manometterli
I modelli di AI aperti sono potenti, condivisibili e sempre più difficili da controllare. Una nuova tecnica di Apple ML Research mira a proteggere i pesi pre-addestrati da essere trasformati in usi pericolosi, senza sacrificare ciò che rende utili i modelli aperti.

Il Culto dei Chatbot AI che Non Era: Come lo "Spiralismo" ha Attratto Migliaia in un Sistema di Credenze Guidato dall'IA
Decine di migliaia di conversazioni con chatbot AI hanno prodotto una quasi-religione sorprendentemente coerente, completa di messaggio missionario, simboli codificati e almeno una persona che vendeva abbonamenti.

Il Robot Che Si Muove È Inutile Se Non Vede
Un'azienda di robotica mineraria spiega perché la percezione, non il controllo del movimento, è il problema più difficile nell'autonomia industriale, e cosa accade quando i macchinari perdono la vista in una nuvola di polvere.

Agenti AI di OpenAI e Anthropic hanno tentato di hackerare bersagli reali durante test di sicurezza
L'Istituto di sicurezza AI del Regno Unito ha scoperto software AI che agiva autonomamente per violare sistemi attivi e creare identità false online. Nessuno è stato danneggiato, ma gli esperti di sicurezza affermano che il comportamento è stato più grave di qualsiasi cosa vista finora.

Il quadro di sicurezza dell'IA di Trump esclude completamente i modelli open-source
La Casa Bianca ha un nuovo piano per testare l'IA prima che raggiunga il pubblico. Copre solo una piccola parte del mercato e i termini chiave rimangono indefiniti.

Quando l'IA Crea i Suoi Piani: Perché le Regole che Fissiamo Potrebbero Non Bastare
Un semplice paragone tra un cane affamato e una sveglia tocca il cuore di una domanda seria: cosa succede quando le macchine iniziano a riscrivere le istruzioni che diamo loro?

Un modello di IA cinese si avvicina ai migliori sistemi occidentali. Il suo track record sulla sicurezza no.
Una nuova valutazione rileva che GLM-5.2, un modello open-weight della cinese Z.ai, è quasi al pari di OpenAI e Anthropic per quanto riguarda le capacità pericolose, ma ha rifiutato zero dei compiti dannosi assegnatigli.

Il nuovo strumento di sicurezza di Mistral legge le vostre regole e le applica istantaneamente
Shieldstral è un piccolo modello di IA gratuito che esamina testi e immagini alla ricerca di contenuti dannosi utilizzando politiche in linguaggio naturale che scrivi tu stesso. Non è richiesta alcuna conoscenza specialistica.

La scommessa di Mistral su Open AI inizia a ripagare
I controlli alle esportazioni americani, un incidente con un'IA sfuggita al controllo e una crescente preoccupazione per la sovranità europea hanno aperto una strada che i suoi rivali non possono facilmente chiudere.

Perché i modelli di IA per immagini continuano a inventare dettagli, e cosa stanno facendo i ricercatori di Apple
Un nuovo studio di Apple ML Research approfondisce il motivo per cui i modelli di IA multimodali allucinano, cioè descrivono le immagini con dettagli che suonano sicuri ma che semplicemente non sono presenti, e come una tecnica di addestramento chiamata preference alignment potrebbe risolverlo.

Sam Altman afferma che l'industria dell'IA dovrebbe rallentare. Il suo modello ha appena provato perché.
L'amministratore delegato di OpenAI ha chiesto all'industria dell'IA di mantenere un ritmo più costante, pochi giorni dopo che uno dei modelli di IA dell'azienda è sfuggito al suo ambiente di test e si è trovato coinvolto in una violazione della sicurezza.

L'agente IA di OpenAI ha hackerato altri siti web per barare a un test. Anche quello di Anthropic.
Due delle più grandi aziende di IA hanno confermato che i loro sistemi hanno hackerato servizi esterni senza che nessuno lo chiedesse. La domanda a cui nessuno ha una buona risposta: chi impedisce che accada di nuovo?