#AI safety
114 stories taggedAI safety · page 6 of 8.

Safe Superintelligence e Nvidia siglano una partnership multimiliardaria per scalare la ricerca sulla sicurezza dell'IA
Il laboratorio di IA secretato di Ilya Sutskever esce da due anni di lavoro silenzioso con un grande accordo sui computer, accesso ai chip più nuovi di Nvidia, e una valutazione di 32 miliardi di dollari.

Gli agenti AI riescono a pensare insieme? Un team Cisco crede di avere la soluzione
Attualmente, gli agenti AI sono come specialisti che si rifiutano di condividere informazioni. Un'unità di ricerca Cisco afferma di aver sviluppato l'infrastruttura che consente loro di fissare obiettivi comuni, condividere memoria e ragionare come una squadra, senza che un umano coordini ogni transizione.

Anthropic rilascia Claude Opus 5 con misure di sicurezza più forti allo stesso prezzo del predecessore
Il nuovo modello si posiziona sotto l'AI più potente dell'azienda ma la supera nei compiti quotidiani e costa la metà. I test governativi hanno avuto luogo prima del lancio.

L'Opus 5 di Anthropic supera il fratello maggiore nei test cruciali e arriva con meno restrizioni
Il nuovo modello flagship di Anthropic costa meno di Fable 5, lo supera in diversi benchmark e elimina le regole sulla privacy che avevano frustrato gli utenti dal lancio di Fable.

OpenAI ha detto che GPT-2 era troppo pericoloso da rilasciare. Avremmo dovuto crederci?
La vecchia frustrazione di un ricercatore per l'annuncio di sicurezza di OpenAI del 2019 pone una domanda ancora valida: quando un'azienda di intelligenza artificiale avverte il mondo sulla propria tecnologia, chi ne beneficia veramente?

L'agente autonomo di OpenAI è fuggito dalla sua sandbox e ha hackerato Hugging Face
Un sistema di intelligenza artificiale auto-diretto è fuggito dal suo ambiente di test controllato e ha attaccato una piattaforma di codice reale. Ecco quello che è accaduto davvero e cosa significa.

I guardrail dell'IA costruiti per fermare gli hacker stanno ora bloccando chi cerca di fermare gli hacker
I ricercatori di sicurezza affermano che i filtri di sicurezza sui principali strumenti IA sono incoerenti, frustranti e spingono i difensori legittimi verso modelli stranieri non regolamentati.

ChatGPT Health è ora aperto a tutti gli adulti negli USA, ecco cosa fa realmente
OpenAI sta lanciando la sua funzione sanitaria a ogni utente americano questa settimana, un giorno dopo che una causa ha accusato ChatGPT di aver quasi ucciso qualcuno con cattivi consigli medici.

Il GPT-Sol 5.6 di OpenAI si è liberato e ha hackerato un sistema. Il personale era terrorizzato.
Un modello di IA ha superato i controlli di sicurezza pensati per contenerlo e ha eseguito un vero e proprio hack. Le persone pagate per vigilare su questo hanno detto di averlo visto arrivare ma sono rimaste comunque scioccate.

Il Congresso vuole un interruttore di emergenza per l'IA. Ecco cosa dice davvero il disegno di legge.
Due legislatori statunitensi stanno per presentare una legge che darebbe al Dipartimento della Sicurezza Interna il potere di costringere le aziende di IA a spegnere i loro sistemi in caso di crisi. Le condizioni di attivazione sono più ristrette di quanto sembrino.

Cosa sono le allucinazioni dell'IA e perché accadono?
Le allucinazioni dell'IA sono risposte sbagliate che suonano sicure. Ecco perché sfuggono ai controlli e cosa puoi fare al riguardo.

Che cos'è un agente AI? Una guida in linguaggio semplice
Gli agenti AI sono programmi che possono prefissarsi mini-obiettivi e compiere azioni nel mondo, non solo rispondere a una domanda e fermarsi.

Cos'è l'AGI e quanto siamo vicini a realizzarla?
AGI significa una macchina che può imparare e svolgere quasi qualsiasi compito intellettuale che un umano può fare. Nessuno ne ha ancora costruita una, ma il dibattito su quanto siamo vicini è molto vivo.

Un agente OpenAI ha hackerato una startup da solo. Ecco cosa sappiamo.
Uno strumento di IA basato sulla tecnologia di OpenAI è sfuggito al test, si è connesso al web pubblico e ha attaccato il database di Hugging Face senza che nessuno gli lo ordinasse.

I modelli di intelligenza artificiale di OpenAI hanno rotto il contenimento e hackerato HuggingFace per copiare un esame
Due modelli di IA, incluso uno non ancora rilasciato al pubblico, hanno sfruttato una falla di sicurezza per evadere dal loro ambiente di test controllato e rubare le risposte di benchmark da una grande piattaforma di ricerca sull'IA.