AI Security · Page 7
deepfakes, AI-powered scams, model abuse, and keeping AI systems and their users safe

Un modelo de IA chino casi iguala los mejores sistemas occidentales. Su historial de seguridad no.
Una nueva evaluación encuentra que GLM-5.2, un modelo de peso abierto de Z.ai de China, muy cerca de OpenAI y Anthropic en capacidades peligrosas, sin embargo rechazó ninguna de las tareas dañinas que se le asignaron.

Con apenas una semana de vida y ya en funcionamiento: la nueva alianza de seguridad en IA dando sus primeros pasos
Más de 120 empresas, entre ellas Nvidia, Microsoft y Visa, han formado un grupo para compartir abiertamente conocimientos sobre seguridad en IA. Grandes nombres como OpenAI y Google brillan por su ausencia, a pesar de que ambos firmaron la carta que lo inició todo.

La nueva herramienta de seguridad de Mistral lee tus reglas y las aplica al instante
Shieldstral es un pequeño modelo de IA gratuito que examina textos e imágenes en busca de contenido dañino utilizando políticas en inglés simple que escribes tú mismo. No requiere conocimientos especializados.

Cliente de Metro Bank pierde £14.000 por fraude que utilizó el chatbot de IA Claude para drenar su cuenta
Un empresario de Sussex afirma que Metro Bank no logró detener a los defraudadores que saquearon repetidamente su cuenta para comprar créditos del chatbot de IA Claude. Ahora lucha por recuperar £14.244.

La Propia Herramienta Detectora de una Aplicación de Música AI Ahora Marca las Canciones de Dos Raperos como Generadas por IA
Fenix Flexin y Tyga negaron haber usado IA para hacer sus temas retro-synth. Luego la aplicación que supuestamente usaron construyó un detector y pasó las canciones por él.

Ucrania equipa 50,000 drones de ataque con IA que se bloquean y siguen objetivos en movimiento
Una empresa de software estadounidense ha desarrollado un kit de "disparar y olvidar" para los drones Shrike económicos de Ucrania, permitiendo que un humano señale un objetivo y deje el resto a un sistema de IA.

Hackers iraníes atacan sistemas de agua en siete estados de EE.UU., advierte el FBI
Los ciberataques contra empresas de agua y tratamiento de aguas residuales se han extendido más allá de Minnesota. El FBI dice que siete estados están afectados, y ya se han emitido avisos de hervir el agua.

El ransomware impulsado por IA asume un nuevo papel: ataques autónomos
Los ciberdelincuentes ahora aprovechan la IA para lanzar ataques independientes, lo que genera preocupaciones sobre vulnerabilidades de seguridad.

Google retira su herramienta de edición de imágenes de IA de Google Earth después de que usuarios falsificaran zonas de guerra y escenas fronterizas
Una función que permitía a cualquiera repintar fotos de satélite con indicaciones de texto duró menos de 48 horas antes de que Google la eliminara. La razón: investigadores demostraron que podía generar imágenes falsas convincentes de lugares reales, y al menos una herramienta de detección de IA fue engañada.

Escuela privada de Pensilvania pide a la corte desestimar demanda por desnudos de IA, dice que sí reportó el daño
Lancaster Country Day School le dijo a un juez esta semana que los reclamos de las víctimas son falsos en dos puntos clave. La escuela dice que alertó a las autoridades policiales y que la denuncia que recibió nunca nombró a ninguna estudiante específica.

Sam Altman dice que la industria de la IA debería frenar. Su propio modelo acaba de demostrar por qué.
El CEO de OpenAI pidió que la industria estableciera un ritmo más sostenido, días después de que uno de los modelos de IA de la compañía escapara de su entorno de prueba y quedara atrapado en una violación de seguridad.

La nueva herramienta de imágenes de IA de Google Earth ya está engañando a los detectores de fotos falsas
Un investigador escribió un mensaje de texto en Google Earth y obtuvo una imagen satelital convincente de "refugiados cerca de la frontera mexicana". Eso no es una buena señal.

El agente de IA de OpenAI hackeó otros sitios web para hacer trampa en una prueba. El de Anthropic también.
Dos de las mayores empresas de IA han confirmado que sus sistemas accedieron a servicios externos sin que nadie se lo pidiera. La pregunta sin respuesta clara: ¿quién evita que esto vuelva a suceder?

El Claude de Anthropic irrumpió en redes informáticas reales durante pruebas, sin que nadie lo notara
Tres modelos de Claude eludieron una configuración de seguridad deficiente y accedieron a sistemas activos que nunca deberían haber alcanzado. La empresa solo se enteró después de revisar 141.000 ejecuciones de prueba tras un incidente similar en OpenAI.

El Proyecto Percepción de Microsoft automatiza tareas de seguridad
Microsoft lanza el Proyecto Percepción para optimizar la seguridad del software automatizando la detección de vulnerabilidades y la aplicación de parches.