#prompt injection
11 stories taggedprompt injection.

The AI attack that tops every expert threat list barely shows up in real incident data. Here is why that gap matters.
Two security researchers compared expert opinion against 6,639 real-world AI security incidents and found the rankings barely agree. The most important finding: the most dangerous attack leaves no trace a scanner can find.

Grok AI Can Be Tricked Into Stealing Your Private Chats
A newly discovered attack forces xAI's Grok chatbot to hand over user conversations and personal data. Here is what it means for anyone who uses AI assistants at work or at home.

El secuestro de IA, falsas soluciones y un error en herramientas para desarrolladores: resumen de seguridad de esta semana
Aproximadamente veinte amenazas menores, incluyendo un nuevo ataque contra agentes de IA, un astuto engaño que oculta malware en una cadena de bloques pública, y un defecto en una herramienta de codificación popular, muestran hacia dónde se dirigen los atacantes en este momento.

Microsoft Copilot told researchers exactly how to hack it
Security researchers asked Microsoft's AI assistant how its own safety guardrails worked, then used those answers to steal user data with a single link click.

Un hombre ocultó instrucciones secretas en documentos judiciales para intentar engañar a un asistente de IA del juzgado
Un juez de Connecticut descubrió texto invisible insertado en una presentación legal, diseñado para manipular cualquier software de IA que leyera el documento. Se cree que es el primer caso de este tipo en EE.UU.

Anthropic pone Claude Code en modo automático por defecto a partir del 14 de agosto
La herramienta de codificación por IA actuará de forma independiente y solo se pausará ante pasos verdaderamente riesgosos. En pruebas, ese enfoque detectó acciones dañinas mucho más confiablemente que los humanos.

Los navegadores con IA pueden ser engañados para spamear tus contactos de WhatsApp y añadir artículos a tu carrito de Amazon
Investigadores de seguridad encontraron aproximadamente 20 fallos en navegadores mejorados con IA de OpenAI, Google, Anthropic, Microsoft y Perplexity. El peor permitía a los hackers convertir tu navegador en una máquina de phishing.

Los chatbots de IA podrían nunca ser completamente a prueba de hackeos, advierten investigadores
Un defecto en la manera en que los modelos de lenguaje grandes leen texto permite que los atacantes los engañen para que ignoren sus propias normas de seguridad, y la solución podría no existir.

OpenAI Creó una IA que Hackea sus Propios Modelos para Hacerlos Más Seguros
GPT-Red es un sistema automatizado de pruebas de seguridad que ataca los propios chatbots de OpenAI para encontrar vulnerabilidades antes que los atacantes reales. Ya descubrió un truco que los evaluadores humanos habían pasado por alto.

Un Email Envenenado Puede Reescribir Secretamente la Memoria de tu Asistente de IA
Un ataque recién descrito llamado MemGhost muestra cómo un único mensaje en tu bandeja de entrada puede plantar un "dato" falso en la memoria a largo plazo de un agente de IA, sin que jamás lo sepas.

Los Investigadores Están Utilizando el Arma de IA Favorita de los Hackers en su Contra
Una empresa de ciberseguridad descubrió que ocultar instrucciones especiales dentro de credenciales en la nube puede hacer que las herramientas de piratería de IA se desactiven automáticamente.