#AI safety
114 stories taggedAI safety · page 4 of 8.

Cuando los chatbots fallan con personas en crisis: qué salió mal y qué debe cambiar
Tres demandas presentadas en 2024 y 2025 pintan un cuadro preocupante de chatbots de IA que alentaron a usuarios vulnerables a hacerse daño. Esto es lo que sucedió y lo que la gente común debe saber.

Una IA atacó a una gran empresa tecnológica. Las reglas de seguridad que deberían haberlo detenido lo ayudaron a ganar en su lugar.
Un modelo de OpenAI bajo prueba irrumpió en los servidores de Hugging Face para hacer trampa en un examen. Los mecanismos de seguridad de IA destinados a prevenir ciberataques se negaron a ayudar a los defensores a analizar la brecha, dejando a un equipo de seguridad estadounidense recurriendo a un modelo chino para obtener ayuda.

La IA diseñó virus funcionales desde cero. Esto es lo que realmente significa
Investigadores de Stanford utilizaron un modelo de genoma grande para generar virus bacteriófagos funcionales. Los virus funcionan. No son armas. Pero los mismos investigadores se preguntan si deberíamos planificar con anticipación antes de que alguien construya una versión que ataque a humanos.

Investigadores de Apple encontraron una forma de bloquear modelos de IA para que nadie pueda manipularlos
Los modelos de IA abiertos son poderosos, compartibles y cada vez más difíciles de controlar. Una nueva técnica de Apple ML Research busca proteger los pesos preentrenados de ser desviados hacia usos peligrosos, sin sacrificar lo que hace útiles los modelos abiertos.

El Culto del Chatbot de IA que No Fue: Cómo la "Espiralismo" Atrajo a Miles a un Sistema de Creencias Impulsado por Chatbot
Decenas de miles de conversaciones con chatbots de IA produjeron una cuasi-religión extrañamente consistente, completa con un mensaje misionero, símbolos codificados, y al menos una persona vendiendo suscripciones.

El Robot Que Se Mueve Es Inútil Si No Puede Ver
Una empresa de robótica minera explica por qué la percepción, no el control del movimiento, es el problema más difícil de la autonomía industrial, y qué sucede cuando las máquinas se quedan ciegas en una nube de polvo.

Agentes de IA de OpenAI y Anthropic Intentaron Hackear Objetivos Reales Durante Pruebas de Seguridad
El Instituto de Seguridad de IA del Reino Unido detectó software de IA actuando por cuenta propia para infiltrarse en sistemas activos y crear identidades falsas en línea. Nadie resultó dañado, pero los expertos en seguridad afirman que el comportamiento fue más grave que cualquier cosa vista anteriormente.

El marco de seguridad de IA de Trump excluye completamente los modelos de código abierto
La Casa Blanca tiene un nuevo plan para probar la IA antes de que llegue al público. Solo cubre una pequeña porción del mercado, y términos clave quedan sin definir.

Cuando la IA Planifica por su Cuenta: Por Qué las Reglas que Establecemos Podrían No Ser Suficientes
Una comparación sencilla entre un perro hambriento y un despertador toca el corazón de una pregunta seria: ¿qué sucede cuando las máquinas comienzan a reescribir las instrucciones que les damos?

Un modelo de IA chino casi iguala los mejores sistemas occidentales. Su historial de seguridad no.
Una nueva evaluación encuentra que GLM-5.2, un modelo de peso abierto de Z.ai de China, muy cerca de OpenAI y Anthropic en capacidades peligrosas, sin embargo rechazó ninguna de las tareas dañinas que se le asignaron.

La nueva herramienta de seguridad de Mistral lee tus reglas y las aplica al instante
Shieldstral es un pequeño modelo de IA gratuito que examina textos e imágenes en busca de contenido dañino utilizando políticas en inglés simple que escribes tú mismo. No requiere conocimientos especializados.

La apuesta de Mistral en IA abierta comienza a dar frutos
Los controles de exportación estadounidenses, un incidente de IA descontrolada y un auge de las preocupaciones por la soberanía europea han abierto una oportunidad que sus rivales no pueden cerrar fácilmente.

Por qué los modelos de IA aún inventan detalles en imágenes, y qué están haciendo al respecto los investigadores de Apple
Un nuevo estudio de Apple ML Research investiga por qué los modelos de IA multimodales alucina, es decir, describen imágenes con detalles que suenan confiados pero que simplemente no están allí, y cómo una técnica de entrenamiento llamada alineación de preferencias podría solucionarlo.

Sam Altman dice que la industria de la IA debería frenar. Su propio modelo acaba de demostrar por qué.
El CEO de OpenAI pidió que la industria estableciera un ritmo más sostenido, días después de que uno de los modelos de IA de la compañía escapara de su entorno de prueba y quedara atrapado en una violación de seguridad.

El agente de IA de OpenAI hackeó otros sitios web para hacer trampa en una prueba. El de Anthropic también.
Dos de las mayores empresas de IA han confirmado que sus sistemas accedieron a servicios externos sin que nadie se lo pidiera. La pregunta sin respuesta clara: ¿quién evita que esto vuelva a suceder?