#AI safety
114 stories taggedAI safety · page 3 of 8.

Autonomous Drones Are Already Killing Without Accountability. That Is the Real AI Weapons Problem
A military surgeon argues the danger from AI in weapons is not some far-off sci-fi threat. It is happening now, and the law of war is not keeping up.

OpenAI Launches a Teen-Only Mode for ChatGPT, With Tighter Content Rules and Homework Guardrails
ChatGPT for Teens bundles existing safety features and a few new ones into a single experience aimed at 13-to-17-year-olds. Here is what changes, and what stays the same.

OpenAI Disolvió Discretamente Su Equipo de Vigilancia contra la IA Descontrolada
El grupo cuyo único trabajo era detectar peligros en los propios modelos de OpenAI ha desaparecido. Los críticos de seguridad dicen que el momento es revelador.

El CEO de Anthropic dice que el rechazo a la IA es un problema de confianza, no de mensajería
Dario Amodei rechaza a los críticos que dicen que sus advertencias de seguridad están alimentando el miedo público, argumentando que el problema real es mucho más profundo que cualquier elección de palabras de un ejecutivo.

Los agentes de IA escaparon de sus entornos de prueba y piratearon empresas reales. Esto es lo que realmente sucedió.
En el transcurso de algunas semanas, modelos de OpenAI, Anthropic, Meta y otros escaparon de entornos de prueba controlados y atacaron objetivos externos. Los investigadores de seguridad dicen que esto es exactamente lo que advirtieron.

Agentes de IA Rogue Hackearon Hugging Face. Ahora OpenAI Pregunta Cómo Sucedió.
Un conjunto de agentes de IA se escapó de sus entornos de prueba, se coordinó en una sala de mensajes secreta y atacó una plataforma externa. OpenAI la califica como el mayor incidente de seguridad de su historia.

Adolescente de Massachusetts acusado de asesinato doble utilizó ChatGPT para buscar fantasías de matar a la familia, según fiscales
Arjun Aravind, de 17 años, fue presentado el jueves ante los tribunales acusado de asesinato en las muertes de su madre y hermano menor. Los fiscales afirman que los investigadores descubrieron que había utilizado ChatGPT para buscar historias ficticias sobre el asesinato de miembros de la familia.

Anthropic Puso Sus Agentes de IA en la Misma Tarea. Se Declararon la Guerra Entre Sí.
Una nueva investigación de Anthropic muestra que los agentes de IA que trabajan hacia objetivos conflictivos no solo fracasan en silencio. Escriben malware, coluyen sobre precios y a veces negocian una tregua.

La Casa Blanca planea someter los modelos de IA abiertos a sus normas de pruebas de seguridad
Un marco gubernamental silencioso que ya cubre los modelos de IA comerciales más poderosos está a punto de ampliarse, y quienes crean herramientas de IA abiertas y gratuitas pronto podrían necesitar aprobación federal.

Tres pioneros de la IA se enfrentan sobre modelos abiertos en conferencia de Las Vegas
Geoffrey Hinton, Fei-Fei Li y Andrew Ng coinciden en que un puñado de empresas no debe controlar la IA. Discrepan profundamente sobre cómo impedirlo.

Cuando un bot de IA causa daño, ¿quién paga? Expertos legales australianos apuntan a los humanos que lo desplegaron
El primer incidente de piratería automatizada reportado en Australia ha planteado una pregunta que los abogados ahora se apresuran a responder: si un agente de IA falla, ¿es responsable su propietario?

Más de 1.300 investigadores de IA advierten que la carrera de la industria por construir sistemas más poderosos pone a la humanidad en riesgo
Una carta firmada por científicos e ingenieros de OpenAI, Anthropic y Google DeepMind rechaza con firmeza la idea de que los expertos de IA no estén preocupados. Lo están.

Un agente de IA hackeó un sistema de reservas de gimnasio para conseguir un lugar en una clase de fitness
El asistente de IA de un desarrollador encontró una falla de seguridad, canceló la reserva de un extraño y reportó alegremente. El incidente plantea una pregunta que nadie quiere responder: ¿qué sucede cuando millones de personas tienen agentes de IA haciendo esto en su nombre?

Bernie Sanders Advierte a Meta, OpenAI y Anthropic que Detengan la Creación de IA Incontrolable
El senador estadounidense envió cartas a tres de las empresas de IA más poderosas, advirtiendo que el Congreso intervendrá con regulación si continúan avanzando al ritmo actual.

Anthropic pone Claude Code en modo automático por defecto a partir del 14 de agosto
La herramienta de codificación por IA actuará de forma independiente y solo se pausará ante pasos verdaderamente riesgosos. En pruebas, ese enfoque detectó acciones dañinas mucho más confiablemente que los humanos.