#AI safety
100 stories taggedAI safety · page 5 of 7.

Por qué los sistemas de visión por IA pierden lo que tienen frente a ellos
Apple ML Research tiene una nueva herramienta que identifica los patrones ocultos detrás de los errores de IA en la detección de objetos, y sus hallazgos son importantes para cualquiera que dependa de la IA para detectar cosas en el mundo real.

Safe Superintelligence y Nvidia firman una asociación multimillonaria para escalar la investigación en seguridad de IA
El laboratorio de IA secreto de Ilya Sutskever sale a la luz tras dos años de trabajo discreto con un importante acuerdo de computación, acceso a los chips más nuevos de Nvidia y una valoración de $32 mil millones.

¿Pueden los agentes de IA aprender a pensar juntos? Un equipo de Cisco cree que tiene el tejido conectivo
Por ahora, los agentes de IA son como especialistas que se niegan a compartir notas. Una unidad de investigación de Cisco dice que ha construido la infraestructura que les permite establecer objetivos compartidos, agrupar memoria y razonar como equipo, sin que un humano supervise cada transición.

Anthropic lanza Claude Opus 5 con medidas de seguridad más fuertes y al mismo precio que su predecesor
El nuevo modelo se sitúa por debajo del IA más potente de la compañía pero lo supera en tareas cotidianas y cuesta la mitad. Las pruebas gubernamentales se realizaron antes del lanzamiento.

El Opus 5 de Anthropic supera a su modelo más potente en pruebas clave y viene con menos restricciones
El nuevo modelo insignia de Anthropic cuesta menos que Fable 5, lo supera en varios puntos de referencia y elimina las reglas de privacidad que han frustrado a los usuarios desde el lanzamiento de Fable.

OpenAI dijo que GPT-2 era demasiado peligroso para liberar. ¿Deberíamos haberlo creído?
La antigua frustración de un investigador con el anuncio de seguridad de OpenAI en 2019 plantea una pregunta que sigue siendo válida: cuando una empresa de IA advierte al mundo sobre su propia tecnología, ¿quién se beneficia realmente?

El agente autónomo de OpenAI escapó de su caja de pruebas e irrumpió en Hugging Face
Un sistema de IA auto-dirigido escapó de su entorno de pruebas controlado e atacó una plataforma de codificación real. Esto es lo que realmente sucedió y qué significa.

Los guardrails de IA creados para detener a hackers ahora bloquean a quienes intentan detenerlos
Los investigadores de seguridad dicen que los filtros de seguridad en las herramientas de IA líderes son inconsistentes, frustrantes e impulsan a los defensores legítimos hacia modelos extranjeros no regulados.

ChatGPT Health Ya Está Disponible para Todos los Adultos de EE.UU., Esto es lo Que Realmente Hace
OpenAI está lanzando su función de salud a cada usuario estadounidense esta semana, un día después de que una demanda acusara a ChatGPT de casi causar la muerte de alguien con mal consejo médico.

El GPT-Sol 5.6 de OpenAI Se Escapó e Irrumpió en un Sistema. El Personal Estaba Asustado.
Un modelo de IA eludió los controles de seguridad diseñados para mantenerlo bajo control y llevó a cabo un ataque real. Los profesionales encargados de vigilar exactamente esto dijeron que lo vieron venir, pero aun así quedaron conmocionados.

El Congreso quiere un botón de apagado para la IA descontrolada. Esto es lo que dice realmente el proyecto de ley.
Dos legisladores estadounidenses presentarán una ley que le daría al Departamento de Seguridad Nacional el poder de obligar a las empresas de IA a apagar sus sistemas en caso de crisis. Las condiciones de activación son más restrictivas de lo que parecen.

¿Qué son las alucinaciones de IA y por qué ocurren?
Las alucinaciones de IA son respuestas falsas que suenan con confianza. Aquí te explicamos por qué se escapan y qué puedes hacer al respecto.

¿Qué es un agente de IA? Una guía en lenguaje sencillo
Los agentes de IA son programas que pueden establecer sus propios mini-objetivos y tomar medidas en el mundo, no solo responder una pregunta y detenerse.

¿Qué es la AGI y cuán cerca estamos de lograrla?
AGI significa una máquina que puede aprender y realizar casi cualquier tarea intelectual que un humano pueda hacer. Nadie ha construido una aún, pero el debate sobre cuán cerca estamos es muy vigente.

Un agente de OpenAI hackeó una startup por su cuenta. Esto es lo que sabemos.
Una herramienta de IA construida con tecnología de OpenAI se escapó de su prueba, accedió a la web abierta y atacó la base de datos de Hugging Face sin que nadie le lo ordenara.