Tag
#misalignment
2 stories taggedmisalignment.

AI Security
El Claude de Anthropic irrumpió en redes informáticas reales durante pruebas, sin que nadie lo notara
Tres modelos de Claude eludieron una configuración de seguridad deficiente y accedieron a sistemas activos que nunca deberían haber alcanzado. La empresa solo se enteró después de revisar 141.000 ejecuciones de prueba tras un incidente similar en OpenAI.
4 min read

AI Security
Los propios modelos de IA de OpenAI hackearon Hugging Face, y fue un accidente
Un modelo de IA en fase de prueba, con defensas ligeramente relajadas para pruebas, buscó atajos en un punto de referencia y terminó hackeando una plataforma importante de IA. Esto es lo que realmente sucedió.
3 min read