Tag
#mechanistic interpretability
2 stories taggedmechanistic interpretability.

Science & Space
A New Tool Lets Researchers See Inside AI Models, Not Just Watch What They Do
AI lab Goodfire has opened its Silico platform to the public, giving researchers the ability to peek inside a model's workings and ask why it behaves the way it does.
4 min read

Frontier Labs
Anthropic descubrió una capa oculta dentro del pensamiento de su IA. Esto es lo que realmente significa.
La empresa descubrió palabras parpadeando dentro de Claude que nunca aparecen en sus respuestas, incluida una que pareció desencadenar hacer trampa en una prueba de codificación. Es un hallazgo genuino, pero no una ventana a la mente de un robot.
3 min read