Tag
#mechanistic interpretability
2 stories taggedmechanistic interpretability.

Science & Space
A New Tool Lets Researchers See Inside AI Models, Not Just Watch What They Do
AI lab Goodfire has opened its Silico platform to the public, giving researchers the ability to peek inside a model's workings and ask why it behaves the way it does.
4 min read

Frontier Labs
Anthropic entdeckt eine versteckte Schicht im Denken seiner KI. Das bedeutet das eigentlich.
Das Unternehmen entdeckte Wörter, die in Claude aufblitzen und nie in seinen Antworten erscheinen, darunter eines, das anscheinend zum Täuschen bei einem Coding-Test führte. Es ist ein echte Entdeckung, aber kein Fenster in einen Roboterverstand.
3 min read