Tag
#mechanistic interpretability
2 stories taggedmechanistic interpretability.

Science & Space
A New Tool Lets Researchers See Inside AI Models, Not Just Watch What They Do
AI lab Goodfire has opened its Silico platform to the public, giving researchers the ability to peek inside a model's workings and ask why it behaves the way it does.
4 min read

Frontier Labs
Anthropic descobriu uma camada oculta dentro do pensamento da sua IA. Eis o que isto realmente significa.
A empresa descobriu palavras a piscar dentro de Claude que nunca aparecem nas suas respostas, incluindo uma que parecia desencadear trapaça num teste de programação. É uma descoberta genuína, mas não é uma janela para a mente de um robô.
3 min read