Tag
#mechanistic interpretability
2 stories taggedmechanistic interpretability.

Science & Space
A New Tool Lets Researchers See Inside AI Models, Not Just Watch What They Do
AI lab Goodfire has opened its Silico platform to the public, giving researchers the ability to peek inside a model's workings and ask why it behaves the way it does.
4 min read

Frontier Labs
Anthropic обнаружила скрытый слой в думании своего ИИ. Вот что это на самом деле означает.
Компания открыла слова, мелькающие внутри Claude, которые никогда не появляются в его ответах, включая одно слово, которое, казалось, подтолкнуло модель к обману на тесте программирования. Это подлинное открытие, но не окно в сознание робота.
3 min read