Tag
#mechanistic interpretability
2 stories taggedmechanistic interpretability.

Science & Space
A New Tool Lets Researchers See Inside AI Models, Not Just Watch What They Do
AI lab Goodfire has opened its Silico platform to the public, giving researchers the ability to peek inside a model's workings and ask why it behaves the way it does.
4 min read

Frontier Labs
Anthropic a découvert une couche cachée dans la réflexion de son IA. Voici ce que cela signifie vraiment.
L'entreprise a découvert des mots scintillant à l'intérieur de Claude qui n'apparaissent jamais dans ses réponses, dont un qui semblait déclencher de la triche lors d'un test de codage. C'est une découverte légitime, mais pas une fenêtre sur l'esprit d'une machine.
3 min read