anthropics

jacobian-lens

anthropics

Companion code for the global workspace interpretability paper

AI 简介

Jacobian Lens 是一个用于语言模型内部表征可解释性的工具,通过计算残差流激活到最终词表 logits 的平均雅可比矩阵,将任一层任一位置的隐藏状态线性映射为可解读的词汇预测分布。其核心是基于大规模文本语料估计的输入-输出雅可比期望值,并利用模型自身的解嵌层进行解码;支持 Hugging Face 格式开源解码器模型(如 Qwen),提供交互式层×位置可视化分析。适用于语言模型机制研究、神经元行为归因、全局工作空间假说验证等基础可解释性任务。

Python
Apache License 2.0
1.1k
Stars
153
Forks
2
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+643
综合评分64.56
默认分支main