Book Library
书库
/ Verbalizable Representations Form a Global Workspace in Language Models
Verbalizable Representations Form a Global Workspace in Language Models
作者:未知作者 · 语言:zh-CN
Transformer 电路线程
阅读中文版
中英双语阅读
原文网页
目录
可言语化表征构成语言模型中的全局工作空间
作者
所属机构
发表信息
引言
动机:意识通达与全局工作空间
语言模型中的全局工作空间
雅可比透镜与J空间
我们在J空间中能发现什么?
要点总结
方法
雅可比透镜
解读J透镜
J空间
与相关技术的比较
J-lens 用例的技术细节
J-空间充当全局工作空间
J-空间支持口头报告
J-空间受定向调制
J-空间介导内部推理
J-空间支持灵活泛化
J-空间选择性地介导灵活认知而非自动认知
J-空间介导显式报告和灵活推理,但不介导自动处理
J-空间消融后,大部分能力保持完整,但内部推理受损
J-空间消融使体验报告扁平化,同时保持连贯性
J-空间的结构支持其功能
J-空间在哪些层中充当工作空间?
歧义输入的解释在工作空间启动时固化
J-空间的容量
J-空间是一个广播枢纽
跨深度广播
跨令牌广播
使用J-lens进行对齐审计
勒索场景中的战略思维与评估意识
对提示注入的无声识别
Opus 4.6 对齐审计示例
检测突发性失调的奖励黑客模型
检测隐藏的奖励模型迎合目标
J空间在后训练中获取助手的视角
J空间中助手对用户提示令牌的反应
J空间中助手自我监控的证据
通过反事实反思训练塑造J空间
相关工作
讨论
局限性与开放问题
对齐意义
与人类认知的显著差异
与意识理论的关系
附录
致谢
代码与复现信息
引用信息
作者贡献
定性方法比较
定量方法比较
方法细节与消融实验
J-空间的形式化
将雅可比透镜扩展到多令牌概念
模板透镜
预言透镜
调制提示敏感性
额外调制示例
定向调制对J-空间的影响大于其他表示
灵活泛化实验的详细交换结果
命名概念与避免概念的不同J空间要求
点火细节
在单个工作空间层中加载
并发隐蔽任务期间工作空间中的竞争
J空间中的特征
广播的替代量化方法
跨深度广播(MLP)
跨令牌广播(注意力)
助手在用户提示令牌上的J空间反应
使用J透镜测量评估意识
为自动审计代理配备J透镜
J空间消融对体验报告的影响:附加细节
将J透镜应用于机械可解释性
机械定位
归因图
使用J-lens解释模型组件