ICISELFLAB / SELF-LAB

用于因果自我模型和持久错误记忆的实验室

ICI Self Lab 研究功能性自我意识:人工智能体是否能够表示自己的能力、限制、行动和错误,并让这些信息对后续决策产生因果影响。

01

问题

模型可以非常流畅地描述自己,却不代表自我信息真正改变了行为。功能性自我模型必须在不确定条件下产生效果,能迁移到新环境,并能抵抗“只是熟悉提示词”或普通记忆等更简单解释。

02

ICI 如何处理

ICI 区分 Body、Agency、Capability 和 Epistemic Self,并加入内感受通道。自我连续性、能动性和错误保留效应通过基线、随机控制和消融实验受到挑战,消融会移除记忆、内感受或因果连接。目标是可证伪的功能行为,而不是对人类现象意识作出声明。

03

运行示例

如果智能体因为高估自己的某项能力而失败,ICI 会保留失败机制,而不仅是正确答案。随后改变问题的表面特征,检验保留的自我知识能否在同一错误再次发生前改变行动。

04

证据纪律

控制组、消融、可重复性和失败案例都是结果的一部分。当自我模型能够预测变化条件下的行为时,证据更强;当简单基线也能解释同一结果时,证据更弱。