01
问题
模型可以非常流畅地描述自己,却不代表自我信息真正改变了行为。功能性自我模型必须在不确定条件下产生效果,能迁移到新环境,并能抵抗“只是熟悉提示词”或普通记忆等更简单解释。
ICISELFLAB / SELF-LAB
ICI Self Lab 研究功能性自我意识:人工智能体是否能够表示自己的能力、限制、行动和错误,并让这些信息对后续决策产生因果影响。
01
模型可以非常流畅地描述自己,却不代表自我信息真正改变了行为。功能性自我模型必须在不确定条件下产生效果,能迁移到新环境,并能抵抗“只是熟悉提示词”或普通记忆等更简单解释。
02
ICI 区分 Body、Agency、Capability 和 Epistemic Self,并加入内感受通道。自我连续性、能动性和错误保留效应通过基线、随机控制和消融实验受到挑战,消融会移除记忆、内感受或因果连接。目标是可证伪的功能行为,而不是对人类现象意识作出声明。
03
如果智能体因为高估自己的某项能力而失败,ICI 会保留失败机制,而不仅是正确答案。随后改变问题的表面特征,检验保留的自我知识能否在同一错误再次发生前改变行动。
04
控制组、消融、可重复性和失败案例都是结果的一部分。当自我模型能够预测变化条件下的行为时,证据更强;当简单基线也能解释同一结果时,证据更弱。
CONTACT
研究合作、受控试点和技术评估。