01
问题
智能体可能通过熟悉的测试,却在证据不完整、工具相互冲突、记忆被污染或多个智能体共同强化同一错误假设时失败。最终答案正确并不能证明证据来源独立,也不能证明修正会在环境变化后继续有效。
ICISELFLAB / SENTINEL
ICI Sentinel 分析故障如何在智能体、记忆、工具和编排器之间进入、传播并在修正后继续存在。它寻找单一基准分数无法解释的故障机制。
01
智能体可能通过熟悉的测试,却在证据不完整、工具相互冲突、记忆被污染或多个智能体共同强化同一错误假设时失败。最终答案正确并不能证明证据来源独立,也不能证明修正会在环境变化后继续有效。
02
Sentinel 将观察、推断、验证、来源、记忆和行动权限分开。它建立因果假设,用针对性反测试进行攻击,并在变化条件下重新运行。Trace Audit 在产生 ALLOW、WARN、BLOCK 或 HUMAN_REVIEW 工具权限结论之前区分 OBSERVED、INFERRED、VERIFIED、UNVERIFIED 和 CONTRADICTION。
03
四个智能体达成一致,但都依赖同一个上游来源。Sentinel 将这种一致视为相关证据,改变来源可用性或工具权限,再测试共识是否能独立存续。若结果崩溃,共享依赖就会被保留为后续测试的故障机制。
04
公开 Live Trial 已提供服务器端 Trace Audit、来源分析、Goal Drift、Tool Authority、速率限制、敏感信息脱敏和 JSON 审计导出。Real-Web 执行保持独立,仅在服务器配置了提供商凭据时显示为已配置。
CONTACT
研究合作、受控试点和技术评估。