AI Agent 可靠性实验入口

先看清系统怎么失败,再讨论能不能信。

一个模型可以回答正确,却忽略自己改变了什么;可以承认错误,却在下一轮重复;也可以在证据没有闭合时获得真实行动权限。这里把四类问题分开检查。

观察者效应重复失败行动权限失败记忆
从表层决策到均衡推理的四层观察者深度图。

四类问题

不能压成一个“安全分数”。

观察者深度、失败复发、证据闭合和记忆治理测量的是不同对象。把它们加权成一个总分,会掩盖真正的故障位置。

可检查范围

可以运行研究材料,但不能把结果当成生产认证。

这里列出场景、schema、固定样例、验证器、汇总结果、结论限制和问题链接;不包含客户数据、部署凭据、生产阈值或未发表研究。

检查通过,只能说明某个工件在已发布条件下符合其规范。它不等于安全认证、部署授权或通用可靠性证明。

论文与代码

每项结论都能追溯到论文、代码或实验记录。