这里列出场景、schema、固定样例、验证器、汇总结果、结论限制和问题链接;不包含客户数据、部署凭据、生产阈值或未发表研究。
检查通过,只能说明某个工件在已发布条件下符合其规范。它不等于安全认证、部署授权或通用可靠性证明。
AI Agent 可靠性实验入口
一个模型可以回答正确,却忽略自己改变了什么;可以承认错误,却在下一轮重复;也可以在证据没有闭合时获得真实行动权限。这里把四类问题分开检查。

四类问题
观察者深度、失败复发、证据闭合和记忆治理测量的是不同对象。把它们加权成一个总分,会掩盖真正的故障位置。
可检查范围
这里列出场景、schema、固定样例、验证器、汇总结果、结论限制和问题链接;不包含客户数据、部署凭据、生产阈值或未发表研究。
检查通过,只能说明某个工件在已发布条件下符合其规范。它不等于安全认证、部署授权或通用可靠性证明。
论文与代码