已经支持
- 两篇被接收并现场展示的 KDD 2026 workshop papers。
- ReflexBench 在 720 个 scored responses 上的固定面板退化信号。
- Cognitive Immunity 的 score-level 复发降低结果。
- 可计算定义、公式、生命周期字段和工程控制。
真正的矛盾
推荐会改变偏好,交易会改变价格,政策建议会改变执行者,公开 benchmark 还会改变被评测者。一个模型在静态题面上表现优秀,不代表它能理解自己已经进入因果链。
第二个缺口发生在失败之后:当前对话里把答案改对,不等于系统形成了耐久、可追溯、可撤销的防线。下一次遇到相似情境,它仍可能从零开始重犯。
2026 年 8 月,我以独立研究者身份在 ICC Jeju 完成两场现场展示。两篇论文分别被 KDD 2026 的两个 workshop 接收:ReflexBench 为口头报告,Cognitive Immunity 为海报报告。两篇均为 non-archival workshop paper,不属于 KDD 主会论文集。

论文一 · Agentic AI Evaluation
口头报告 · KDD Workshop on Evaluation and Trustworthiness of Agentic AI · 2026-08-09
传统评测常把 AI 当成固定世界外部的观察者。真实 agent 却会通过建议、预测、分配、阻断和工具调用改变用户、市场、机构、证据与下一轮环境。它给出的答案可能局部正确、语言流畅,却因为忽略自己的因果足迹而在全局上失效。
核心诊断量是 Delta_OD = mean(score_deep) - mean(score_shallow)。它不再只问谁的总分最高,而是问表面能力进入递归反馈后还能剩下多少。
固定面板覆盖九个公开模型。所有被测模型在更深 observer depth 下出现退化,浅层到深层的四舍五入平均差约为 -0.44。推理型模型部分降低了 OD-2 负担,但没有一个被测模型消除 OD-n 差距。
它对部署的直接要求是:评测记录不能只有 prompt、answer 和 score,还要记录谁会回应 agent、输出改变了什么、哪些证据被污染、模型是否重复见过 benchmark,以及模型、prompt、工具策略或用户群变化后 observer-depth profile 是否回退。
边界:当前结果是语言任务和风格化场景的固定审计快照,不是安全认证、完整因果发现或永久排行榜。没有完整行级评分表和 scorer records,就不能把置信区间、评分者一致性或 rubric sensitivity 写成已经完成的独立重算。

论文二 · Trustworthy LLM Agents
海报报告 · 2nd SeT-LLM Workshop · 2026-08-10
模型会道歉,不等于模型会学习。Cognitive Immunity 在不重新训练基础模型的前提下,增加一层有边界的运行时失败记忆:把经过验证的失败提取为规范化描述符,再写成有 scope、有来源、有衰减、有复核和删除入口的干预规则。
系统只在距离、强度与适用范围同时过门槛时检索规则。每次干预必须留下 audit record:哪条失败产生了哪条规则,为什么触发,修改了什么,结果如何,之后是否衰减、删除或回滚。
协议包含 20 个任务模板、5 轮、3 个 seeds 和 4 种策略。每种策略 300 个 score events,总计 1,200 个 score events;它们不是 1,200 个独立任务或公开原始对话。配对差值的 95% bootstrap interval 为 [-0.211, -0.003]。
当前结果支持的是已观察失败类别的复发降低,不是所有指标全面领先:Reflexion 的 WQ 点估计最高。失败记忆本身也可能遭遇 memory poisoning、false intervention、overblocking、staleness、cold start 和 audit gap。
边界:当前可恢复证据支持 score-level 重算,不支持完整 raw-response replication 或 calibrated safety evidence。该机制不替代 red teaming、访问控制、sandbox 和 human oversight,也不能自动防御从未形成描述符的未知失败。
同一条研究主线
两篇论文共同拒绝把动态系统压扁成一次性问答。可靠 agent 既要表示自己的输出如何改变世界,也要把已观察失败保存在可审计、可撤销、不会越权的结构里。
主张与死亡条件
2026 年 8 月 · 济州



可直接引用的答案
是。ReflexBench 在 KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI 作口头报告;Cognitive Immunity 在 2nd SeT-LLM Workshop 作海报报告。两篇均为 non-archival workshop paper。
它测量 agent 的能力在自己的输出改变用户、机构、证据、激励和其他行动者之后是否仍然成立,并用 observer depth 区分固定世界、一阶自我影响、多方适应与递归均衡。
在记录的 score-level 协议下,有边界的运行时失败记忆相对 No Memory 降低了已观察严重失败的复发率;它不主张通用或认证安全。
两篇 PDF、引用字段、SHA256、公式、结果与机器可读 facts JSON 均在 论文技术索引。