research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻) - #335
research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻)#335oratis wants to merge 54 commits into
Conversation
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
第四轮 deep-research(12 目标 × [发现员+怀疑复核] + 总裁决 = 25 agent, 0 error) 对抗式证伪狭义主张。结果 holds-with-caveat, 0 反例 0 refute: - 族6 回放选择准则全覆盖: reservoir=随机 / GDumb=类别平衡 / GSS=梯度多样性 / iCaRL=代表性 / DER++=reservoir(标签仅进loss) 皆真准入门; MIR 是检索门非准入门; 生成式回放/CLS 无逐项门 — 无一用概念级正确性 - 族5 局部学习: FF/PC/EqProp 无 episodic 门(量词空真); Hopfield 容量=被动饱和; recall-gated/self-sizing 是 GT-free 但信号为熟悉度/新颖 - 两悬案关闭: CN-DPM ✅ 确立为架构原生两段式(WAKE/SLEEP, DP×似然门); 2606.03787 ✅ 确立为真实 surprise-gated robot episodic memory - caveat: 2026 agentic 记忆写入门(Write-Time Gating/TRUSTMEM/LOCI)引入新代理 (来源信誉/对源忠实/可靠度/外部oracle), 均非概念真伪 → 代理表扩到十类, delta 收紧为 "GT-free / 无外部 oracle"; LOCI 为最锋利近邻(外部结果确认) - 引用修正: GDumb arXiv:2007.05003 是误号 → ECCV 2020 proceedings 改动: §7.6.2 代理表+12行 / 新增 §7.6.7 总裁决 / §7.6.4 证据强度重排 / §7.6.5 关闭两悬案 / §7.6.6 引用陷阱 / 附录 I 族4/5/6 落地 / §9.1 勾掉第四轮 / §9.2 Q9/Q11 已答+Q12 / §9.3 立论包(proposal+related-work+三层架构最小实现) Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
四轮调研收官后进入设计。两份新文档把立论包 §9.3 的 C2/C4 展开为可实现规格:
- DESIGN_COMPRESSION_GATE.md — 机制
* 两部分 MDL 形式化:G(c) 必须在【留出轮次】上算、必须含 L(c)、必须过【安慰剂对照】
* 修正 C4:区分 E1(模型误解 → 压缩门拒绝 ✅)与 E2(老师教假话 → 压缩门接受,
属设计边界,归 provenance 门射程)——原措辞"拒绝一切错误概念"会被 E2 反例击穿
* 现有七种门在 E1 上的失分表 + 七条失败模式 + 八项消融矩阵
- DESIGN_CONCEPT_BENCH.md — 数据
* 构造语言(伪词四道过滤 / 组合式微世界 / 语法距离旋钮)
* gavagai 对 G1–G5:教学集在构造上不足以消歧,只有留出用法能揭示所指
→ 把 E1 从"碰运气"变成可控可判分的实验条件
* 切断 Aycock 平行样例捷径的教学协议;冲突词跨用户隔离测试
* 实施顺序按"最早能证伪"排:P0 零算力先验证核心信号
研究文档同步回填 C4 修正、related-work 末句收紧提示、P0 指引。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
首个实证结果(Qwen2.5-1.5B 冻结,零训练,8 个 gavagai 对)。
结论:机制成立,但【压缩什么】比【用什么判据】更关键。
1. 朴素版(在老师自由陈述上算 NLL)——失败
· G 表面 8/8,但拆开看 92% 的 margin 来自长度罚 L(c)
· 纯预测力 ΔNLL 仅 +0.68 nats(5/8, 符号检验 p=0.36 不显著)
· 词级 margin +0.02 ≈ 零:给不给正确定义,模型输出该伪词的概率几乎不变
· 2/8 项被错误安慰剂击败
→ 若只报 G 的 8/8 就是假阳性结论;诊断项是设计时特意埋的,起了作用
2. 决定性诊断——能力在,观测方式错
· 强制选择探针:M/M′ 落差平均 0.295,6/8 有区分(最强 0.954→0.026)
· 失败的 2 项均需世界知识(盒子不圆 / 石头非金属)
3. 修正版(改压缩老师的用词决策序列)——成立
· ΔNLL +4.92 nats(8/8, p=0.0039),较自由陈述版提升 7.2×
· 安慰剂对照 8/8;4/8 项上误解的增益为负(比无概念更糟,门直接拒绝)
· 长度罚占比 92% → 60%
未解决(已写进文档,不可声称已解决):
· 单候选阈值跨 item 不可分,最佳归一化 AUC 0.875
→ 门目前是排序器,不是阈值判据;per-item 校准是最大缺口
· 范畴歧义远易于合取歧义(+10.73 vs +2.99),勿用 G2 数字代表整体
回改:机制文档新增 §1.2b(观测量)、§1.3 阈值警告、消融必报项 A0′/A0″。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按路线图推进第 1、3 项(第 2 项缩放测试受下载带宽阻塞,未完成)。
1. per-item 校准(P0d)——部分成功
· 用安慰剂池作零分布算 z 分数:AUC 0.797 → 0.906
· 设计预测精确成立:M′ 平均 −0.22 vs 零分布中心 −0.27(仅差 0.05 nats),
M 为 +3.86 显著离群 → 零分布含 overspec 的设计是对的
· 与 SEMA(族 4 最接近先例)同一套 z 校准机制,差别只在信号类型 → 可正面引用
· 试过 6 种归一化(硬零分布/仅overspec/稳健z/百分位/÷base),全局可分性均未达成
2. ★ 根因定位:门的判别力继承自基座能力(新增第二前置条件)
· ρ(能力探针落差, 判别 margin) = +0.857
· 探针失败组 margin +2.11 vs 通过组 +5.86(2.8×)
→ 校准无法弥补能力不足;这是原设计未识别的前置条件
3. 扩展集 v2(P0e)——22 items × 5 类歧义 + bootstrap CI
· margin +4.08 nats 95%CI [+2.52,+5.70](不含 0);19/22,p=0.000428
· AUC 裸 0.843 [0.738,0.942] / z 校准 0.857 [0.746,0.950]
· 分类型差异是主导因素:
G2 范畴 +9.12 (AUC 1.000) · G3 材料 +8.25 (1.000) · G1 合取 +2.93 (0.861)
G5 绝对/相对 +0.53 (0.812) · G4 论元顺序 +0.15 (0.562 ≈ 随机)
· ★ 分层可分性:仅 G2/G3 时单候选阈值 AUC 1.000、τ=+0.75 ✅
→ 把「阈值不可分」从方法缺陷重定位为【作用域条件】
4. 🔴 撤回一个我方设计预测
· 设计时预期「双向判别(G3-G5)强于单向(G1,G2)」→ 实测相反(+2.98 vs +5.41)
· G4 失败机制查清:|ΔNLL| 仅 0.90 vs 其他 4.74,定义完全不改变模型预测
(靠表层语序启发式作答)——能力缺失,非材料或门的缺陷
5. bf16 与 fp32 结果一致(margin +4.90 vs +4.92,AUC 相同)→ 精度非混淆项
回改:机制文档新增 §1.3b(零分布 z 校准)、失败模式 8/9、前置条件 2;
bench 文档标注 G1/G2/G3 为主实验核心、G4/G5 为作用域边界。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P0e 发现 G4(论元顺序)AUC 0.562 ≈ 随机、|ΔNLL| 仅 0.90(其他类 4.74)。 本实验保持任务不变、只改定义呈现方式,分开三种互斥解释: a 抽象变量 "X zelka Y" means X gives to Y → margin +0.15 (2/4), |ΔNLL| 0.90 b + 显式角色说明(第一个名字是给予者…) → margin −0.56 (1/4), |ΔNLL| 3.37 c 用真实人名实例化(去掉变量绑定) → margin +0.35 (3/4), |ΔNLL| 0.87 对照:其他 4 类歧义 → margin ≈ +4.9, |ΔNLL| ≈ 4.74 裁决:(A) 能力缺失。三种呈现都无信号 → 排除 (B) 变量绑定 与 (C) 提示格式。 关键细节:b 的 |ΔNLL| 升到 3.37 说明显式角色说明确实大幅改变了模型预测, 但 margin 转负 —— 不是"定义被忽略",而是模型用了定义却仍分不清论元角色。 这把 G4 从"可能是提示假象"坐实为【基座能力边界】。 含义:论文作用域应以 G1/G2/G3(属性/范畴/材料)为核心, G4/G5 单列为当前基座不可及的边界,勿混入主指标。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
项目目标扩展为「探索所有 AI 模型将知识内化的方案」,据此新建全景文档, 把前四轮调研的材料重组为按机制的分类学(而非按论文名)。 概念脊柱(本文档的原创综合,标 💭): · 内化的五个判据 I1–I5:免检索/组合性/隐式触发/跨会话持久/抗干扰 → "学会了" ≈ 五者合取;RAG 只满足 I4,是"存储"不是"内化" · 内化度阶梯 L0–L5:上下文→外部存储→激活/状态→适配器→稀疏槽→稠密权重 · ★ 核心张力:内化度 ↑ ⟹ 可逆性 ↓、可隔离性 ↓ 所有工程方案本质上都是在这条对角线上选点;有意思的研究都在中间层 L3/L4 · 内化流水线六环节:获取→准入门控→写入→巩固→保持/隔离→调用 实证发现:环节②(准入门控)是全领域最薄弱的一环 三个正交轴:载体 × 写入算子 × 时机,外加横切的准入门控维度。 家族 A–I 已落地(ICL/外部记忆/SSM状态/TTT快权重/稀疏槽/per-user适配器/ 权重编辑/可生长模块/局部规则),每族回答四问:内化到哪里、用什么写入、 持久性、有无准入门控;全部带 ✅/⚠️ /❌/🔍/💭 验证状态。 §4 横向矩阵读出三条结构性事实: 1. 「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓ 2. 有门控的家族信号都不是正确性(十类代理占满,正确性列空) 3. 唯一原生快慢分离(HOPE/CMS)把巩固接到时钟而非门 §5 五个根本张力:稳定性-可塑性、叠加不可寻址、内化度反比、容量上界、 隔离 vs 泛化(后者在架构文献中命中为零)。 §7 定位本项目并声明边界:压缩增益验证「对该对话者用法的语义保真度」, 非「世界真值」;解决 E1(模型误解)不解决 E2(老师说假话), 后者属 provenance 门射程,两者正交可组合。 待办:第五轮调研(进行中)回填 J–P,尤其 J 上下文蒸馏—— 它可能是「推理期写入 × 跨会话持久」那格的已有解,若是则空白声明需收紧。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
问题:门的判别力继承自基座能力(ρ=0.857),关系类概念上几乎无信号,
校准救不了(试过 6 种归一化)。原设计的门是二态的(毕业/不毕业),
在能力不足处任何阈值都是在读噪声。
方案:加一个前置的【可判定性闸门】,让门能"知道自己判不了"并转为追问。
可判定性计 σ_null = 零分布的离散度,必须满足三条且都满足:
· GT-free(不需要答案)
· 不需要知道哪个候选是对的(对比:能力探针 ρ=0.857 但需要两个候选)
· 门本来就要算零分布 → 零额外开销
语义:把候选定义塞进上下文后,模型预测到底会不会被影响。
σ_null≈0 ⟹ 定义没进入决策 ⟹ 增益判据无效。
实测(22 items):
σ_null: G1 4.75 / G3 4.12 / G2 2.93 ≫ G5 1.07 / G4 0.64
ρ(σ_null, margin) = +0.520
三态门(τ_dec=1.5, τ_z=+0.68):
AUC 0.857 → 0.964(τ_dec=2.0 时 0.970)
正确接受 M 15/15(零漏拒)· 正确拒绝 M′ 12/15 · 弃权 7/22
覆盖项准确率 90.0%
⚠️ 仍误收 3 个 M′ —— 误解被固化是最该压低的错误,未解决
★ 弃权的正当性检验(关键):被弃权项的 AUC = 0.551 ≈ 随机
→ 门弃掉的正是它本来就判不了的,不是在丢信号
这让弃权从"逃避"变成"有依据的判断"
回改:
· 机制文档 §1.4 毕业判据从二态升级为三态(ACCEPT/REJECT/ASK),
失败模式 8(基座无能力)标为"已解决为机制"
· 全景文档 §1.3 流水线补充:环节②应含元判断"判不判得了",
指出现有所有方案的门都是二态的、没有"弃权"这一态
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 机制文档:状态行更新为「判据已升级为三态门」;失败模式 8(基座无能力) 标为「已解决为机制」——σ_null 可判定性闸门可检出并弃权 · 全景文档 §1.3:流水线环节② 补充元判断「这条经验我判不判得了」, 并指出现有所有方案的门都是二态的、没有「弃权」这一态 · 全景文档 §7:补三态门实测结果与三层架构中的位置 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第五轮调研(上下文蒸馏/模型合并/知识蒸馏/检索增强/自我改进/睡眠期/
参数化知识库)回填完成,A–P 全覆盖,文档 631 行。
🔴 证据等级警告(已在文档顶部与 §3 前置声明):
第五轮的 Verify 与 Synthesize 阶段未执行完(工作流在 Fetch 后中断,
输出文件为空),130 条主张未经 3 票对抗验证。
J–P 全部标 🔍,与 A–I 的 ✅ 不可混用。
★ 最重要的一条:撤回原 §4 结构性事实 1
原文:「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓,是最干净的结构性空白。
实况:家族 J(上下文蒸馏)恰恰填上了这一格;其中 Generative Adapter
(ICLR 2025)更做到 单次前向写入 × 跨会话 × 天然按用户隔离。
修正后仅保留弱版本:该格在纯架构层 A–I 内为空;J 靠额外离线蒸馏步/摊销 hypernet。
(这条风险在上一版 §8 待办里已预警,现应验并如实撤回。)
★ 但定位反而更强:J/J′/O 三族「有完整内化管线、唯独没有准入门控」
→ 贡献声明从「提出新架构」收紧为
「给一个已跑通的内化管线补上它唯一缺的器官:无需标准答案的正确性门」
→ 不必自证管线可行(J 族已证),只需证明「加门比不加好」
→ 2605.26099 的调研记录直接点出「这个无门控正是压缩增益门可插入的位置」
新增两条必须处理的风险(已写进 §7 与 §8):
1. 内化不幂等(When Context Returns, 2606.11627):把原始 context 重新塞回
已蒸馏模型,性能反而变差,甚至在它本已答对的样本上退化。
本项目正是「引用→内化」系统,必须测;已知轻量修复 = stop-gradient
anchoring + forward KL 一致性正则。
2. 迭代内化的 progressive capability collapse(2606.04703);
缓解线索 principle-level > instance-level、step-wise > global。
一条理论正面支持:Sharpening 机制(ICLR 2025)证明自我改进不可能创造
模型中原本不存在的信息 → 新知识必须来自外部证据 → 从理论侧确认本项目
「新概念必须在引用中从对话者处获得」的问题设定是对的。
其他要点:M 族给出「何时写进权重」的判据双轴(规模轴标度律 + 长尾流行度轴);
K 族 task vector 取负提供了罕见的可逆性,但崩塌是任务对固有属性且有解析上界;
N 族模型坍缩需连边界条件引用(替换式才坍缩,累积式不坍缩);
P 族 LMLM 的损失掩码即准入门,且支持 instant forgetting。
新增附录 J(J–P 文献表,全部 🔍)。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
3B 下载完成,路线图第 2 项解除阻塞并跑通。结论与我方预测相反。 预测(由 ρ(能力探针,margin)=+0.857 导出):放大基座应同时提升 margin、 判别质量、全局可分性。 实测(22 items,同材料同代码,均 bf16): margin +4.08 → +16.82 (涨 4×) ✅ M 胜出 19/22 p=0.00043 → 15/22 p=0.067 ❌ 不再显著 AUC(z) 0.857 → 0.738 ❌ → margin 大 ≠ 判得准,二者不是一回事 分类型显示两种失败模式对缩放反应相反: G4 论元顺序 0.562 → 0.812 ✅ 改善(原最差项,"没有信号"型失败确实随规模缓解) G1 合取 0.861 → 1.000 ✅ G5 绝对/相对 0.812 → 0.000 ❌❌ 彻底翻转(4/4 全判反,margin −21.70) ★ 新错误类型 E5「条件化失败」: G5 的实例措辞 "next to Y" 提示比较读法;3B 模型即使被明确告知 "该词指绝对大"仍按比较读法作答 —— 模型没有忠实条件化于给定定义, 先验压过了定义。而先验强度随规模增长 ⟹ 该失败模式越大越糟。 与 E1–E4 的区别:E1 是模型的假设错;E5 是假设对但模型不按它行动。 测量效度含义:ΔNLL 实测的是「(模型先验 ⊗ c) 解释数据的程度」,不是 c。 ★ 三态门接不住 E5(弃权机制的盲区): G5 的 σ_null 均值 6.94(不低)、z(M′) 均值 +3.52(强离群) → 模型是「自信地判反」而非「判不了」,可判定性计读出的是「可判定」 → 「不可判定」≠「自信地错」,σ_null 只能检出前者。当前最大未解决问题。 方法学注记:能力探针在 3B 上饱和失效(落差 +0.297→+0.058,6/8→1/8; ρ 0.857→0.310)。它是两个趋近 1 的概率相减 —— 这不是能力瓶颈结论被推翻, 而是该仪器在 ≥3B 不再可用;σ_null(离散度)更稳健。 必须声明的混淆:G5 把对照物写进实例本身,本就提示比较读法。但真实对话 总是带框架的,故这是真实的测量效度问题,不能仅当作材料瑕疵;两种解释都报告。 机制文档:新增 E5 行与前置条件 3(模型必须能忠实条件化于候选概念)、 失败模式 10。候选解法方向:忠实性探针(在定义能给出平凡确定答案的实例上 检查模型是否遵循 c)。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按计划做了两件事:验证仪器、试 E5 的候选解法。两个结果都是负面的,
其中一个纠正了我上一条提交里的结论。
1. P0h 仪器有效性检查(下 E5 结论前的前置验证)
· 平凡常识题:raw 6/6、chat 6/6 → 仪器正常,E5 不是格式假象 ✅
· 但伪词+定义的平凡应用 3B 仅 4/6:
"kirel means red" + "Is a red box kirel?" → p(yes)=0.000(以概率 1.0 答 No)
→ E5 比 §6c 原先归因的「framing 提示比较读法」更广:
3B 连无任何框架的单属性平凡应用都会失败。
2. P0i 忠实性探针 F(c) —— 我提的方案,失败
构造「答案由候选定义单独蕴含」的平凡实例(GT-free 成立),
F(c) = p_yes(蕴含Yes) − p_yes(蕴含No)。
预测判错的 AUC:F_min 1.5B 0.895 / 3B 0.533(≈随机)
σ_null 1.5B 0.965 / 3B 0.905
→ 两个规模都不如 σ_null,3B 上退化到随机。假设推翻,不采用。
(细节:3B 的 G5 上 F(M)=0.403 < F(M′)=0.768,模型对错误读法反而更忠实,
与先验压过定义一致;但 F_min 聚合后挑不出这类项。)
3. ★ 纠正上一条提交里的过强结论
上次写「σ_null 是盲的、接不住 E5」。数据不支持:
判错的 7 项 σ_null 均值 6.72 vs 判对的 15 项 13.06
σ_null 预测本项会不会判错的 AUC = 0.905
→ σ_null 对 E5 并不盲,它在失败项上系统性更低。
→ 真正坏掉的是阈值跨规模不可迁移(3B 的 σ_null 约为 1.5B 的 4 倍,
1.5B 调好的 τ_dec=1.5 在 3B 上无意义)。
→ 这是校准问题,不是盲区;修法应是把 σ_null 无量纲化,而非另找信号。
限制清单相应更新(第 10/12 条),并把失败的 F(c) 存档以免重复劳动。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
失败模式 10 与前置条件 3 更新: · σ_null 对 E5 并不盲(判错组 6.72 vs 判对组 13.06,AUC 0.905) · 真问题是阈值跨规模不可迁移(3B ≈ 1.5B 的 4×)→ 需无量纲化 · 忠实性探针 F(c) 已试且失败(3B AUC 0.533≈随机),标注不采用以免重复 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
§6d 定位出真问题是阈值跨规模不可迁移(3B 的 σ_null ≈ 1.5B 的 4×)。本次解决。 测了 6 种归一化,双标准:A 组内 AUC 不降;B 1.5B 选的阈值直接用到 3B 仍有效。 结果: raw AUC 0.965/0.905 迁移❌(3B 全保留,无弃权效果) /base AUC 0.965/0.724 迁移◐ ← 我事先按量纲推理看好的,实测失败 /|mu| AUC 0.667/0.743 迁移✅ ← 但组内 AUC 太低,判为噪声,不推荐 rank AUC 0.965/0.905 迁移✅ ← 采用 ★ rank 是对的,且有构造性论证而非拟合: · rank 是 raw 的单调变换 ⟹ 组内 AUC 与 raw 完全相同,判别力分毫不损 · 分位数天然无量纲 ⟹ 跨规模可比 两点都是构造性质,不是在 22 样本上碰巧拟合出来。 覆盖/准确率权衡在两个规模上都单调(信号良态的标志): τ=0.19 → 1.5B 18/22 100% | 3B 18/22 77.8% τ=0.40 → 1.5B 13/22 100% | 3B 13/22 92.3% τ=0.60 → 1.5B 9/22 100% | 3B 9/22 100% (3B 不弃权基线 68.2%) 🔴 但这没有解决 E5:3B 上 τ=0.19 弃掉的 4 项里只有 3 个是真错误; 7 个错误中 G4-01/G4-04/G5-01/G5-02 未被抓住——G5 的 E5 错误多为中等 σ_null。 ⟹ 校准问题与 E5 问题是两个独立问题,§6d 把它们混在一起了,本节分开。 部署代价:rank 需要一批候选才能算分位(同轮候选池或滚动窗口), 必须写进论文。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第六轮的正式 Verify(3票) 阶段未跑完,但抓取代理完成了 pdftotext 全文穷举 +
关键词逐条核查。据此引入中间证据等级 ✅ᶠ(全文穷举级,强于 🔍 弱于 ✅)。
★ 确认(✅ᶠ 全文穷举)——立论支点在「已实现方法」层面成立:
· Generative Adapter (ICLR 2025):21 页 camera-ready、136KB 全文,
admission/admit/filter/criteri*/threshold/verif*/trust/confiden*/reliab*/
surpris*/salien*/discard/relevance/importance 命中全为 0;
近似命中逐条证伪——gate 唯一命中是 'aggregated' 子串,gating 是 'investigating' 子串
· Cartridges:Algorithm 1 是裸 chunk→seed→sample 循环,每条生成对话直接进训练集;
损失为纯 KL 上下文蒸馏,无正确性/事实性/置信度项;38.6×/26.4× 数字准确
· Cartridges at Scale:12,094 词穷举 gate/admission/novelty 均 0
★★ Appendix J 提供「凡进上下文即写」的直接铁证:9 个 FinQA cartridge 的
688 个唯一数字中仅 41% 有原文依据,纯粹捏造占 9%(n=62),全部被无差别写入
🔴 改正 4 处错误:
1. LMLM 不是 NeurIPS 2025 主会 → 是 CCFM workshop Oral;
且 v3 已更名 Large → Limited Memory Language Models(沿用旧名会检索错配)
2. LMLM「损失掩码即准入门」是范畴错置 → 掩码是训练目标;真正的写入过滤器是
标注管线的 Corrector(按损失丢弃 top-10%,判据=格式合规+上下文可推得性,非正确性)
3. Sharpening「自我改进不可能创造新信息」不是该文定理 → 是动机性前提,
正文归因于 data-processing inequality (Cover 1999)。引用须改归因。
但适用范围核查对我方有利:论文显式限定「无外部反馈」自采样设定,
故不能外推到「有外部证据进入上下文」,我方推论仍成立。
4. Generative Adapter「全程无梯度」不准确 → 仅测试期;生成器 G 需离线自监督预训练。
「省 4×」必须连代价一起报:F1 66.0 → 40.2(相对下跌 39%),只报 4× 是误导。
🔴🔴 优先权风险(对本项目最重要):
arXiv:2607.08032 "What to Keep, What to Forget: A Rate–Distortion View of
Memory Compaction"(Colaco & Lahjouji, 2026-07-09)
· 有利:独立佐证我方否定性支点(该文 49 次 gate 命中全是架构门控单元,
admission/verify/correctness 全 0;断言各层保留信号一律是注意力幅度或时近性)
· 不利:其开放问题已提出基于边际任务条件信息量 I*(Q) 的写入准入判据,
与压缩增益/MDL 门在动机与形式上高度同构
→ 裁决:已实现方法层面支点仍成立(该文未实现、未实验),但已被提出层面被占位
→ 贡献声明收紧为「尚无方法【实现并实证】基于压缩增益的写入准入门控」,
并把 2607.08032 作为 concurrent position work 正面引用
→ 这是继 SAGE 之后第二次有工作逼近本项目位置,且这次在信息论形式上更近
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
汇总 2026-07-24→07-31 的全部工作,作为 PR 的主文档。 结构:研究问题(四性质 P1–P4) → 方法(6 轮对抗调研 + P0–P0j) → 主要发现 → ★被推翻或收紧的我方主张(10 处) → 当前状态 → 下一步 → 产物索引。 核心结论: · 定位:空白在「门控信号的类型」而非「有没有门控」;十类代理占满, 「无 GT、无外部 oracle 的概念级正确性」一列为空 · 实证:压缩增益门成立(22 items,19/22,p=0.00043),但【压缩什么】 比【用什么判据】更关键——观测量必须是用词决策序列而非自由陈述(7.2×) · 三个前置条件(原设计全漏):观测量要对 / 基座要有能力 / 基座要肯照做; 条件 2 与 3 对缩放的反应相反 ⟹「放大模型」不是通用解药 · 三态门 + 弃权正当性(被弃权项 AUC 0.551≈随机)+ rank 跨规模校准 同时把贡献声明按第六轮的优先权风险做最终收紧: 「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」 并把 arXiv:2607.08032 作为 concurrent position work 正面引用。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第七轮收窄到 8 篇后 Verify 阶段成功执行(103 agent,105 主张 → 25 验证 →
18 确认 7 否决;5 个 agent 因 API 断连出错)。
🔴🔴 立论支点的绝对表述被证伪(第二次被推翻):
arXiv:2606.03979 的 Dreaming 阶段有两道真实的写入前筛选——
(a) 梯度重要性 Top-k 拒采(ARC 上「每任务采 60 条 dream、拒 45 条」;
消融去掉后 SQuAD 48.9/46.2 → 47.1/45.2)
(b) 继承自 SEAL 的二值奖励 r={1 if improves, 0 otherwise}
但两者判据均为【可学习性/效用】而非正确性/事实核验;
且 τ 只在 ReST-EM 训练期塑形生成器,部署写入环节不施加过滤。
⟹ 声明第三次收紧为「尚无方法【实现并实证】以压缩增益/MDL 为判据、
GT-free 且无外部 oracle 的写入准入门控」。
🔴 改正我方两处实质错误(均在 2605.26099):
1. 作用域:N 次 pass 作用于当前窗口 chunk(L=24 tokens),
不是「整个累积上下文」
2. 定性(更严重):其 fast weights 是 SSM 定长递归状态 S、每序列零初始化,
不是跨会话持久的模型参数(permanent=0/cross-session=0/continual=0)
⟹ 我方原先称其「把睡眠期落到权重上」是错的,已撤回;
不可与真正写权重的 P 族并列为持久化证据
✅ 新确认(3 票):
· Sleep-time Compute 不写权重(LaTeX 级 weight/gradient/LoRA/SGD 全 0;
模型全为闭源 API 结构上无法写权重;repo 无 torch/peft),数字 5×/+13%/+18% 属实;
唯一写入规则是新近性+似然,参考实现为无条件覆写
· LMs Need Sleep 两阶段与摘要关键句逐字属实;第一阶段确无准入判据
(forget*=13 全是 catastrophic forgetting、零个 forget gate;
surpris*=1 仅 "Surprisingly" → 不存在 Titans 式 surprise 度量)
⚠️ 两条措辞纪律:
· 不得由「论文不假设 oracle verifier」推出「因此不可能有正确性门控」
(该强推论被三次独立否决 0-3×3)
· Sleep-time Compute 的仓库层提示词含 "remove calculations that are not useful"
与 "checked that there are no errors" —— 可被审稿人当反例,避免绝对句
🔴 最高优先未决线索:GATES (stein2026) 的 consensus-gating 按多条 tutor trace
一致性门控学习 —— 一致性是无需 GT 的正确性代理,直接落在我方主张位置上,
若属实需再次收紧。SEAL 同样待查。
❗ 覆盖缺口:J 族 3 篇 + P 族 2 篇本轮无一条主张通过验证,仍仅摘要级,
相关事实明确标注为「不得写入论文」。
核查 SOP 已沉淀:子串误报清单(LoRA⊂exploration、gating⊂backpropagating 等)、
词边界+substring 双跑、arXiv HTML 曾返回错篇故须用正文水印校验身份。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 自我推翻清单 10 → 12(新增:支点绝对表述被证伪、Do LMs Need Sleep 的 fast weights 非持久参数) · 贡献声明的三次收紧过程做成表格,给出当前唯一可辩护的措辞 · 新增 GATES/SEAL 最高优先未决线索 · 未解决表补充 J/P 族剩余 5 篇仍仅摘要级(明确标注哪些事实不得写入论文) · 方法学自评补充第七轮沉淀的核查 SOP(子串误报清单、双跑校验、 arXiv HTML 返回错篇、不得过度外推 oracle 免责句) Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第七轮 3 票验证结果(PR 已更新)前两轮的 Verify 阶段都卡住没跑完,这轮把范围收窄到 8 篇后成功执行(103 agent,105 主张 → 25 验证 → 18 确认 7 否决)。 🔴 立论支点的绝对表述被证伪arXiv:2606.03979(Language Models Need Sleep)的 Dreaming 阶段有两道真实的写入前筛选:
但两者判据都是【可学习性/效用】,不是正确性/事实核验。 贡献声明因此第三次收紧:
🔴 同时改正了我方两处实质错误(都在 2605.26099)
✅ 新确认(3 票 + 全文穷举)Sleep-time Compute 不写权重:LaTeX 源码级 🔴 下一轮最高优先:GATES2606.03979 点名 GATES 用 consensus-gating「按多条 tutor trace 的一致性门控学习」——一致性是无需 GT 的正确性代理,直接落在我方主张的位置上。若属实需再次收紧。 ❗ 覆盖缺口(已在报告中明确标注)J 族 3 篇 + P 族 2 篇无一条主张通过验证,仍仅摘要级。相关事实(Snell 的"不需 GT"、SPIDER +9%、OPCD 机制、Memory Grafting 数字等)明确标注为不得写入论文。 自我推翻清单从 10 条增至 12 条;另沉淀了一套核查 SOP(子串误报清单如 |
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
窄范围 5 篇,Verify 成功执行(100 agent,90 主张 → 25 验证 → 21 确认 4 否决)。
我方预判「GATES 有相当概率构成反例」应验。
★ GATES = arXiv:2602.20574v1 (Stein/Huang/Goldstein, UMD, 2026-02-24)
三源互证(PDF 水印 + LaTeX e-print + HTML),确认为 GT-free 二值写入准入门:
· 判据 = k=8 条 tutor rollout 答案一致度 ≥4/8;未过门者
"contributes zero loss across all objectives"(整体丢弃)
· 数学确证是硬性准入而非降权:g_i·e_{i,j} 同时在 Eq.1 分子与归一化分母中
→ 被门掉的项从分母消失
· 作者自陈 "agreement… as a proxy for correctness"、
"no external teacher or reward model is involved"
· 亲自划界 "it decides when to distill, not what to answer"
· 消融:去掉共识门 → student 54.0% / benchmark 31.1%
🔴 且非首创:LMSI (2210.11610, 2022) 早已用多数投票筛选自训练数据,
明言 "we do not use any ground truth labels to filter";
GATES 自认 consensus filtering 是 "well-established"。
⟹ 「GT-free 正确性代理 + 准入门控」这一轴彻底失守,不得再主张新颖性。
✅ 但我方在另外两轴存活,新颖性重量全部转移过去:
(i) 判据类型:全族 MDL/description length/compression 词边界命中 = 0
(compression 唯一命中在参考文献;bits 是 exhibits 子串)
(ii) 门控环节:GATES 门作用于训练期数据/梯度准入、固定预生成题集;
我方作用于推理期按对话者隔离的持久写入
❌ SEAL 不构成反例:奖励需每 context 配带 gold label 的 τ,论文 Limitations
自述 "prevents RL training of SEAL from scaling to unlabeled corpora";
且筛选在生成器 RL 训练期,部署写入期无条件聚合应用、完全无门。
✅ Snell 2209.15189 确认为「无门」最近邻:LaTeX 源码级确认目标函数是纯嵌套
期望,无指示函数/阈值/门控项;穷举扫描全零。
⚠️ 但其机制细节描述被 0-3 否决、"SPIDER +9%" 未获核实 → 均不得引用。
★ 一条对我方有利的反向证据:arXiv:2607.08065 大规模审计
(53 runners × K=50 × 265,000 samples)显示一致性只是弱预测子
(Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错,
"Self-consistency is not accuracy… unreliable as a standalone confidence score"
→ 可论证一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。
三条硬性禁令已写入文档:
1. 不得再写「尚无 GT-free 的写入准入门控」
2. 不得保留「无外部 oracle」作为独立卖点(攻防上得不偿失)
3. 用「写入」必须带 scope 注解(推理期/持久/按条)
最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4。
自我推翻清单 12 → 13 条。
剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275)
两轮均未通过验证,若任一含 GT-free 写入侧筛选,声明仍可能被推翻。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
1. §3.1「无 GT 的概念级正确性一列为空」已被第八轮 GATES 推翻 → 就地标注 并给出修正后的空白(判据类型=压缩/MDL + 门控环节=推理期持久写入) 2. 自我推翻表第 12/13 条顺序修正 3. 周期更新至 2026-08-01 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第八轮:GATES 确认为反例 —— 贡献声明第四次收紧(定稿)上一条评论里我预判「GATES 有相当概率构成反例」。应验了。 🔴 GATES 是一个 GT-free 的二值写入准入门arXiv:2602.20574v1(Stein / Huang / Goldstein, UMD)—— PDF 水印 + LaTeX e-print + HTML 三源互证:
且非首创:LMSI(arXiv:2210.11610, 2022)早已用多数投票筛选自训练数据,明言 "we do not use any ground truth labels to filter"。GATES 自己承认 consensus filtering 是 "well-established"。 ✅ 但我方在另外两轴存活 —— 这反而让 delta 更精确
❌ SEAL 不构成反例奖励需每个 context 配带 gold label 的 τ;论文 Limitations 自述这 "prevents RL training of SEAL from scaling to unlabeled corpora"。且筛选在生成器 RL 训练期,部署写入期无条件聚合、完全无门。 ★ 一条对我方有利的反向证据arXiv:2607.08065 的大规模审计(53 runners × K=50 × 265,000 samples):一致性只是弱预测子(Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错 —— "Self-consistency is not accuracy… unreliable as a standalone confidence score." ⟹ 可论证:一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。 🚫 三条硬性禁令(已写入文档)
最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4。 自我推翻清单 12 → 13 条。剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275) 连续两轮未通过验证——若任一含 GT-free 的写入侧筛选,声明仍可能被推翻。 |
2412.14964 (Prompt Distillation) 与 2602.12275 (OPCD) 连续两轮(七、八)无一条 主张通过验证,是唯一未闭合的风险面。本轮取得两篇全文(水印校验 v2/v2), 11 条主张 × 3 独立对抗验证者 = 33 票,全部 3-0 确认: ★ 决定性结论:两篇均无 GT-free 的写入侧准入筛选 - 2412.14964:完全无筛(30+ 关键词词边界+substring 双跑穷举零命中; gate/gating 9 个 raw 命中全为 mitigate/investigate 子串误报)。噪声答案 不过滤,靠高温软标签蒸馏吸收。附录 K 的五分位分组是诊断性消融,非管线筛选 - OPCD:唯一筛选「filtered EKD」在 1000 道带 GT 的 math validation / 环境 得分上打分取最高 → 判据=任务表现,需要标签/oracle,非 GT-free;其明确 GT-free 的 test-time 设定随机选取,自述 "quality … not pre-evaluated" ⟹ 第八轮定稿贡献声明维持原文;OPCD 反而构成空白存在性的直接文献锚点 同轮确认(解禁,可按收紧措辞写入论文): - 2412.14964:teacher=同一模型带文档 prompt、LoRA 翻转切换角色、训练无 GT、 无更强 teacher(更大 expert 反因风格失配变差) - OPCD:reverse KL + on-policy 机制、两应用(experiential/system prompt) 新增 2 处我方转述收紧(REPORT §4 #14/#15,总数 13→15): - 「PD 多规模超过 RAG」→ 纯闭卷仅 Squadshifts/Llama-8B 追平;「超过」依赖 PD+RAG 组合或 PD XL;HotpotQA 上 RAG 对纯闭卷 PD 全面占优 - 「OPCD 更好保留 OOD」→ 边际(+0.1~+0.5,std 内;对 base 持平或微降), 且 checkpoint 按 test accuracy 挑选,数字受通胀 文档同步: - REPORT.md:8→9 轮、§2 加第 9 行、§4 加第九轮小节+2 收紧、§5 风险表 两行合并为一行(仍禁写:Snell/DyPRAG/Memory Grafting)、§6 推进到 改写 Intro/Related Work → P1/P2、SOP 误报清单补 gate⊂Bagatella - RESEARCH_KNOWLEDGE_INTERNALIZATION.md:J 族两行 🔍→✅(带收紧措辞)、 准入门控行改为核实后表述、§8 勾掉 GATES 与两篇核查项、附录 J 更新 - r9/verification.json:33 票原始裁决+逐条证据引文+PDF md5,供审计 Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
第九轮定向验证 — 最后风险口闭合 ✅(commit 3d417c8)只查两篇(连续两轮未通过对抗验证的最大风险面):2412.14964(Prompt Distillation)与 2602.12275(OPCD)。全文级(PDF,水印校验 ★ 决定性问题:有无 GT-free 的写入侧准入筛选?——都没有
⟹ 第八轮定稿贡献声明维持原文,免于第五次收紧。 OPCD 反而构成反向支持——它把 GT-free 部署场景明确留在「质量不预评」状态,可在 Related Work 中直接引作空白存在性的文献锚点。 同轮确认(两篇解禁,可按收紧措辞写入论文)
新增 2 处我方转述收紧(§4 #14/#15,自我推翻总数 13 → 15)
状态与下一步
🤖 Generated with Claude Code |
一、第十轮验证(5 篇全文 / 17 主张 / 51 票):仅摘要级清零 - Generative Adapter 2411.05877v1:单次前向机制+无门+数字全确认; 但「天然按用户隔离」被收紧(1C/2CORR)——论文无 isolation 一词、无跨用户 测试,跨会话复用也是架构性而非纵向演示 → REPORT §4 #16。 反而保住我方 P4 空间:「按对话者隔离并实测无泄漏」仍无人做 - When Context Returns 2606.11627v1:内化不幂等升级为 ✅(7/12 设定退化; 修复 NCA 11/12;scope=仅系统提示/游戏脚手架,未测文档) - Snell 2209.15189v1:七轮 0-3 悬案解决——机制精化(token 级 KL 到冻结 自身副本,非硬标签微调)+「SPIDER +9%」精确化(8-shot 比 GD 基线 +9.0 点, 非对 teacher) - DyPRAG 2503.23895v4:我方「多文档 LoRA 平均互相干扰」系误读,如实改正 (REPORT §4 #17)——论文称平均有效整合,衰退归因无关冗余+有损压缩 - Memory Grafting 2605.20948v1:定性修正为预训练容量扩展方法;写入侧仅 频率覆盖筛选(质量盲),非正确性门 - 自我推翻总数 15→17;无一篇含正确性写入门 → 空白声明再获确认 二、Introduction / Related Work 投稿草案 v1(paper/DRAFT_INTRO_RELATED_WORK.md) - 按第八轮定稿措辞:GATES/LMSI 正面让位、OPCD "not pre-evaluated" 作 空白锚点、E1/E2 划界、三条禁令全稿自查表 + 措辞红线速查 - RESEARCH doc §9.3.1 旧 C1 与 §9.3.2 旧段就地标注已被推翻/替代 三、两个内化风险写进实验设计 - DESIGN_COMPRESSION_GATE §3 新增失败模式 #11(内化不幂等,✅)与 #12(迭代坍缩,🔍 2606.04703 引用前须 3 票) - DESIGN_CONCEPT_BENCH §7 新增指标 8(重现幂等性)与 9(迭代巩固坍缩曲线, gate-on vs gate-off——若推迟坍缩即门价值第二论据) 四、P1 构造语言生成器脚手架(research/learning-in-referencing/p1/) - lexicon(CV(C) 音系+阻断表+编辑距离;分词器/探针钩子留待模型环境) - microworld(13 kind × 4 色 × 3 尺寸 × 4 材料,4 范畴群) - gavagai G1-G5 程序化构造:教学集外延一致由构造保证,不变量测试全过 (T1 外延一致/T2 分离样例/T3 过滤/T4 确定性/T5 留出未见/T6 overspec) - 已生成 items_p1.json(40 items)+ isolation_p1.json(8 冲突词隔离对) Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
P6 — I2 组合性:我方自设的限制被自己的实验推翻(自我推翻 #21)五判据里最后一条未验证的(I2 组合性)已测。前面所有探针都来自同源微世界——那测的是泛化,不是组合。 跨域探针要求两步组合:①
🔴 这推翻的是我方自己声明的限制P5 §4 写过「final-layer memory 缺深度组合性」,并据此在 Method 草稿 §6(i) 写入 "we do not verify criterion I2"。 ⟹ 新增纪律:自己声明的「限制」也必须做实验。未测的限制和未测的优点一样不可信。
|
| 判据 | 状态 |
|---|---|
| I1 免检索 | ✅ P5(0.485 → 0.992) |
| I2 组合性 | ◐ 部分成立 — 与世界知识 ✅;概念间未测 |
| I3 隐式触发 | 🔴 未测 |
| I4 跨会话持久 | ✅ P4/P5 |
| I5 抗干扰 | 🔴 未测 |
| (隔离) | ✅ P3/P4/P5 |
同步范围
REPORT §3.9 + 自我推翻表(20 → 21 处)+ §0.2/0.4/0.5/§5/§6/§7;Method 草稿 §5.6/§6(i)/禁令 10;全景文档 L0–L5 表的 I2 列首次回填实证;p5/README.md §1 与 memory_layer.py 的残留(由一致性审计器抓到);审计器新增 #21 两条规则并重跑 → 0 处残留。
换 torch/transformers 环境后重跑 P6 时发现的。逐用户跨域 AUC 16/16 完全复现
(0.949、0.840、0.992、1.000 逐位相同,torch 2.13 + transformers 5.14),
但前置检查那一行:
脚本实际打印 → red 3/4 · blue 3/4 · yellow 3/4 · green 2/4
平均 0.69 —— ⚠️ 世界知识不足,跨域结论受限
我写进文档的 → 平均命中 1.00 ✅
数字错,判据也错。判据错在**重犯了 P3 的 No 偏置坑**:模型对 Yes/No 题有系统性
No 偏置,16 个【正确】颜色配对里有 5 个 p_yes < 0.5,尽管与负例分得很开(负例低至
0.001)。改用本项目已确立的阈值无关 AUC → 0.891(red .958/yellow .917/green .854/
blue .833)。⟹ **P6 结论不变**,世界知识确实可用。
修正范围:p6 脚本改用 AUC 判据并保留 raw 命中率作为偏置证据;p6/README、REPORT §3.9、
Method 草稿 §5.6 的数字与判据;REPORT §0.4 加一行"差点犯的错"。
★ 结构性防复发:新增 tools/probe_metrics.py。P3 那次的教训写进了报告**但没有变成代码**,
于是第二次照犯。auc() 是判据,hit_rate() 只作偏置证据且注释里写明不得当判据。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
I2 的最后一格补上了。同一用户学两个概念(颜色+材质,各自独立教学), 探针问从未教过的合取句式 `Is X both w1 and w2?`: base 0.479 → L4 合并训练 0.889 → L1 上下文 0.986 (单概念策略上界 0.500) 前置检查:基座对真词的同句式合取 AUC 0.973;L1 min 0.986 ⟹ 任务本身可解 🔴 自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750 (负例"只中 w1"那半与正例在 w1 上同分布贡献 0.5,"只中 w2"那半被 w1 拒掉贡献 1.0)。 修法:判据拆成 conj|¬w2 与 conj|¬w1 两半取 min——单概念策略在此必 ≈ 0.5。 裁决线设错会把单概念策略误判成组合。⚠️ 自我推翻 #23:P5 的「分区解决了干扰」只对【跨用户】成立。 同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。 ★ 修法来自诊断而非猜测(子区版失败后先查): · w1 的槽 values 最大改动量 0.00e+00 → 梯度掩码有效,槽分毫未动 · w1 探针 25% 的 top-4 落进 w2 子区 → **检索跨了区** ⟹ 分区必须同时作用于写入与检索。P5 之所以成功,正因为那里检索本来就按 uid 掩了。 双掩码后 Δ +0.000,且每概念只有 16 槽(< seq 的 32)⟹ 容量解释被排除。 🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条: 只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。⚠️ 代价 —— 全景文档新增第二条张力:**可隔离性 ↑ ⟹ 组合性 ↓** 严格按概念分区保住了单概念(0.927, Δ 0.000)却把合取压到 0.653(合并训练 0.889)。 ⟹「顺序到达 + 强组合」目前无解,已写进 §6(i) limitations。 顺带修两个工具缺陷: · memory_layer 加可选子区掩码(P5 结果 JSON 逐字节相同,向后兼容已验证) · 审计器在子目录下会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根 + <10 份即拒绝结论 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
更正 + P7🔴 先更正上一条评论里的一个数字上一条我写「世界知识前置检查命中 1.00 ✅」。错的。 换 torch/transformers 环境重跑时发现,脚本实际打印的是: 我把脚本的警告当成了通过。 而且判据也错——重犯了 P3 的 No 偏置坑(16 个正确颜色配对里 5 个 p_yes < 0.5,尽管负例低至 0.001)。改用阈值无关 AUC:0.891。P6 结论不变,世界知识确实可用。 P6 本身在新环境下逐用户 16/16 完全复现(0.949 / 0.840 / 0.992 逐位相同)。
P7 — 「概念 ⊗ 概念」(I2 的最后一格)同一用户学两个概念(颜色 + 材质,各自独立教学),探针问从未教过的合取句式
自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750。判据必须拆成 🔴 自我推翻 #23:P5 的「分区解决了干扰」只对跨用户成立同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。 修法来自诊断而非猜测——子区版失败后(Δ −0.351,几乎等于不分区)先查:
🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条:只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。
|
| 判据 | 状态 |
|---|---|
| I1 免检索 | ✅ P5 |
| I2 组合性 | ✅ 两种形态(P6 ⊗世界知识、P7 ⊗概念);否定/量化/多跳/同属性内两概念未测 |
| I3 隐式触发 | 🔴 未测 |
| I4 跨会话持久 | ✅ P4/P5 |
| I5 抗干扰 | 🔴 未测 |
| 隔离 | ✅ 跨用户;◐ 用户内部需子区+双掩码,代价是组合性 |
顺带修了审计器一个缺陷:在子目录下跑会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根,<10 份即拒绝给结论。
五判据最后两格。I5 ✅,I3 ❌,而后者的机制把前面所有结论统一了起来。
【I5 抗干扰 ✅】上下文塞进另一位老师的含义("in some dialects, w means …"):
base 0.545 → 0.033 ← 关键对照:base 没有概念,照单全收,答案系统性反向
L1 0.988 → 0.912 (−0.075)
L4 0.960 → 0.910 (−0.050) ⟹ 参数化比上下文注入更抗干扰
base 那一行证明了干扰确实有效——L4 扛住不是因为模型没读它。
【I3 隐式触发 ❌】不问定义、要求去用(二选一行动题,训练中没有的句式):
base 0.500 · L1 1.000 · 真词先验 1.000 · ★ L4 0.507 ⟹ 零迁移
🔴 判据在这里又错了一次:初版只报 accuracy(0.492),而伪词条件下模型 91% 选 A,
阈值法被偏置钉死在 0.5。这是 P3(No 偏置) → P6(前置检查) → P8(A 偏置) 同一类
仪器错误的第三次,且专为此抽出的 probe_metrics.auc 当时已 import、只用在了 I5 上。
⟹ 抽出工具还不够,判据必须在每个新度量上被显式选择一次。改 AUC 后结论不变,
但那是运气不是方法。
★ 机制(先诊断,不猜)—— 否掉了"检索没取到":
行动题 top-4 落在训练用过的槽的比例 : 0.750 ← 取到了
cos(m(h), W_yes−W_no) : +0.7926
cos(m(h), W_A−W_B) : +0.0027 ← 近乎零
两读出方向本身余弦 : −0.0265
‖m(h_act)‖ = 14.279 ← 不是太小,是方向不对
⟹ 记忆学的是"这个决策格式下往哪边推",不是概念。
★ P8b 回应显然的反驳「多训几种格式不就行了」——可证伪,测了:
训 F1 : F1 0.960 · F2 0.555 · F3 0.755(held-out)
训 F1+F2 : F1 0.902 · F2 0.795 · F3 0.645(held-out)
加训 F2 使 F2 +0.240,却让 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。
更有力的是同序关系:只训 F1 时迁移量随读出方向余弦单调
余弦 1.000 → 0.960 · +0.1065 → 0.755 · −0.0265 → 0.555 ≈ base
⚠️ 只有三个点,同序而已,不得写成拟合出来的定律。
🔑 这条回溯限定了 P5–P7:它们的训练与探针全在同一个读出方向内。
P6 变的是表层内容、P7 变的是表层句式,读出方向都没变;P8 变的正是读出方向。
⟹ 精确主张只有一条:**概念能跨表层句式迁移,不能跨读出方向迁移**。
「泛化 ✅ / 组合 ✅ / 隐式触发 ❌」是同一条机制的三个侧面。
论文中每条结论都须带作用域「在教学所用的决策格式内」。
✅ 副产品:第一次给「中间层记忆」提供了实证动机(而非审美偏好)——
P5 曾错误声明的"缺深度组合性"已被 P6 撤回,现在有了正确版本且是测出来的。
⚠️ 但中间层版本未做,不得声称它能解决。
诊断脚本入库(p8/diag_i3_mechanism.py、p7/diag_subpart_failure.py);
审计器加 #24 两条规则;Method 草稿 §5.8 + §6(i) 重写 + 禁令 13–15;
全景文档 L0–L5 表的 L4 行 I3=✓ 加硬前提。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P8 — 五判据最后两格:I5 ✅ / I3 ❌,且 I3 的机制把前面所有结论统一了I5 抗干扰 ✅上下文里塞进另一位老师的含义(
关键对照在 base 那一行:base 没有概念,那条注释是它唯一的定义来源,于是照单全收、答案系统性反向(0.033)。⟹ 干扰被证明有效,L4 扛住不是因为模型没读它。参数化比上下文注入更抗干扰。 🔴 I3 隐式触发 ❌ —— 干净的负结果不问定义,要求去用(二选一行动题,训练中从未出现的句式):
零迁移。 任务完全可解,参数化记忆没有任何效果。
★ 机制:不是检索失败,是读出方向
记忆学的是「这个决策格式下该往哪边推」,不是概念。 P8b — 回应「那多训几种格式不就行了」
加训 F2:F2 +0.240,但 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。 比裁决更有力的是同序关系——只训 F1 时,迁移量随读出方向余弦单调:
🔑 这条回溯限定了 P5–P7
✅ 副产品:中间层记忆第一次有了实证动机P5 曾错误声明 final-layer memory「缺深度组合性」(已被 P6 推翻撤回)。现在有了正确版本,而且是测出来的:它只在输出层动手,学到的东西天然绑死在训练任务的读出方向上。 五判据最终状态
📌 |
fig1 判据类型 × M′ 宽度分层 —— 压缩增益 0.915/0.883/0.766 vs 语义熵 0.269/0.137/0.507 fig2 五判据 × 参数化 vs 上下文注入 —— I3 那一格灰底标 fails fig3 (a) 迁移量 vs 读出方向余弦 (b) 记忆插入位置(P9 跑完后自动补全) 🔴 出图时抓到一处会与正文打架的错:我先用了**配对胜率**,得核心域 0.958 / 0.208, 而正文引用的是**汇总 AUC** 0.915 / 0.269 —— 两个不同的统计量。 已改为与 p2_three_arm.py 的 report() 同一估计量,并加了闸门: 图上的核心域数值若与 p2 自己产出的 summary 差 >1e-6 即 sys.exit 拒绝出图。 分层口径与 p2/README §3.2 严格一致(M′ 更窄 = G1 合取 + G2 范畴层级)。 灰度可读,不靠颜色区分;单栏 3.3in / 8pt。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
⚠️ 本 commit 只落原始结果与脚本;**解释待 P9b 词绑定控制**(正在跑,见下)。 只训 F1 Yes/No,F2 A/B 与 F3 True/False 始终 held-out: 插入位置 F1(训练) F2 F3 跨方向均值 base 0.540 0.550 0.510 0.530 L1 定义进上下文 0.960 1.000 1.000 1.000 ★ L7 全位置 0.945 0.935 0.945 0.940 ◇ L7@last 0.820 0.565 0.600 0.583 post-norm(=P5–P8) 0.970 0.555 0.770 0.663 ✅ P8 的推论成立:中间层比 post-norm 高 +0.277,几乎追平上下文注入。 🔴 但控制条件否掉了「深度」这个解释:L7@last(同样在 L7、其上同样有 20 层去变换它, 只是**仅改最后一个位置**)只有 0.583,**比 post-norm 还低 0.080**。 ⟹ 增益来自**位置覆盖**——记忆必须改写**描述物体的那些 token** 的表征, 而不是在决策点上加偏置。没有这个控制,这条结论会被一句话打掉。 🔴 而这恰好打开一个新漏洞:既然它改写物体表征,它可能只学会了「给蓝色物体打标」、 根本没绑定到那个词。三种格式全过也解释得通。⟹ P9b 换词控制已启动, 在它出结果之前**不写任何「学到了一个概念」的结论**。 工程: · 正确性闸门 —— 批处理左填充必须显式传 position_ids,否则 rotary 整体移位; 实测与逐条前向最大 logit 偏差 8.77e-05、argmax 5/5,不过闸门即 sys.exit。 · 每条件即时落盘 + --preload 合并(上一轮中断白跑 99 分钟的教训), 合并时核验重算的 base/L1 与 preload 逐位相同(差 ≥1e-6 即拒绝)。 · 未测:L14/L21 深度曲线(单条件 ~99 分钟,本轮裁掉)。 fig3(b) 补全插入位置对比。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9 说"概念能跨读出方向迁移"。那个结论有个明显漏洞我自己去堵,结果堵塌了。
控制:训练完全不变,**只把提示里的伪词换成另一位用户的伪词**,其余一字不改。
插入位置 提示里的词 F1 F2 F3
L7 本词 0.945 0.935 0.935
★ 换成别人的词 0.930 0.895 0.935 落差均值 0.018
post-norm 本词 0.970 0.555 0.770
★ 换成别人的词 0.975 0.505 0.765 落差均值 0.017
⟹ **两个方案都不是"学会了一个词的含义",而是"给一类物体打了标"。**
L7 的跨格式迁移之所以成立,正因为被打标的是**物体表征**——任何读出格式都能读到它。
这与 P9 查到的"增益来自位置覆盖"完全自洽,但把结论的性质整个改变了。
🔴 波及范围:所有**每个用户只教一个概念**的实验(P5 I1、P6 I2⊗世界知识、P8 I5、P9)。
在那些设置里,「w 指蓝色」与「给蓝色物体打标」**在训练集上外延完全相同**——
梯度没有任何理由去关心那个词。**是实验设置欠定,不一定是方法的性质。**
★ 唯一可能的例外是 P7(每人两个词,同一物体在两词下标签不同,光打标不可能同时高分)。
P9c 正在直接验这一点(三档换词:本词 / 换成同用户的另一个词 / 换成别人的词)。
**在 P9c 出结果之前,不得写任何"学到了一个概念"的结论。**
工程:本轮把训练好的记忆存盘(P9 没存,导致这个控制不得不整个重训);权重不入库。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9b 之后剩一个可能的辩解:单概念设置**欠定**(一个词时"w 指蓝色"与"给蓝色物体
打标"在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——
直接测,全部针对 w1 的探针与 w1 的标签:
提示里用的词 F1 F2 F3
w1(本词) 0.785 0.505 0.695
★ 换成同用户的 w2 0.790 0.570 0.645
换成别人的词 0.790 0.515 0.675
own − within -0.005 -0.065 +0.050
(前置:w2 自己的探针 0.890 —— 两个词都"学会"了,不是没学会导致的)
⟹ 两概念也逼不出词绑定。
★ 机制诊断(diag_word_independence.py)—— 两个方案因**不同原因**失败:
L7 post-norm
m(h) 换词后余弦 0.99998 0.787
路由命中槽重合率 1.000 0.957
决策方向上的投影 — +1.690 → +1.047
★★【正例−负例】投影差 — +4.443 → +4.327(保留 97%)
L7 路由层面就看不见那个词。
post-norm 看得见词,但 AUC 只看排序,而判别分量保留 97% ⟹ 词只平移偏置。
🔴 我在这里差点得出相反结论:只看 m(h) 余弦 0.787 会判成"路由读到了词 ✅"。
是补了"决策方向上的正负例投影差"才发现变化分量与判别正交。
⟹「输出变了」不等于「行为变了」;度量必须对准被解释的那个量。
措辞处置:
· REPORT 顶部加最高优先级警告 + §3.12 + 自我推翻 #25
· p5/p6/p7/p8 四页 README 加降级横幅
· Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17
· 审计器加 #25 两条规则(中英各一),并把 🔴 补进 ALLOW
· 能站住的只有:「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」
· 不受影响:压缩增益门(P0–P4,概念以文本存在、词是显式的)、按对话者隔离(P3/P4)
修法方向(全部未做,不得声称已解决):键取在**词的 token 位置**而非整段末位;
让**两个词在同一物体上给出相反标签**(P9c 方向对但强度不够——两词问不同属性,
一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
🔴 P9 / P9b / P9c — 我把自己整条参数化记忆线推翻了先是好消息:P8 的推论成立把记忆从输出层移到中间层,跨读出方向迁移成立。而且控制条件查清了真正的原因:
然后这条结论自己打开了漏洞,我去堵,堵塌了既然它改写的是物体表征,就可能只学会了「给蓝色物体打标」、根本没绑定到那个词。控制:训练不变,只换提示里那个伪词。
还剩一个辩解:单概念设置欠定(一个词时「w 指蓝色」与「给蓝色物体打标」在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——直接测,也不行:
前置:w2 自己的探针 0.890,两个词都"学会"了 ⟹ 不是没学会导致的。 机制:两个方案因不同原因失败
处置必须撤回:参数化记忆线不得写"学会了一个词 / 建立了一个概念"。
已落地:REPORT 顶部最高优先级警告 + §3.12 + 自我推翻 #25;p5–p8 四页 README 加降级横幅;Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17;审计器加 #25 中英两条规则。 修法方向(全部未做,不得声称已解决):键取在词的 token 位置而非整段末位;让两个词在同一物体上给出相反标签(P9c 方向对但强度不够——两词问不同属性,一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。 |
设计把 P9c 的后门焊死:w1=颜色A、w2=颜色B,训练物体只取这两色 ⟹ 同一物体在两词下标签**严格相反** ⟹ 只看物体的策略在数学上恰好 0.500。 训练准确率本身就是判据。 结果(8 用户 / 900 epoch / post-norm):训练 acc **0.974** 提示里的词 F1 F2 F3 w1(本词) 0.770 0.535 0.595 ★ 换成 w2(含义相反) 0.350 0.515 0.450 换成别人的词 0.380 0.510 0.530 ✅ 绑定是真的:换成含义相反的词后 F1 掉到 0.350 —— 低于随机,是**答案跟着词翻转**, 不是失效。P9b/P9c 里落差只有 0.017/−0.005,完全看不到这个。 ⟹ #25 的**原因**改写为「我们没让它必须做到」,但**撤回本身不变**: P5–P9 跑的仍是欠定设置,测到的仍是与词无关的物体级偏置。⚠️ 差点犯的错:60 epoch 时训练 acc 0.542 ≈ 只看物体的上限,按判据就是"架构不能", 而且会直接推出一条不必要的架构修改建议。加了训练曲线检查点才发现不是: ep150 0.771 → ep300 0.891 → ep600 0.943 → ep900 1.000 **P5–P9 全部用的 300 步恰好落在还没收敛处。** 已把这条写成硬分支:末段仍在上升 >0.03 时输出 ⚪ 不可判,不允许下结论。 🔴 代价两条: · held-out 泛化 0.992(P5 不强制)→ 0.770。⚠️ 非严格控制(训练量翻倍、任务更难), 不得归因为"绑定必然损害泛化",只能说本设置下同时成立。 · 跨读出方向**消失**(F2 0.535 / F3 0.595 ≈ 随机)。与 P8 的机制一致—— P9 在 post-norm 上还有 F3 0.770,是因为没绑定时那个物体级标本身跨格式可读; 一旦逼它条件化于词,这条便车就没了。 ⟹ **在 post-norm 上「绑定」与「跨格式」互斥**。L7 能否兼得,L7 臂正在跑。 工程:每个**用户**跑完即落盘 + --merge 合并(P9 丢过 99 分钟、P10 又整条臂丢过,第三次才修)。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
L7 中间层在强制设置下**真的绑定到词了**,而且比 post-norm 干净得多:
臂 训练acc F1 F2 F3
base — 0.585 0.540 0.525
L1 定义进上下文 — 0.855 0.905 0.995
post-norm 本词 0.974 0.770 0.535 0.595
post-norm 换相反词 0.350 0.515 0.450
★ L7 本词 1.000 0.925 0.545 0.670
★ L7 换相反词 0.070 0.410 0.290
换词落差:L7 −0.855(0.925→0.070,不是失效,是答案跟着词整个翻过去)
post-norm −0.420 · P9b 未强制时仅 −0.018
🔴🔴 但跨读出方向随之消失:L7 的 F2 0.545 / F3 0.670,base 是 0.540 / 0.525;
而 P9 **未绑定**时是 0.935 / 0.945。
⟹ **P9 那个漂亮的跨格式迁移,正是"没绑定到词"换来的**——
未绑定时记忆给**物体表征**打了个与词无关的标,任何读出格式都能读到。
★ 四格全测下来,从来没有一格同时拿到两者:
绑定到词 跨读出方向
post-norm + 欠定(P5–P8) ❌ 0.017 ❌
L7 + 欠定(P9) ❌ 0.018 ✅ 0.940
post-norm + 强制(P10) ◐ −0.420 ❌ 0.565
L7 + 强制(P10) ✅ −0.855 ❌ 0.608
L1 上下文注入 ✅ 构造上必然 ✅ 0.905/0.995
⟹ 参数化路线最多只拿到其一;上下文注入两者都有。**该路线目前最强的负面证据。**
补的两处方法学漏洞:
· base/L1 参照臂(主脚本初版漏了)——逐用户 base 的 F1 从 0.240 到 0.880 都有,
个别用户像"F3=0.080"这种极端值大半来自基座,不可单独解读。新增 p10_ref_arms.py。
· 两臂优化量不对等:900 步是为 post-norm 定的(它 ep900 才收敛),
而 L7 在 ep150 就 loss 0.000 ⟹ 过训 6 倍,逐用户 held-out F1 方差极大(含一个 0.48)。
早停版未测,已写进限制。
同步:REPORT 顶部警告 + §3.13 + 自我推翻 #26 + §0.4 两条新的"差点犯的错";
Method 草稿 SCOPE 补充 + §6(0-b) + 禁令 18/19。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P10 强制词绑定 —— 能绑定了,但跨格式随之消失(自我推翻 #26)P9b/P9c 的失败可能是设置欠定(一个词时「w 指蓝色」与「给蓝色物体打标」外延完全相同,那个词是常量、零信息)。P10 把后门焊死:w1 = 颜色 A、w2 = 颜色 B,训练物体只取这两色 ⟹ 同一物体在两词下标签严格相反 ⟹ 只看物体的策略在数学上恰好 0.500,训练准确率本身就是判据。
✅ 绑定是真的L7 落差 −0.855(0.925 → 0.070)——不是"失效"(那会是 0.5),是答案跟着词整个翻过去。对照 P9b 未强制时只有 −0.018。 ⟹ #25 的原因改写:不是"架构做不到词绑定",而是"我们没让它必须做到"。 🔴🔴 但跨读出方向随之消失L7 的 F2 0.545 / F3 0.670,而 base 是 0.540 / 0.525;P9 未绑定时是 0.935 / 0.945。
★ 四格全测下来:从来没有一格同时拿到两者
参数化路线在测过的每一种配置里最多只拿到其一;上下文注入两者都有。 这是目前对该路线最强的一条负面证据,已写进 §6(0-b)。
|
两份草稿里的裸 arXiv 号与命名占位符全部换成 \cite{}(31 处),
交叉核验:正文引用的 24 个 key **全部**在 bib 中,无悬空引用。
★ 会场填写纪律(写在文件抬头)——这条是自我推翻 #9 换来的:
当初把 LMLM 写成「NeurIPS 2025 主会」,实为 CCFM workshop Oral。
⟹ booktitle/journal 只在两种证据之一存在时才填:
(a) arXiv 元数据的 comment/journal-ref 自陈;(b) 我方 r9/r10/r11 全文核查记录。
其余一律 @misc + eprint。我方文档声称过、但两条证据都没有的,
标 % VENUE-UNVERIFIED 并保留 @misc(目前 2 条:Delétang ICLR'24、SEMA CVPR'25)。
其它纪律写进各条目的 note 字段,让引用时无法绕过:
· chen2024generativeadapter — 不得写"天然按用户隔离"(#16,全文无 isolation 一词)
· kujanpaa2024injection — 不得写"多规模超过 RAG"(#14,HotpotQA 上 RAG 全面占优)
· ye2026opcd — 不得写"更好保留 OOD"(#15,是退化更少;checkpoint 按 test acc 挑)
· tan2025dyprag — 不得写"平均互相干扰"(#17,说反了)
· chen2026continual — teacher 是自教师不是外部强模型;坍缩归因不得改写(#18/#19)
· huang2024sharpening — DPI 论点须归 cover1999elements,不得写成该文定理(#10)
· stein2026gates + huang2022selfimprove — 禁止写"尚无 GT-free 写入准入门控"(#13)
· li2025selfsizing — 🚨 必须钉 v3,v1/v2 是另一篇
· colaco2026ratedistortion — 🔴🔴 最高优先权风险,同构提案;投稿前必须重扫
元数据来源:arXiv Atom API(2026-08-04);Farquhar 一条走 Crossref DOI 取全字段。
未入库的 6 个背景引用(LOCI/DEN/CN-DPM/DER++/GSS/MIR/iCaRL)已在正文标 %TODO-BIB,
不静默留着——它们只出现在族 5/6 概览句里,不承载我方主张。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按 §6 待办做的 ⏰ 重扫,一个月的时间差就抓到一篇直接命中的。
★ ConsistencyGate(arXiv:2607.22962,2026-07-25,晚于第十一轮)
「a write-time admission gate that, before committing a candidate fact m extracted
from context c, queries the LLM K times for a soft support score and admits m only
when the average exceeds a threshold」——**GT-free**、**推理期**、**按条**、**持久**、
外部记忆写入。⟹ 与我方门控环节**完全重合**。
原声明把新颖性放在两轴:判据类型(压缩/MDL)× 门控环节(推理期按条持久写入,
理由是"已有 GT-free 门均作用于训练期")。**后半句已被证伪,第二条腿倒了。**
⟹ 定稿措辞(第五次收紧):
「尚无方法以**压缩增益/MDL 为判据**做写入准入门控——已有 GT-free 准入门
(GATES、LMSI、ConsistencyGate)用自洽度,SAGE/SEMA 用新颖度,
Write-Time Gating/TRUSTMEM 用来源可信度,**没有一个用描述长度**。」
★ 但它同时是**最好的动机引用**,而且比"无人做过"更强:
它的信号正是我方 P2 实测在 gavagai 对上失效的那一类——语义熵 AUC 0.269,
且 **M′ 更窄时 0.137(系统性反向)**,而 M′ ⊂ M 正是最常见的 gavagai 形态。
⟹ 贡献 C1 改写为「我们不是断言这个区别重要,而是证明了它重要」。
⚠️ 禁令 4:引用它时**必须**同时给出失效实证,否则读者会以为问题已被解决。
同轮另核 MemRefine(2606.13177,2026-06-11):**事后压缩**(对已入库条目做
delete/merge/preserve)、信号是 LLM 判官的事实性判断、**无 MDL 判据** ⟹ 不构成威胁。
2607.08032(rate-distortion,唯一同构提案)**仍未被实现** ⟹ 判据类型那一轴目前仍空。
落地:
· REPORT §0.1 第五次收紧 + 收紧沿革表第 12 行 + 自我推翻 #27(共 27 处)
· Intro 抬头禁令 3 条 → 4 条;¶4 整段改写;贡献 C1 从「criterion × locus 两轴」改为一轴
· 研究文档 §7.6 的两轴表述加删除线 + 作废说明
· refs.bib +2 条(zhang2026consistencygate / kim2026memrefine),27 条
· 审计器加 #27 两条规则 —— 加完立刻抓到 6 处残留(含研究文档 743 的两轴原句),已全部处理
⏰ 投稿当月须再扫一次:该方向 1 个月内就冒出一篇直接命中的。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
转入投稿打磨:bib + 🔴 第十二轮重扫(贡献声明第五次收紧)参数化路线四格已封闭,不再加实验。转去打磨压缩门那条线。 1.
|
三项待办全部处理,并在过程中抓到第十二轮的第二篇。 【1】refs.bib 25 → 37 条 · 补齐正文全部背景引用:GDumb / Chaudhry / GSS / MIR / iCaRL / DER++ / CN-DPM / DEN 会场一律只在 arXiv comment 或 journal-ref 自陈时才填 —— 实际拿到 5 个: CN-DPM ICLR 2020 · DER++ NeurIPS 2020 · MIR NeurIPS 2019 · GSS NeurIPS 2019 · iCaRL CVPR 2017; DEN 与 Chaudhry 无字段佐证 ⟹ 保留 @misc(不按"通行认知"填)。 · 两条 VENUE-UNVERIFIED 已清零: Delétang ICLR 2024(ICLR proceedings PDF 页眉自陈)· SEMA CVPR 2025(CVF Open Access, pp.10087-10098)。 · 🔴 LOCI 未通过复核:第四轮记为 TDCommons 11091,第十二轮无法再定位、作者标题未能核实 ⟹ **已从投稿正文删除**(只在族 6 概览句里,不承载主张),bib 条目标红待决。 · 交叉核验:正文 34 个 \cite 全部命中,无悬空引用;唯一未被引用的是刻意排除的 loci2026。 【2】§7.6.2 十类代理表定稿 —— **末列换轴** 原末列是「正确性 ✓/✗」,读法是"正确性那列空着由我方填"。**该框架第八轮起就不成立** (GATES/LMSI 用一致度作 GT-free 正确性代理),第十二轮 ConsistencyGate 再补一刀。 ⟹ 定稿末列改为「**判据是否为描述长度/压缩增益**」——唯一仍然空着的一轴。 新增 5 行证据(GATES / LMSI / ConsistencyGate / DeMem / MemRefine)+ 定稿读法三条; 第四轮读法整段标为沿革、不得引用。 【3】🔴 又抓到一篇:DeMem(arXiv:2605.10870,2026-05-11) 「Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory」 —— 标题几乎就是我方 P0 的核心发现,是**判据轴上离我方最近的一篇**。 按 r9-r11 协议读全文(水印核验 arXiv:2605.10870v1),词边界扫描: description length = 0 · MDL = 0 · admission = 0 · interlocutor = 0 · isolation = 0 rate-distortion = 4 · reward = 46 · oracle = 21 三条结构性差异(均有原文支撑): ① 需要观测到的奖励 —— contextual bandit,"the learner observes a reward R_t ∈ [0,1]",目标是 regret; ② 是预算下的分区/压缩(什么可以忘),不是准入(要不要写); ③ 压缩的是智能体自己的动作,我方压缩的是对话者的后续用词。 ⟹ 贡献声明再加两条限定(自我推翻 #28),否则被它击穿。 ✅ 但它**独立佐证了我方 P0 最硬的一条**(决策 vs 描述,7.2× margin)—— 我方那条不再只是自家实验结论,而是有独立理论工作支持的观测量选择。⚠️ 按禁令 2,"不需要奖励"只能写成作用域区分,不得当独立卖点。 同步:Intro ¶4 与划界段改写(新增 STaR/MemRefine/DeMem 三方划界);Method ¶1 加旁证; REPORT §0.1 定稿措辞 + 自我推翻 #28(共 28 处)+ §7 索引补 refs.bib 与 figures 两行。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
打磨项清空 —— 过程中又抓到一篇(自我推翻 #28)1.
|
| 词 | 命中 |
|---|---|
description length / MDL |
0 / 0 |
admission |
0 |
interlocutor / isolation |
0 / 0 |
rate-distortion |
4 |
reward / oracle |
46 / 21 |
三条结构性差异,均有原文支撑:
- 需要观测到的奖励 —— contextual bandit,
the learner observes a reward R_t ∈ [0,1],目标是对 full-information oracle 的 regret; - 是预算下的分区/压缩(什么可以忘),不是准入(要不要写);
- 压缩的是智能体自己的动作,我方压缩的是对话者的后续用词。
⟹ 贡献声明再加两条限定(#28),否则被它击穿:
尚无方法以压缩增益/MDL 为判据对新条目的准入做门控,且该压缩算在对话者后续的用词上。
✅ 但它其实是旁证,不是威胁
DeMem 独立论证了「该保住的是决策不是描述」——与我方 P0 最硬的那条同向(自由陈述 +0.68 nats/p=0.36 → 用词决策 +4.92 nats/p=0.0039,7.2×)。⟹ 我方那条不再只是自家实验结论,而是有独立理论工作支持的观测量选择。
当前状态:25 组实证 · 28 处自我推翻 · 贡献声明五次收紧 + 一次再限定 · bib 37 条无悬空引用 · 三张图带交叉核对闸门。
⏰ 唯一未决项:投稿当月再扫一次(两个月内已冒出两篇直接命中的),以及 LOCI 补全或永久删除。
从两份 markdown 草稿组装成可投稿的 LaTeX 全文,中文编辑注记全部剥离。
结构:Intro / Related work / Method / Setup / Results / **§6 参数化基质的负面结果** /
Limitations / Conclusion + 附录 A(27 行完整分类表)+ 附录 B(撤回记录)。
36 条引用零悬空;图 1(判据类型分层)与图 2(读出方向 + 插入位置)已嵌入。
★ 论文的落脚点(五次收紧 + 一次再限定后):
新颖性只在**判据类型**一轴,且带两条限定(压缩**对话者的用词** / 门决定**要不要写**)。
立论不是"无人做过",而是**证明了这个区别重要**——最接近的先例用的正是自洽度,
而我方实测它在 gavagai 对上系统性反向(M′ 更窄时 AUC 0.137)。
★ §6 把参数化那条线写成**结构化负面结果**而非失败:
换词控制(落差 0.017–0.018)+ 强制绑定后跨格式塌到 base(0.545/0.670 vs 0.940)
⟹ "parametric route attains word binding or cross-format transfer, never both"。
附录 B 单独列出四条**改变了贡献声明本身**的撤回(GT-free 门 / locus / 内化 / DPI 归因),
避免读者从现稿反推出错误的历史。
工程:
· refs.bib 的编辑纪律从 `note` 改为 **`annote`** —— note 会被 plainnat 排进参考文献,
中文与 emoji 导致编译失败(实测 main.bbl:52 "You can't use `macro parameter character #'")。
抬头已写明新增条目须沿用 annote。
· LOCI 按建议**整条删除**(TDCommons 11091 无法再定位、作者标题未能核实;
只出现在族 6 概览句里,不承载主张)⟹ bib 当前无未过核条目。
· 表 1 过宽(270pt overfull)已改 p{} 列宽;附录表 caption 的分组说明与 GT-free 列对齐修正。
· 新增 paper/CHECKLIST.md:22 条禁令 → main.tex 落实位置的逐条映射 + 每次改稿的机械检查命令。
· .gitignore 排除编译产物。
未决(已写进 CHECKLIST 的「投稿当月必做」):
⏰ 重扫 rate-distortion 方向(两个月内已冒出两篇直接命中的)。
L7 早停版、E5 条件化失败、单模型族——按建议不再补实验,全部进 Limitations。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
论文 §6 的负面结论(参数化路线最多只拿到「词绑定」或「跨格式」之一)指向一个
结构性修法:把上下文注入赢下两者的那两个性质——**键是词的 token、值进入表征**——
做成不占上下文、跨会话持久的形式。
三条约束全部来自实测失败,不是想出来的:
· 键必须是词本身且推理时可观测(post-norm 换词后 h 只变 0.006 ⟹ 落差 0.017)
· 值必须进表征不能进 logits(cos(m,W_yes−W_no)=+0.79 vs cos(m,W_A−W_B)=+0.003)
· 不能靠相似度路由去找那个词(L7 换词后路由命中槽重合率 1.000)
★ 八轮正反方辩论,其中五轮是我方让步,全部须原样进 limitations:
反1 基质不新(textual inversion 等)—— 让步,且不得声称新;
新的只在组合:门决定建不建条目 + 值拟合于用法 + 键含 interlocutor_id。
反2 token 触发是查表、绕过了绑定 —— 部分让步;主张须限定为
「不丢失门已认可性质的存储基质」,不得写成「模型学会了绑定」。
反3 早层注入可能破坏该词的身份 —— 真风险,加**复述控制**且先于主结果跑。
反5 固定向量扛不住多义 —— 让步,结论限定在语境无关词汇项。
★反6 词不出现就不点火 = 把 I3 从"没做到"改成"不可能" —— 最贵的代价,
让步:**它绕开而非修复 I3**。唯一辩护是按知识类型分基质
(词汇→token 触发;命题→我们已做出的那个"物体级偏置",它在那里不是 bug)。
反7 上下文注入 0.905/0.995 已最好 —— 让步:质量上确实更好;
参数化只买到不占 token / 跨会话免检索 / 拟合于用法的含义三样,
三样都不要就该直接推荐上下文注入。
反8 你的架构直觉这轮已错两次 —— 成立,故先做最简单的输入嵌入版。
及格线**跑前写死**:F2/F3 须从 ~0.55 抬到 **≥0.85**(上下文注入天花板 0.905/0.995),
换词须 ≤0.30,且复述控制必须先过。任一 ★ 项不达标即记为负面结果、机制推理撤回。
另设两个**双向控制**(各故意破坏一条约束):词触发但值进 logits(预测 F2/F3 仍塌)、
值进表征但不按词位置(预测换词落差回到 ~0.02)。它们若不按预测失败,
说明我方对失败原因的归因本身是错的。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按 docs/DESIGN_LEXICAL_ENTRY.md §6 推进。两步都没走顺,但都是控制实验在起作用。 【第 1 步 复述控制】通过(无注入 1.00 → 同量级随机注入 0.88)⚠️ 但这个"通过"本身有问题:用的是**随机方向**的向量。 换成**学出来的真实 v**(同样 ‖v‖/‖h‖=1.00)⟹ 复述成功率 **0.00**。 ⟹ 范数不是正确的约束,问题在**方向**:梯度只优化决策, 没有任何一项保护 token 身份,于是径直落在覆盖身份的方向上。 ★ 教训:**控制实验必须用真实产物跑,不能用同量级的替身。** 已把「用学到的 v 重跑复述」写进脚本,作为解读主结果的前置。 【实施顺序被推翻】设计文档原写「先做 ℓ=0,够就不做 ℓ=7」。 ℓ=0 恰恰是**词的身份所在的层**,注入必然最具破坏性 ⟹ 改为先做 ℓ=7。 **这是被控制实验改的顺序,不是直觉。** 文档已留痕。 【实现 bug】范数上限一律用**嵌入层**的 ‖h‖(1.09)算,但残差范数随深度增长 (P5 实测末层 ≈172)⟹ L7 上的上限小了两个量级,几乎等于没注入, 训练 acc 卡在 0.500(= 只看物体的上限),**看着像"架构不能"**。 修:上限在**注入层**上量。修后训练 acc 1.000,而 v 只用了隐状态范数的 **2%**。 【冒烟 n=2,不下结论】L7 修正后: own F1 0.920 · F2 0.420 · **F3 0.920**(held-out 格式,base 0.525,此前最好 0.670) 换成含义相反的词:0.000 / 0.020 / 0.000 —— **三种格式一起翻转** 但 F2 未过线、复述仍 0.00。 ⟹ 全量 8 用户 × 4 条件(含两个双向控制)已启动,跑完再判。⚠️ 另需处理一处**我方原措辞过强**:辩论反 3 写「拼不出 ⟹ 绑定是假的」。 实测换词后 AUC=0.000(完全翻转),**绑定行为是真的**,丢掉的是"还能把词说出来"。 精确表述:**词条【替换】了该词的表征而非【丰富】它** —— 真缺陷,但不否定绑定。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
8 用户 × 4 条件 + base/L1 参照,全部完成。按设计文档 §4.1 跑前写死的及格线判定:**未达标**。
条件 F1 F2 F3
base 0.585 0.540 0.525
L1 上下文(天花板) 0.855 0.905 0.995
L7 词条 · 本词 0.835 0.570 0.775
· ★换相反词 0.080 0.330 0.125
· 换别人的词 0.550 0.430 0.395
emb 词条 · 本词 0.855 0.585 0.670
· ★换相反词 0.175 0.310 0.145
◇ emb_allpos(控制) 0.500 0.445 0.595 训练 acc 0.531
◇ postnorm_word(控制)0.585 0.540 0.525 ← 与 base **逐位相同**
✅ 绑定拿到了,而且是新拿到的:换成含义相反的词 → 0.080(P9b 未强制时落差仅 0.017);
换成**别人的词** → 0.550 ≈ base,正是"触发器不点火"应有的样子。
🔴 但跨格式未达线:F2 0.570(base 0.540)· F3 0.775(及格线 0.85,上下文注入 0.995)
⟹ 「早层 + 词位置就能拿到跨格式」这条机制推理**撤回**。
★ 两个双向控制**都按预测失败** —— 本轮唯一完全达标的部分:
· 值进 logits ⟹ 与 base 逐位相同(常量末位平移不改排序,构造性必然);
它解释了为什么 P5–P8 必须用输入依赖的路由。
· 键不是词(全位置注入)⟹ **连训练集都拟合不了**(acc 0.531 ≈ 只看物体的上限 0.5):
加在所有位置的常量无法区分"问的是 w1"还是"w2"。
⟹ **两条约束的归因成立,错的是"满足它们就够"。**
⚠️ 论文 §6 与摘要那句 "never both" 已软化为「最多只【完整】拿到其一」:
P11 是第一个同时拿到**完整绑定**与**部分跨格式**的配置 ⟹ 不是非此即彼,是**权衡曲线**。
main.tex 已改并零 error 编译通过。
⚠️ 复述控制主条件未过(L7 0.50 / emb 0.00)⟹ 按预注册规则主结果"不可解读",
**规则不改**。但辩论原写的「拼不出 ⟹ 绑定是假的」被实测证明过强——
换词后 0.080 说明**绑定行为是真的**;精确表述是
**词条【替换】了该词的表征而非【丰富】它**。正确处置是改设计(目标函数缺身份保持项),未做。
两个我方 bug,都是控制实验抓的(已进 §0.4 "差点犯的错"):
· 复述控制初版用**随机方向**同量级向量验证得 0.88 ✅,换真实 v → 0.00
⟹ 控制实验必须用真实产物,不能用同量级替身;
· 范数上限一律算在**嵌入层**(1.09),而注入在 L7(‖h‖ 大两个量级)
⟹ 训练 acc 卡 0.500,**又一次差点把实现问题报成架构限制**。
未做:F2 为何完全不响应未单独诊断(P8 记录该格式有 91% A 位置偏置);完整回路(门→词条)未接。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
直接看 p(A) 的分布,与上下文注入(同格式 0.905)逐项对照:
臂 AUC p(A|正例) p(A|负例) 正负例差 p(A)展幅 选A率
词条(L7) 0.570 0.534 0.514 +0.021 0.569 0.562
base 0.540 0.589 0.585 +0.004 0.223 0.700
L1 上下文 0.905 0.487 0.287 +0.200 0.340 0.237
❌ H_sat 被否:词条的 p(A) 展幅 **0.569 > L1 的 0.340** —— 比 L1 还展得开,不是饱和。
✅ H_weak 成立:正负例之差仅 +0.021,而 L1 是 +0.200 ⟹ **词条确实没迁到这个读出方向**。
✅ H_item 也成立:逐用户 AUC [0.20,0.20,0.32,0.68,0.76,0.76,0.80,0.84] —— 明显双峰。
★ 相对 base 的增益 +0.030(σ 0.116),**符号逐用户翻转**(+.12/−.16/+.16/−.04/+.12/−.08/+.16/−.04)
⟹ n=8 下与 0 无法区分。**P11 §1 表里的 0.570 vs 0.540 不构成提升**,已在正文标明。
★ 附带发现:**F2 作为测量仪器对非上下文方法不可靠**——
base 自己就逐用户 0.20–0.84(两个用户系统性反向),而 L1 在同样用户上 0.60–1.00(7/8 ≥0.96)。
把定义显式放进上下文能压过基座的固有倾向,一个细微的词条压不过。
⟹ **F3 才是干净仪器**(base 0.525、L1 0.995、无逐用户反向),
论文跨格式主证据应以 F3 为准,F2 只作"更难的格式"报告。
⚠️ 但**不改变判定**:F3 也只有 0.775,仍低于跑前写死的 0.85。
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
这是什么
一个新论文方向(目标 COLM/ICLR 2027)的阶段研究成果:让 LLM 在预训练之后、于交互(引用)中建立经过验证的、永久的、按对话者隔离的新概念。
本 PR 只新增
docs/与research/下的文档与实验代码,不触碰产品代码。核心结论
定位:空白不在「有没有准入门控」,而在门控用什么信号。跨持续学习/记忆架构/agentic 记忆,所有永久固化门的信号穷尽落在十类代理上(损失·参数漂移·容量·新颖性·梯度干扰·代表性·类别平衡·随机·不确定性·来源可信),「无 GT、无外部 oracle 的概念级正确性」一列为空。
实证:压缩增益门成立——22 个 gavagai 对,margin +4.08 nats 95%CI[+2.52,+5.70],19/22,p=0.00043。
但最重要的发现是**「压缩什么」比「用什么判据」更关键**:
三个前置条件(原设计全都漏了):观测量要对 / 基座要有能力 / 基座要肯照做。
后两者对缩放的反应相反(G4 无信号型 0.562→0.812 改善;G5 条件化失败 0.812→0.000 恶化)⟹ 「放大模型」不是通用解药。
★ 10 处自我推翻
报告第 4 节逐条记录了我方先提出、后被自己的调研或实验推翻的主张,包括:
/base归一化 → 试了,失败(存档以免重复劳动)其中 6 处来自设计时特意埋的诊断项——例如朴素压缩门表面 8/8,被自埋的
ΔNLL拆解否掉(92% 的 margin 来自长度罚,词级 margin 仅 +0.02)。只报G就会是假阳性结论。🔴 一条优先权风险
arXiv:2607.08032(2026-07-09)已在开放问题中提出与压缩增益门同构的写入准入判据(基于边际任务条件信息量
I*(Q)),但只提议程、未实现未实验。贡献声明已据此最终收紧为:「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」,并将其作为 concurrent position work 正面引用。
证据等级
复现
全部实验零训练算力(冻结基座 + 纯 prompt,单机 MPS):
🤖 Generated with Claude Code