Skip to content

research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻) - #335

Open
oratis wants to merge 54 commits into
mainfrom
claude/learning-in-referencing-03a60e
Open

research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻)#335
oratis wants to merge 54 commits into
mainfrom
claude/learning-in-referencing-03a60e

Conversation

@oratis

@oratis oratis commented Jul 31, 2026

Copy link
Copy Markdown
Owner

主文档research/learning-in-referencing/REPORT.md

这是什么

一个新论文方向(目标 COLM/ICLR 2027)的阶段研究成果:让 LLM 在预训练之后、于交互(引用)中建立经过验证的、永久的、按对话者隔离的新概念。

本 PR 只新增 docs/research/ 下的文档与实验代码,不触碰产品代码

核心结论

定位:空白不在「有没有准入门控」,而在门控用什么信号。跨持续学习/记忆架构/agentic 记忆,所有永久固化门的信号穷尽落在十类代理上(损失·参数漂移·容量·新颖性·梯度干扰·代表性·类别平衡·随机·不确定性·来源可信),「无 GT、无外部 oracle 的概念级正确性」一列为空

实证:压缩增益门成立——22 个 gavagai 对,margin +4.08 nats 95%CI[+2.52,+5.70],19/22p=0.00043
但最重要的发现是**「压缩什么」比「用什么判据」更关键**:

观测量 margin 显著性
老师的自由陈述 +0.68 nats p=0.36 ❌
老师的用词决策序列 +4.92 nats p=0.0039

三个前置条件(原设计全都漏了):观测量要对 / 基座要有能力 / 基座要肯照做
后两者对缩放的反应相反(G4 无信号型 0.562→0.812 改善;G5 条件化失败 0.812→0.000 恶化)⟹ 「放大模型」不是通用解药

★ 10 处自我推翻

报告第 4 节逐条记录了我方先提出、后被自己的调研或实验推翻的主张,包括:

  • 「所有门控只调写入强度」→ 第三轮推翻(DEN/SEMA/SAGE 都是真门控)
  • 「推理期写入 × 跨会话持久从未同时成立」→ 上下文蒸馏族已填上该格
  • 「放大模型可解」→ 3B 上 margin 涨 4× 但 AUC 反降
  • 「σ_null 是盲的」→ 被自己的数据纠正(是校准问题不是盲区)
  • 忠实性探针 F(c)、/base 归一化 → 试了,失败(存档以免重复劳动)
  • LMLM 的 venue 与机制归因、Sharpening 的定理归因 → 第六轮改正

其中 6 处来自设计时特意埋的诊断项——例如朴素压缩门表面 8/8,被自埋的 ΔNLL 拆解否掉(92% 的 margin 来自长度罚,词级 margin 仅 +0.02)。只报 G 就会是假阳性结论。

🔴 一条优先权风险

arXiv:2607.08032(2026-07-09)已在开放问题中提出与压缩增益门同构的写入准入判据(基于边际任务条件信息量 I*(Q)),但只提议程、未实现未实验
贡献声明已据此最终收紧为:「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」,并将其作为 concurrent position work 正面引用。

证据等级

  • 家族 A–I:经 3 票对抗验证(✅)
  • 家族 J–P:第五、六轮的正式 Verify 阶段未跑完;第六轮抓取代理完成了 pdftotext 全文穷举 + 近似命中逐条核查,故标 ✅ᶠ(强于 🔍、弱于 ✅)
  • 未解决项与方法学限制在报告第 5 节全部列出(E5 条件化失败、误收 3 个 M′、内化不幂等、迭代内化坍缩、单模型族、22 items)

复现

全部实验零训练算力(冻结基座 + 纯 prompt,单机 MPS):

cd research/learning-in-referencing/p0
uv venv --python 3.12 .venv && uv pip install torch transformers
.venv/bin/python p0c_decision_mdl.py                              # 核心信号
.venv/bin/python p0e_v2_eval.py Qwen/Qwen2.5-1.5B-Instruct bf16   # 22 items + CI
.venv/bin/python p0j_calibration.py                               # 跨规模校准(纯分析)

🤖 Generated with Claude Code

oratis and others added 18 commits July 24, 2026 13:50
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
第四轮 deep-research(12 目标 × [发现员+怀疑复核] + 总裁决 = 25 agent, 0 error)
对抗式证伪狭义主张。结果 holds-with-caveat, 0 反例 0 refute:

- 族6 回放选择准则全覆盖: reservoir=随机 / GDumb=类别平衡 / GSS=梯度多样性 /
  iCaRL=代表性 / DER++=reservoir(标签仅进loss) 皆真准入门; MIR 是检索门非准入门;
  生成式回放/CLS 无逐项门 — 无一用概念级正确性
- 族5 局部学习: FF/PC/EqProp 无 episodic 门(量词空真); Hopfield 容量=被动饱和;
  recall-gated/self-sizing 是 GT-free 但信号为熟悉度/新颖
- 两悬案关闭: CN-DPM ✅ 确立为架构原生两段式(WAKE/SLEEP, DP×似然门);
  2606.03787 ✅ 确立为真实 surprise-gated robot episodic memory
- caveat: 2026 agentic 记忆写入门(Write-Time Gating/TRUSTMEM/LOCI)引入新代理
  (来源信誉/对源忠实/可靠度/外部oracle), 均非概念真伪 → 代理表扩到十类,
  delta 收紧为 "GT-free / 无外部 oracle"; LOCI 为最锋利近邻(外部结果确认)
- 引用修正: GDumb arXiv:2007.05003 是误号 → ECCV 2020 proceedings

改动: §7.6.2 代理表+12行 / 新增 §7.6.7 总裁决 / §7.6.4 证据强度重排 /
§7.6.5 关闭两悬案 / §7.6.6 引用陷阱 / 附录 I 族4/5/6 落地 / §9.1 勾掉第四轮 /
§9.2 Q9/Q11 已答+Q12 / §9.3 立论包(proposal+related-work+三层架构最小实现)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
四轮调研收官后进入设计。两份新文档把立论包 §9.3 的 C2/C4 展开为可实现规格:

- DESIGN_COMPRESSION_GATE.md — 机制
  * 两部分 MDL 形式化:G(c) 必须在【留出轮次】上算、必须含 L(c)、必须过【安慰剂对照】
  * 修正 C4:区分 E1(模型误解 → 压缩门拒绝 ✅)与 E2(老师教假话 → 压缩门接受,
    属设计边界,归 provenance 门射程)——原措辞"拒绝一切错误概念"会被 E2 反例击穿
  * 现有七种门在 E1 上的失分表 + 七条失败模式 + 八项消融矩阵

- DESIGN_CONCEPT_BENCH.md — 数据
  * 构造语言(伪词四道过滤 / 组合式微世界 / 语法距离旋钮)
  * gavagai 对 G1–G5:教学集在构造上不足以消歧,只有留出用法能揭示所指
    → 把 E1 从"碰运气"变成可控可判分的实验条件
  * 切断 Aycock 平行样例捷径的教学协议;冲突词跨用户隔离测试
  * 实施顺序按"最早能证伪"排:P0 零算力先验证核心信号

研究文档同步回填 C4 修正、related-work 末句收紧提示、P0 指引。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
首个实证结果(Qwen2.5-1.5B 冻结,零训练,8 个 gavagai 对)。

结论:机制成立,但【压缩什么】比【用什么判据】更关键。

1. 朴素版(在老师自由陈述上算 NLL)——失败
   · G 表面 8/8,但拆开看 92% 的 margin 来自长度罚 L(c)
   · 纯预测力 ΔNLL 仅 +0.68 nats(5/8, 符号检验 p=0.36 不显著)
   · 词级 margin +0.02 ≈ 零:给不给正确定义,模型输出该伪词的概率几乎不变
   · 2/8 项被错误安慰剂击败
   → 若只报 G 的 8/8 就是假阳性结论;诊断项是设计时特意埋的,起了作用

2. 决定性诊断——能力在,观测方式错
   · 强制选择探针:M/M′ 落差平均 0.295,6/8 有区分(最强 0.954→0.026)
   · 失败的 2 项均需世界知识(盒子不圆 / 石头非金属)

3. 修正版(改压缩老师的用词决策序列)——成立
   · ΔNLL +4.92 nats(8/8, p=0.0039),较自由陈述版提升 7.2×
   · 安慰剂对照 8/8;4/8 项上误解的增益为负(比无概念更糟,门直接拒绝)
   · 长度罚占比 92% → 60%

未解决(已写进文档,不可声称已解决):
   · 单候选阈值跨 item 不可分,最佳归一化 AUC 0.875
     → 门目前是排序器,不是阈值判据;per-item 校准是最大缺口
   · 范畴歧义远易于合取歧义(+10.73 vs +2.99),勿用 G2 数字代表整体

回改:机制文档新增 §1.2b(观测量)、§1.3 阈值警告、消融必报项 A0′/A0″。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按路线图推进第 1、3 项(第 2 项缩放测试受下载带宽阻塞,未完成)。

1. per-item 校准(P0d)——部分成功
   · 用安慰剂池作零分布算 z 分数:AUC 0.797 → 0.906
   · 设计预测精确成立:M′ 平均 −0.22 vs 零分布中心 −0.27(仅差 0.05 nats),
     M 为 +3.86 显著离群 → 零分布含 overspec 的设计是对的
   · 与 SEMA(族 4 最接近先例)同一套 z 校准机制,差别只在信号类型 → 可正面引用
   · 试过 6 种归一化(硬零分布/仅overspec/稳健z/百分位/÷base),全局可分性均未达成

2. ★ 根因定位:门的判别力继承自基座能力(新增第二前置条件)
   · ρ(能力探针落差, 判别 margin) = +0.857
   · 探针失败组 margin +2.11 vs 通过组 +5.86(2.8×)
   → 校准无法弥补能力不足;这是原设计未识别的前置条件

3. 扩展集 v2(P0e)——22 items × 5 类歧义 + bootstrap CI
   · margin +4.08 nats 95%CI [+2.52,+5.70](不含 0);19/22,p=0.000428
   · AUC 裸 0.843 [0.738,0.942] / z 校准 0.857 [0.746,0.950]
   · 分类型差异是主导因素:
       G2 范畴 +9.12 (AUC 1.000) · G3 材料 +8.25 (1.000) · G1 合取 +2.93 (0.861)
       G5 绝对/相对 +0.53 (0.812) · G4 论元顺序 +0.15 (0.562 ≈ 随机)
   · ★ 分层可分性:仅 G2/G3 时单候选阈值 AUC 1.000、τ=+0.75 ✅
     → 把「阈值不可分」从方法缺陷重定位为【作用域条件】

4. 🔴 撤回一个我方设计预测
   · 设计时预期「双向判别(G3-G5)强于单向(G1,G2)」→ 实测相反(+2.98 vs +5.41)
   · G4 失败机制查清:|ΔNLL| 仅 0.90 vs 其他 4.74,定义完全不改变模型预测
     (靠表层语序启发式作答)——能力缺失,非材料或门的缺陷

5. bf16 与 fp32 结果一致(margin +4.90 vs +4.92,AUC 相同)→ 精度非混淆项

回改:机制文档新增 §1.3b(零分布 z 校准)、失败模式 8/9、前置条件 2;
bench 文档标注 G1/G2/G3 为主实验核心、G4/G5 为作用域边界。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P0e 发现 G4(论元顺序)AUC 0.562 ≈ 随机、|ΔNLL| 仅 0.90(其他类 4.74)。
本实验保持任务不变、只改定义呈现方式,分开三种互斥解释:

  a 抽象变量 "X zelka Y" means X gives to Y   → margin +0.15 (2/4), |ΔNLL| 0.90
  b + 显式角色说明(第一个名字是给予者…)        → margin −0.56 (1/4), |ΔNLL| 3.37
  c 用真实人名实例化(去掉变量绑定)             → margin +0.35 (3/4), |ΔNLL| 0.87
  对照:其他 4 类歧义                          → margin ≈ +4.9,   |ΔNLL| ≈ 4.74

裁决:(A) 能力缺失。三种呈现都无信号 → 排除 (B) 变量绑定 与 (C) 提示格式。

关键细节:b 的 |ΔNLL| 升到 3.37 说明显式角色说明确实大幅改变了模型预测,
但 margin 转负 —— 不是"定义被忽略",而是模型用了定义却仍分不清论元角色。
这把 G4 从"可能是提示假象"坐实为【基座能力边界】。

含义:论文作用域应以 G1/G2/G3(属性/范畴/材料)为核心,
G4/G5 单列为当前基座不可及的边界,勿混入主指标。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
项目目标扩展为「探索所有 AI 模型将知识内化的方案」,据此新建全景文档,
把前四轮调研的材料重组为按机制的分类学(而非按论文名)。

概念脊柱(本文档的原创综合,标 💭):
· 内化的五个判据 I1–I5:免检索/组合性/隐式触发/跨会话持久/抗干扰
  → "学会了" ≈ 五者合取;RAG 只满足 I4,是"存储"不是"内化"
· 内化度阶梯 L0–L5:上下文→外部存储→激活/状态→适配器→稀疏槽→稠密权重
· ★ 核心张力:内化度 ↑ ⟹ 可逆性 ↓、可隔离性 ↓
  所有工程方案本质上都是在这条对角线上选点;有意思的研究都在中间层 L3/L4
· 内化流水线六环节:获取→准入门控→写入→巩固→保持/隔离→调用
  实证发现:环节②(准入门控)是全领域最薄弱的一环

三个正交轴:载体 × 写入算子 × 时机,外加横切的准入门控维度。

家族 A–I 已落地(ICL/外部记忆/SSM状态/TTT快权重/稀疏槽/per-user适配器/
权重编辑/可生长模块/局部规则),每族回答四问:内化到哪里、用什么写入、
持久性、有无准入门控;全部带 ✅/⚠️/❌/🔍/💭 验证状态。

§4 横向矩阵读出三条结构性事实:
 1. 「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓
 2. 有门控的家族信号都不是正确性(十类代理占满,正确性列空)
 3. 唯一原生快慢分离(HOPE/CMS)把巩固接到时钟而非门

§5 五个根本张力:稳定性-可塑性、叠加不可寻址、内化度反比、容量上界、
隔离 vs 泛化(后者在架构文献中命中为零)。

§7 定位本项目并声明边界:压缩增益验证「对该对话者用法的语义保真度」,
非「世界真值」;解决 E1(模型误解)不解决 E2(老师说假话),
后者属 provenance 门射程,两者正交可组合。

待办:第五轮调研(进行中)回填 J–P,尤其 J 上下文蒸馏——
它可能是「推理期写入 × 跨会话持久」那格的已有解,若是则空白声明需收紧。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
问题:门的判别力继承自基座能力(ρ=0.857),关系类概念上几乎无信号,
校准救不了(试过 6 种归一化)。原设计的门是二态的(毕业/不毕业),
在能力不足处任何阈值都是在读噪声。

方案:加一个前置的【可判定性闸门】,让门能"知道自己判不了"并转为追问。

可判定性计 σ_null = 零分布的离散度,必须满足三条且都满足:
  · GT-free(不需要答案)
  · 不需要知道哪个候选是对的(对比:能力探针 ρ=0.857 但需要两个候选)
  · 门本来就要算零分布 → 零额外开销
语义:把候选定义塞进上下文后,模型预测到底会不会被影响。
      σ_null≈0 ⟹ 定义没进入决策 ⟹ 增益判据无效。

实测(22 items):
  σ_null: G1 4.75 / G3 4.12 / G2 2.93 ≫ G5 1.07 / G4 0.64
  ρ(σ_null, margin) = +0.520

三态门(τ_dec=1.5, τ_z=+0.68):
  AUC 0.857 → 0.964(τ_dec=2.0 时 0.970)
  正确接受 M 15/15(零漏拒)· 正确拒绝 M′ 12/15 · 弃权 7/22
  覆盖项准确率 90.0%
  ⚠️ 仍误收 3 个 M′ —— 误解被固化是最该压低的错误,未解决

★ 弃权的正当性检验(关键):被弃权项的 AUC = 0.551 ≈ 随机
  → 门弃掉的正是它本来就判不了的,不是在丢信号
  这让弃权从"逃避"变成"有依据的判断"

回改:
· 机制文档 §1.4 毕业判据从二态升级为三态(ACCEPT/REJECT/ASK),
  失败模式 8(基座无能力)标为"已解决为机制"
· 全景文档 §1.3 流水线补充:环节②应含元判断"判不判得了",
  指出现有所有方案的门都是二态的、没有"弃权"这一态

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 机制文档:状态行更新为「判据已升级为三态门」;失败模式 8(基座无能力)
  标为「已解决为机制」——σ_null 可判定性闸门可检出并弃权
· 全景文档 §1.3:流水线环节② 补充元判断「这条经验我判不判得了」,
  并指出现有所有方案的门都是二态的、没有「弃权」这一态
· 全景文档 §7:补三态门实测结果与三层架构中的位置

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第五轮调研(上下文蒸馏/模型合并/知识蒸馏/检索增强/自我改进/睡眠期/
参数化知识库)回填完成,A–P 全覆盖,文档 631 行。

🔴 证据等级警告(已在文档顶部与 §3 前置声明):
   第五轮的 Verify 与 Synthesize 阶段未执行完(工作流在 Fetch 后中断,
   输出文件为空),130 条主张未经 3 票对抗验证。
   J–P 全部标 🔍,与 A–I 的 ✅ 不可混用。

★ 最重要的一条:撤回原 §4 结构性事实 1
   原文:「推理期写入」与「跨会话持久」在任何一行都不同时为 ✓,是最干净的结构性空白。
   实况:家族 J(上下文蒸馏)恰恰填上了这一格;其中 Generative Adapter
        (ICLR 2025)更做到 单次前向写入 × 跨会话 × 天然按用户隔离。
   修正后仅保留弱版本:该格在纯架构层 A–I 内为空;J 靠额外离线蒸馏步/摊销 hypernet。
   (这条风险在上一版 §8 待办里已预警,现应验并如实撤回。)

★ 但定位反而更强:J/J′/O 三族「有完整内化管线、唯独没有准入门控」
   → 贡献声明从「提出新架构」收紧为
     「给一个已跑通的内化管线补上它唯一缺的器官:无需标准答案的正确性门」
   → 不必自证管线可行(J 族已证),只需证明「加门比不加好」
   → 2605.26099 的调研记录直接点出「这个无门控正是压缩增益门可插入的位置」

新增两条必须处理的风险(已写进 §7 与 §8):
 1. 内化不幂等(When Context Returns, 2606.11627):把原始 context 重新塞回
    已蒸馏模型,性能反而变差,甚至在它本已答对的样本上退化。
    本项目正是「引用→内化」系统,必须测;已知轻量修复 = stop-gradient
    anchoring + forward KL 一致性正则。
 2. 迭代内化的 progressive capability collapse(2606.04703);
    缓解线索 principle-level > instance-level、step-wise > global。

一条理论正面支持:Sharpening 机制(ICLR 2025)证明自我改进不可能创造
模型中原本不存在的信息 → 新知识必须来自外部证据 → 从理论侧确认本项目
「新概念必须在引用中从对话者处获得」的问题设定是对的。

其他要点:M 族给出「何时写进权重」的判据双轴(规模轴标度律 + 长尾流行度轴);
K 族 task vector 取负提供了罕见的可逆性,但崩塌是任务对固有属性且有解析上界;
N 族模型坍缩需连边界条件引用(替换式才坍缩,累积式不坍缩);
P 族 LMLM 的损失掩码即准入门,且支持 instant forgetting。

新增附录 J(J–P 文献表,全部 🔍)。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
3B 下载完成,路线图第 2 项解除阻塞并跑通。结论与我方预测相反。

预测(由 ρ(能力探针,margin)=+0.857 导出):放大基座应同时提升 margin、
判别质量、全局可分性。

实测(22 items,同材料同代码,均 bf16):
  margin  +4.08 → +16.82   (涨 4×)   ✅
  M 胜出  19/22 p=0.00043 → 15/22 p=0.067  ❌ 不再显著
  AUC(z)  0.857 → 0.738    ❌
  → margin 大 ≠ 判得准,二者不是一回事

分类型显示两种失败模式对缩放反应相反:
  G4 论元顺序  0.562 → 0.812  ✅ 改善(原最差项,"没有信号"型失败确实随规模缓解)
  G1 合取      0.861 → 1.000  ✅
  G5 绝对/相对 0.812 → 0.000  ❌❌ 彻底翻转(4/4 全判反,margin −21.70)

★ 新错误类型 E5「条件化失败」:
  G5 的实例措辞 "next to Y" 提示比较读法;3B 模型即使被明确告知
  "该词指绝对大"仍按比较读法作答 —— 模型没有忠实条件化于给定定义,
  先验压过了定义。而先验强度随规模增长 ⟹ 该失败模式越大越糟。

  与 E1–E4 的区别:E1 是模型的假设错;E5 是假设对但模型不按它行动。
  测量效度含义:ΔNLL 实测的是「(模型先验 ⊗ c) 解释数据的程度」,不是 c。

★ 三态门接不住 E5(弃权机制的盲区):
  G5 的 σ_null 均值 6.94(不低)、z(M′) 均值 +3.52(强离群)
  → 模型是「自信地判反」而非「判不了」,可判定性计读出的是「可判定」
  → 「不可判定」≠「自信地错」,σ_null 只能检出前者。当前最大未解决问题。

方法学注记:能力探针在 3B 上饱和失效(落差 +0.297→+0.058,6/8→1/8;
ρ 0.857→0.310)。它是两个趋近 1 的概率相减 —— 这不是能力瓶颈结论被推翻,
而是该仪器在 ≥3B 不再可用;σ_null(离散度)更稳健。

必须声明的混淆:G5 把对照物写进实例本身,本就提示比较读法。但真实对话
总是带框架的,故这是真实的测量效度问题,不能仅当作材料瑕疵;两种解释都报告。

机制文档:新增 E5 行与前置条件 3(模型必须能忠实条件化于候选概念)、
失败模式 10。候选解法方向:忠实性探针(在定义能给出平凡确定答案的实例上
检查模型是否遵循 c)。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按计划做了两件事:验证仪器、试 E5 的候选解法。两个结果都是负面的,
其中一个纠正了我上一条提交里的结论。

1. P0h 仪器有效性检查(下 E5 结论前的前置验证)
   · 平凡常识题:raw 6/6、chat 6/6 → 仪器正常,E5 不是格式假象 ✅
   · 但伪词+定义的平凡应用 3B 仅 4/6:
     "kirel means red" + "Is a red box kirel?" → p(yes)=0.000(以概率 1.0 答 No)
   → E5 比 §6c 原先归因的「framing 提示比较读法」更广:
     3B 连无任何框架的单属性平凡应用都会失败。

2. P0i 忠实性探针 F(c) —— 我提的方案,失败
   构造「答案由候选定义单独蕴含」的平凡实例(GT-free 成立),
   F(c) = p_yes(蕴含Yes) − p_yes(蕴含No)。
   预测判错的 AUC:F_min 1.5B 0.895 / 3B 0.533(≈随机)
                   σ_null 1.5B 0.965 / 3B 0.905
   → 两个规模都不如 σ_null,3B 上退化到随机。假设推翻,不采用。
   (细节:3B 的 G5 上 F(M)=0.403 < F(M′)=0.768,模型对错误读法反而更忠实,
     与先验压过定义一致;但 F_min 聚合后挑不出这类项。)

3. ★ 纠正上一条提交里的过强结论
   上次写「σ_null 是盲的、接不住 E5」。数据不支持:
     判错的 7 项 σ_null 均值 6.72  vs  判对的 15 项 13.06
     σ_null 预测本项会不会判错的 AUC = 0.905
   → σ_null 对 E5 并不盲,它在失败项上系统性更低。
   → 真正坏掉的是阈值跨规模不可迁移(3B 的 σ_null 约为 1.5B 的 4 倍,
     1.5B 调好的 τ_dec=1.5 在 3B 上无意义)。
   → 这是校准问题,不是盲区;修法应是把 σ_null 无量纲化,而非另找信号。

限制清单相应更新(第 10/12 条),并把失败的 F(c) 存档以免重复劳动。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
失败模式 10 与前置条件 3 更新:
· σ_null 对 E5 并不盲(判错组 6.72 vs 判对组 13.06,AUC 0.905)
· 真问题是阈值跨规模不可迁移(3B ≈ 1.5B 的 4×)→ 需无量纲化
· 忠实性探针 F(c) 已试且失败(3B AUC 0.533≈随机),标注不采用以免重复

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
§6d 定位出真问题是阈值跨规模不可迁移(3B 的 σ_null ≈ 1.5B 的 4×)。本次解决。

测了 6 种归一化,双标准:A 组内 AUC 不降;B 1.5B 选的阈值直接用到 3B 仍有效。

结果:
  raw     AUC 0.965/0.905  迁移❌(3B 全保留,无弃权效果)
  /base   AUC 0.965/0.724  迁移◐   ← 我事先按量纲推理看好的,实测失败
  /|mu|   AUC 0.667/0.743  迁移✅   ← 但组内 AUC 太低,判为噪声,不推荐
  rank    AUC 0.965/0.905  迁移✅   ← 采用

★ rank 是对的,且有构造性论证而非拟合:
  · rank 是 raw 的单调变换 ⟹ 组内 AUC 与 raw 完全相同,判别力分毫不损
  · 分位数天然无量纲 ⟹ 跨规模可比
  两点都是构造性质,不是在 22 样本上碰巧拟合出来。

覆盖/准确率权衡在两个规模上都单调(信号良态的标志):
  τ=0.19 → 1.5B 18/22 100%  | 3B 18/22 77.8%
  τ=0.40 → 1.5B 13/22 100%  | 3B 13/22 92.3%
  τ=0.60 → 1.5B  9/22 100%  | 3B  9/22 100%
  (3B 不弃权基线 68.2%)

🔴 但这没有解决 E5:3B 上 τ=0.19 弃掉的 4 项里只有 3 个是真错误;
   7 个错误中 G4-01/G4-04/G5-01/G5-02 未被抓住——G5 的 E5 错误多为中等 σ_null。
   ⟹ 校准问题与 E5 问题是两个独立问题,§6d 把它们混在一起了,本节分开。

部署代价:rank 需要一批候选才能算分位(同轮候选池或滚动窗口),
必须写进论文。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第六轮的正式 Verify(3票) 阶段未跑完,但抓取代理完成了 pdftotext 全文穷举 +
关键词逐条核查。据此引入中间证据等级 ✅ᶠ(全文穷举级,强于 🔍 弱于 ✅)。

★ 确认(✅ᶠ 全文穷举)——立论支点在「已实现方法」层面成立:
· Generative Adapter (ICLR 2025):21 页 camera-ready、136KB 全文,
  admission/admit/filter/criteri*/threshold/verif*/trust/confiden*/reliab*/
  surpris*/salien*/discard/relevance/importance 命中全为 0;
  近似命中逐条证伪——gate 唯一命中是 'aggregated' 子串,gating 是 'investigating' 子串
· Cartridges:Algorithm 1 是裸 chunk→seed→sample 循环,每条生成对话直接进训练集;
  损失为纯 KL 上下文蒸馏,无正确性/事实性/置信度项;38.6×/26.4× 数字准确
· Cartridges at Scale:12,094 词穷举 gate/admission/novelty 均 0
  ★★ Appendix J 提供「凡进上下文即写」的直接铁证:9 个 FinQA cartridge 的
     688 个唯一数字中仅 41% 有原文依据,纯粹捏造占 9%(n=62),全部被无差别写入

🔴 改正 4 处错误:
1. LMLM 不是 NeurIPS 2025 主会 → 是 CCFM workshop Oral;
   且 v3 已更名 Large → Limited Memory Language Models(沿用旧名会检索错配)
2. LMLM「损失掩码即准入门」是范畴错置 → 掩码是训练目标;真正的写入过滤器是
   标注管线的 Corrector(按损失丢弃 top-10%,判据=格式合规+上下文可推得性,非正确性)
3. Sharpening「自我改进不可能创造新信息」不是该文定理 → 是动机性前提,
   正文归因于 data-processing inequality (Cover 1999)。引用须改归因。
   但适用范围核查对我方有利:论文显式限定「无外部反馈」自采样设定,
   故不能外推到「有外部证据进入上下文」,我方推论仍成立。
4. Generative Adapter「全程无梯度」不准确 → 仅测试期;生成器 G 需离线自监督预训练。
   「省 4×」必须连代价一起报:F1 66.0 → 40.2(相对下跌 39%),只报 4× 是误导。

🔴🔴 优先权风险(对本项目最重要):
   arXiv:2607.08032 "What to Keep, What to Forget: A Rate–Distortion View of
   Memory Compaction"(Colaco & Lahjouji, 2026-07-09)
   · 有利:独立佐证我方否定性支点(该文 49 次 gate 命中全是架构门控单元,
     admission/verify/correctness 全 0;断言各层保留信号一律是注意力幅度或时近性)
   · 不利:其开放问题已提出基于边际任务条件信息量 I*(Q) 的写入准入判据,
     与压缩增益/MDL 门在动机与形式上高度同构
   → 裁决:已实现方法层面支点仍成立(该文未实现、未实验),但已被提出层面被占位
   → 贡献声明收紧为「尚无方法【实现并实证】基于压缩增益的写入准入门控」,
     并把 2607.08032 作为 concurrent position work 正面引用
   → 这是继 SAGE 之后第二次有工作逼近本项目位置,且这次在信息论形式上更近

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
汇总 2026-07-24→07-31 的全部工作,作为 PR 的主文档。

结构:研究问题(四性质 P1–P4) → 方法(6 轮对抗调研 + P0–P0j) →
主要发现 → ★被推翻或收紧的我方主张(10 处) → 当前状态 → 下一步 → 产物索引。

核心结论:
· 定位:空白在「门控信号的类型」而非「有没有门控」;十类代理占满,
  「无 GT、无外部 oracle 的概念级正确性」一列为空
· 实证:压缩增益门成立(22 items,19/22,p=0.00043),但【压缩什么】
  比【用什么判据】更关键——观测量必须是用词决策序列而非自由陈述(7.2×)
· 三个前置条件(原设计全漏):观测量要对 / 基座要有能力 / 基座要肯照做;
  条件 2 与 3 对缩放的反应相反 ⟹「放大模型」不是通用解药
· 三态门 + 弃权正当性(被弃权项 AUC 0.551≈随机)+ rank 跨规模校准

同时把贡献声明按第六轮的优先权风险做最终收紧:
  「尚无方法【实现并实证】基于压缩增益的、GT-free 且无外部 oracle 的写入准入门控」
  并把 arXiv:2607.08032 作为 concurrent position work 正面引用。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
第七轮收窄到 8 篇后 Verify 阶段成功执行(103 agent,105 主张 → 25 验证 →
18 确认 7 否决;5 个 agent 因 API 断连出错)。

🔴🔴 立论支点的绝对表述被证伪(第二次被推翻):
  arXiv:2606.03979 的 Dreaming 阶段有两道真实的写入前筛选——
  (a) 梯度重要性 Top-k 拒采(ARC 上「每任务采 60 条 dream、拒 45 条」;
      消融去掉后 SQuAD 48.9/46.2 → 47.1/45.2)
  (b) 继承自 SEAL 的二值奖励 r={1 if improves, 0 otherwise}
  但两者判据均为【可学习性/效用】而非正确性/事实核验;
  且 τ 只在 ReST-EM 训练期塑形生成器,部署写入环节不施加过滤。
  ⟹ 声明第三次收紧为「尚无方法【实现并实证】以压缩增益/MDL 为判据、
     GT-free 且无外部 oracle 的写入准入门控」。

🔴 改正我方两处实质错误(均在 2605.26099):
  1. 作用域:N 次 pass 作用于当前窗口 chunk(L=24 tokens),
     不是「整个累积上下文」
  2. 定性(更严重):其 fast weights 是 SSM 定长递归状态 S、每序列零初始化,
     不是跨会话持久的模型参数(permanent=0/cross-session=0/continual=0)
     ⟹ 我方原先称其「把睡眠期落到权重上」是错的,已撤回;
        不可与真正写权重的 P 族并列为持久化证据

✅ 新确认(3 票):
· Sleep-time Compute 不写权重(LaTeX 级 weight/gradient/LoRA/SGD 全 0;
  模型全为闭源 API 结构上无法写权重;repo 无 torch/peft),数字 5×/+13%/+18% 属实;
  唯一写入规则是新近性+似然,参考实现为无条件覆写
· LMs Need Sleep 两阶段与摘要关键句逐字属实;第一阶段确无准入判据
  (forget*=13 全是 catastrophic forgetting、零个 forget gate;
   surpris*=1 仅 "Surprisingly" → 不存在 Titans 式 surprise 度量)

⚠️ 两条措辞纪律:
· 不得由「论文不假设 oracle verifier」推出「因此不可能有正确性门控」
  (该强推论被三次独立否决 0-3×3)
· Sleep-time Compute 的仓库层提示词含 "remove calculations that are not useful"
  与 "checked that there are no errors" —— 可被审稿人当反例,避免绝对句

🔴 最高优先未决线索:GATES (stein2026) 的 consensus-gating 按多条 tutor trace
   一致性门控学习 —— 一致性是无需 GT 的正确性代理,直接落在我方主张位置上,
   若属实需再次收紧。SEAL 同样待查。

❗ 覆盖缺口:J 族 3 篇 + P 族 2 篇本轮无一条主张通过验证,仍仅摘要级,
   相关事实明确标注为「不得写入论文」。

核查 SOP 已沉淀:子串误报清单(LoRA⊂exploration、gating⊂backpropagating 等)、
词边界+substring 双跑、arXiv HTML 曾返回错篇故须用正文水印校验身份。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
· 自我推翻清单 10 → 12(新增:支点绝对表述被证伪、Do LMs Need Sleep 的
  fast weights 非持久参数)
· 贡献声明的三次收紧过程做成表格,给出当前唯一可辩护的措辞
· 新增 GATES/SEAL 最高优先未决线索
· 未解决表补充 J/P 族剩余 5 篇仍仅摘要级(明确标注哪些事实不得写入论文)
· 方法学自评补充第七轮沉淀的核查 SOP(子串误报清单、双跑校验、
  arXiv HTML 返回错篇、不得过度外推 oracle 免责句)

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Jul 31, 2026

Copy link
Copy Markdown
Owner Author

第七轮 3 票验证结果(PR 已更新)

前两轮的 Verify 阶段都卡住没跑完,这轮把范围收窄到 8 篇后成功执行(103 agent,105 主张 → 25 验证 → 18 确认 7 否决)。

🔴 立论支点的绝对表述被证伪

arXiv:2606.03979(Language Models Need Sleep)的 Dreaming 阶段有两道真实的写入前筛选

  • 梯度重要性 Top-k 拒采 —— ARC 上**「每任务采 60 条 dream、拒 45 条」**
  • 继承自 SEAL 的二值奖励 r = {1 if improves, 0 otherwise}

但两者判据都是【可学习性/效用】,不是正确性/事实核验。 贡献声明因此第三次收紧:

「尚无方法【实现并实证】以压缩增益 / MDL 为判据、GT-free 且无外部 oracle 的写入准入门控。」

🔴 同时改正了我方两处实质错误(都在 2605.26099)

  1. 作用域:N 次 pass 只作用于 L=24 token 的当前窗口,不是"整个累积上下文"
  2. 定性(更严重):其 fast weights 是 SSM 定长递归状态、每序列零初始化permanent/cross-session/continual 全 0)——不是持久参数。我方原先称其"把睡眠期落到权重上"是错的,已撤回。

✅ 新确认(3 票 + 全文穷举)

Sleep-time Compute 不写权重:LaTeX 源码级 weight/gradient/LoRA/SGD 全 0;所用模型全为闭源 API 结构上无法写权重;官方 repo 无 torch/peft。数字 5×/+13%/+18% 属实。唯一写入规则是新近性 + 似然,参考实现是无条件覆写

🔴 下一轮最高优先:GATES

2606.03979 点名 GATES 用 consensus-gating「按多条 tutor trace 的一致性门控学习」——一致性是无需 GT 的正确性代理,直接落在我方主张的位置上。若属实需再次收紧。

❗ 覆盖缺口(已在报告中明确标注)

J 族 3 篇 + P 族 2 篇无一条主张通过验证,仍仅摘要级。相关事实(Snell 的"不需 GT"、SPIDER +9%、OPCD 机制、Memory Grafting 数字等)明确标注为不得写入论文


自我推翻清单从 10 条增至 12 条;另沉淀了一套核查 SOP(子串误报清单如 gating ⊂ backpropagating、词边界+substring 双跑、arXiv HTML 曾返回错篇故须用正文水印校验)。

@oratis oratis changed the title research: Learning in Referencing — 6 轮调研 + 10 组实证,含 10 处自我推翻 research: Learning in Referencing — 7 轮调研 + 10 组实证,含 12 处自我推翻 Jul 31, 2026
窄范围 5 篇,Verify 成功执行(100 agent,90 主张 → 25 验证 → 21 确认 4 否决)。
我方预判「GATES 有相当概率构成反例」应验。

★ GATES = arXiv:2602.20574v1 (Stein/Huang/Goldstein, UMD, 2026-02-24)
  三源互证(PDF 水印 + LaTeX e-print + HTML),确认为 GT-free 二值写入准入门:
  · 判据 = k=8 条 tutor rollout 答案一致度 ≥4/8;未过门者
    "contributes zero loss across all objectives"(整体丢弃)
  · 数学确证是硬性准入而非降权:g_i·e_{i,j} 同时在 Eq.1 分子与归一化分母中
    → 被门掉的项从分母消失
  · 作者自陈 "agreement… as a proxy for correctness"、
    "no external teacher or reward model is involved"
  · 亲自划界 "it decides when to distill, not what to answer"
  · 消融:去掉共识门 → student 54.0% / benchmark 31.1%

🔴 且非首创:LMSI (2210.11610, 2022) 早已用多数投票筛选自训练数据,
   明言 "we do not use any ground truth labels to filter";
   GATES 自认 consensus filtering 是 "well-established"。

⟹ 「GT-free 正确性代理 + 准入门控」这一轴彻底失守,不得再主张新颖性。

✅ 但我方在另外两轴存活,新颖性重量全部转移过去:
  (i) 判据类型:全族 MDL/description length/compression 词边界命中 = 0
      (compression 唯一命中在参考文献;bits 是 exhibits 子串)
  (ii) 门控环节:GATES 门作用于训练期数据/梯度准入、固定预生成题集;
       我方作用于推理期按对话者隔离的持久写入

❌ SEAL 不构成反例:奖励需每 context 配带 gold label 的 τ,论文 Limitations
   自述 "prevents RL training of SEAL from scaling to unlabeled corpora";
   且筛选在生成器 RL 训练期,部署写入期无条件聚合应用、完全无门。

✅ Snell 2209.15189 确认为「无门」最近邻:LaTeX 源码级确认目标函数是纯嵌套
   期望,无指示函数/阈值/门控项;穷举扫描全零。
   ⚠️ 但其机制细节描述被 0-3 否决、"SPIDER +9%" 未获核实 → 均不得引用。

★ 一条对我方有利的反向证据:arXiv:2607.08065 大规模审计
  (53 runners × K=50 × 265,000 samples)显示一致性只是弱预测子
  (Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错,
  "Self-consistency is not accuracy… unreliable as a standalone confidence score"
  → 可论证一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。

三条硬性禁令已写入文档:
 1. 不得再写「尚无 GT-free 的写入准入门控」
 2. 不得保留「无外部 oracle」作为独立卖点(攻防上得不偿失)
 3. 用「写入」必须带 scope 注解(推理期/持久/按条)

最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4。
自我推翻清单 12 → 13 条。

剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275)
两轮均未通过验证,若任一含 GT-free 写入侧筛选,声明仍可能被推翻。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 7 轮调研 + 10 组实证,含 12 处自我推翻 research: Learning in Referencing — 8 轮调研 + 10 组实证,含 13 处自我推翻 Jul 31, 2026
oratis and others added 2 commits August 1, 2026 02:17
1. §3.1「无 GT 的概念级正确性一列为空」已被第八轮 GATES 推翻 → 就地标注
   并给出修正后的空白(判据类型=压缩/MDL + 门控环节=推理期持久写入)
2. 自我推翻表第 12/13 条顺序修正
3. 周期更新至 2026-08-01

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Jul 31, 2026

Copy link
Copy Markdown
Owner Author

第八轮:GATES 确认为反例 —— 贡献声明第四次收紧(定稿)

上一条评论里我预判「GATES 有相当概率构成反例」。应验了。

🔴 GATES 是一个 GT-free 的二值写入准入门

arXiv:2602.20574v1(Stein / Huang / Goldstein, UMD)—— PDF 水印 + LaTeX e-print + HTML 三源互证:

  • 判据 = k=8 条 tutor rollout 答案的一致度 ≥4/8;未过门者 "contributes zero loss across all objectives"
  • 数学确证是硬性准入而非降权g_i·e_{i,j} 同时出现在 Eq.1 的分子与归一化分母中 → 被门掉的项从分母消失
  • 作者自陈:"agreement… as a proxy for correctness""no external teacher or reward model is involved"
  • 亲自与推理期方法划界:"it decides when to distill, not what to answer"

且非首创LMSI(arXiv:2210.11610, 2022)早已用多数投票筛选自训练数据,明言 "we do not use any ground truth labels to filter"。GATES 自己承认 consensus filtering 是 "well-established"

✅ 但我方在另外两轴存活 —— 这反而让 delta 更精确

GATES / LMSI 我方
判据类型 答案一致性;全族 MDL/description length/compression 词边界命中 = 0 压缩增益 / MDL
门控环节 训练期数据/梯度准入,作用于固定预生成题集 推理期按对话者隔离的持久写入

❌ SEAL 不构成反例

奖励需每个 context 配带 gold label 的 τ;论文 Limitations 自述这 "prevents RL training of SEAL from scaling to unlabeled corpora"。且筛选在生成器 RL 训练期部署写入期无条件聚合、完全无门

★ 一条对我方有利的反向证据

arXiv:2607.08065 的大规模审计(53 runners × K=50 × 265,000 samples):一致性只是弱预测子(Spearman ρ 0.20–0.59),高一致的 gpt-4.1 在 GPQA 上仍 48% 出错 —— "Self-consistency is not accuracy… unreliable as a standalone confidence score."

⟹ 可论证:一致性类信号 ≠ 压缩类判据,且共识门控的代理效力本身存疑。

🚫 三条硬性禁令(已写入文档)

  1. 不得再写「尚无 GT-free 的写入准入门控」—— 已被彻底证伪
  2. 不得保留「无外部 oracle」作为独立卖点 —— 攻防上得不偿失
  3. 用「写入」必须带 scope 注解(推理期/持久/按条),否则与 GATES 的训练准入不可区分

最终措辞(摘要版 + Related Work 收口版)已定稿写入 REPORT §4


自我推翻清单 12 → 13 条。剩余最大风险面:Prompt Distillation (2412.14964) 与 OPCD (2602.12275) 连续两轮未通过验证——若任一含 GT-free 的写入侧筛选,声明仍可能被推翻。

2412.14964 (Prompt Distillation) 与 2602.12275 (OPCD) 连续两轮(七、八)无一条
主张通过验证,是唯一未闭合的风险面。本轮取得两篇全文(水印校验 v2/v2),
11 条主张 × 3 独立对抗验证者 = 33 票,全部 3-0 确认:

★ 决定性结论:两篇均无 GT-free 的写入侧准入筛选
- 2412.14964:完全无筛(30+ 关键词词边界+substring 双跑穷举零命中;
  gate/gating 9 个 raw 命中全为 mitigate/investigate 子串误报)。噪声答案
  不过滤,靠高温软标签蒸馏吸收。附录 K 的五分位分组是诊断性消融,非管线筛选
- OPCD:唯一筛选「filtered EKD」在 1000 道带 GT 的 math validation / 环境
  得分上打分取最高 → 判据=任务表现,需要标签/oracle,非 GT-free;其明确
  GT-free 的 test-time 设定随机选取,自述 "quality … not pre-evaluated"
⟹ 第八轮定稿贡献声明维持原文;OPCD 反而构成空白存在性的直接文献锚点

同轮确认(解禁,可按收紧措辞写入论文):
- 2412.14964:teacher=同一模型带文档 prompt、LoRA 翻转切换角色、训练无 GT、
  无更强 teacher(更大 expert 反因风格失配变差)
- OPCD:reverse KL + on-policy 机制、两应用(experiential/system prompt)

新增 2 处我方转述收紧(REPORT §4 #14/#15,总数 13→15):
- 「PD 多规模超过 RAG」→ 纯闭卷仅 Squadshifts/Llama-8B 追平;「超过」依赖
  PD+RAG 组合或 PD XL;HotpotQA 上 RAG 对纯闭卷 PD 全面占优
- 「OPCD 更好保留 OOD」→ 边际(+0.1~+0.5,std 内;对 base 持平或微降),
  且 checkpoint 按 test accuracy 挑选,数字受通胀

文档同步:
- REPORT.md:8→9 轮、§2 加第 9 行、§4 加第九轮小节+2 收紧、§5 风险表
  两行合并为一行(仍禁写:Snell/DyPRAG/Memory Grafting)、§6 推进到
  改写 Intro/Related Work → P1/P2、SOP 误报清单补 gate⊂Bagatella
- RESEARCH_KNOWLEDGE_INTERNALIZATION.md:J 族两行 🔍→✅(带收紧措辞)、
  准入门控行改为核实后表述、§8 勾掉 GATES 与两篇核查项、附录 J 更新
- r9/verification.json:33 票原始裁决+逐条证据引文+PDF md5,供审计

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
@oratis

oratis commented Aug 1, 2026

Copy link
Copy Markdown
Owner Author

第九轮定向验证 — 最后风险口闭合 ✅(commit 3d417c8

只查两篇(连续两轮未通过对抗验证的最大风险面):2412.14964(Prompt Distillation)与 2602.12275(OPCD)。全文级(PDF,水印校验 arXiv:2412.14964v2 / arXiv:2602.12275v2,md5 记录在案),11 条主张 × 3 独立对抗验证者 = 33 票全数 3–0 确认

★ 决定性问题:有无 GT-free 的写入侧准入筛选?——都没有

论文 裁决
2412.14964 完全无筛:30+ 关键词词边界+substring 双跑穷举零命中(gate/gating 9 个 raw 命中全为 mitigate/investigate 子串误报,另新收录 gate ⊂ Bagatella 人名误报)。噪声生成答案不过滤,靠高温软标签蒸馏吸收("answers serve as inputs (not direct targets)")。附录 K 五分位分组是诊断性消融,非管线筛选
2602.12275 唯一筛选「filtered EKD」= 在 1000 道带 GT 的 math validation / 128 局文字游戏环境得分上打分取最高 → 判据是任务表现,需要标签/环境 oracle,非 GT-free;触发在蒸馏训练前的数据选择期。其明确 GT-free 的「test-time EKD」设定随机选取,论文自述 "no ground-truth labels are available and the quality of experiential knowledge is not pre-evaluated"

⟹ 第八轮定稿贡献声明维持原文,免于第五次收紧。 OPCD 反而构成反向支持——它把 GT-free 部署场景明确留在「质量不预评」状态,可在 Related Work 中直接引作空白存在性的文献锚点。

同轮确认(两篇解禁,可按收紧措辞写入论文)

  • 2412.14964:teacher = 同一模型带文档 prompt ✅、同一模型 + LoRA 翻转切换角色(rank 512–1024)✅、训练全程无 GT ✅、无更强 teacher(更大 expert 反因风格失配变差)✅
  • OPCD:reverse KL + on-policy 机制(学生无 context 采样自身轨迹、top-256 学生词表)✅、两应用(experiential / system prompt distillation)✅

新增 2 处我方转述收紧(§4 #14/#15,自我推翻总数 13 → 15)

  1. 「PD 多规模超过 RAG」→ 纯闭卷仅 Squadshifts/Llama-8B 追平;「超过」依赖 PD+RAG 组合(三规模)或 PD XL(Squadshifts 均值);HotpotQA 上 RAG 对纯闭卷 PD 全面占优
  2. 「OPCD 更好保留 OOD」→ 边际(对 off-policy CD 仅 +0.1~+0.5、落在 std 内;对 base 持平或微降),且 checkpoint 按 test accuracy 挑选(A.3/B.2),数字受通胀

状态与下一步

  • 仍禁写(仅摘要级):Snell 2209.15189 机制细节与「SPIDER +9%」、DyPRAG 2503.23895、Memory Grafting 2605.20948
  • §6 已推进:① 按第八轮定稿措辞改写 Introduction / Related Work → ② 进 P1/P2(构造语言生成器 → 三臂对照 → 记忆层 + 隔离测试)
  • 原始裁决(33 票 + 逐条证据引文 + PDF md5)存于 research/learning-in-referencing/r9/verification.json

🤖 Generated with Claude Code

oratis and others added 2 commits August 1, 2026 12:24
一、第十轮验证(5 篇全文 / 17 主张 / 51 票):仅摘要级清零
- Generative Adapter 2411.05877v1:单次前向机制+无门+数字全确认;
  但「天然按用户隔离」被收紧(1C/2CORR)——论文无 isolation 一词、无跨用户
  测试,跨会话复用也是架构性而非纵向演示 → REPORT §4 #16。
  反而保住我方 P4 空间:「按对话者隔离并实测无泄漏」仍无人做
- When Context Returns 2606.11627v1:内化不幂等升级为 ✅(7/12 设定退化;
  修复 NCA 11/12;scope=仅系统提示/游戏脚手架,未测文档)
- Snell 2209.15189v1:七轮 0-3 悬案解决——机制精化(token 级 KL 到冻结
  自身副本,非硬标签微调)+「SPIDER +9%」精确化(8-shot 比 GD 基线 +9.0 点,
  非对 teacher)
- DyPRAG 2503.23895v4:我方「多文档 LoRA 平均互相干扰」系误读,如实改正
  (REPORT §4 #17)——论文称平均有效整合,衰退归因无关冗余+有损压缩
- Memory Grafting 2605.20948v1:定性修正为预训练容量扩展方法;写入侧仅
  频率覆盖筛选(质量盲),非正确性门
- 自我推翻总数 15→17;无一篇含正确性写入门 → 空白声明再获确认

二、Introduction / Related Work 投稿草案 v1(paper/DRAFT_INTRO_RELATED_WORK.md)
- 按第八轮定稿措辞:GATES/LMSI 正面让位、OPCD "not pre-evaluated" 作
  空白锚点、E1/E2 划界、三条禁令全稿自查表 + 措辞红线速查
- RESEARCH doc §9.3.1 旧 C1 与 §9.3.2 旧段就地标注已被推翻/替代

三、两个内化风险写进实验设计
- DESIGN_COMPRESSION_GATE §3 新增失败模式 #11(内化不幂等,✅)与
  #12(迭代坍缩,🔍 2606.04703 引用前须 3 票)
- DESIGN_CONCEPT_BENCH §7 新增指标 8(重现幂等性)与 9(迭代巩固坍缩曲线,
  gate-on vs gate-off——若推迟坍缩即门价值第二论据)

四、P1 构造语言生成器脚手架(research/learning-in-referencing/p1/)
- lexicon(CV(C) 音系+阻断表+编辑距离;分词器/探针钩子留待模型环境)
- microworld(13 kind × 4 色 × 3 尺寸 × 4 材料,4 范畴群)
- gavagai G1-G5 程序化构造:教学集外延一致由构造保证,不变量测试全过
  (T1 外延一致/T2 分离样例/T3 过滤/T4 确定性/T5 留出未见/T6 overspec)
- 已生成 items_p1.json(40 items)+ isolation_p1.json(8 冲突词隔离对)

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 14 组实证,四性质端到端 + L4 参数化内化 research: Learning in Referencing — 11 轮调研 + 15 组实证,四性质端到端 + L4 参数化内化(含 21 处自我推翻) Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

P6 — I2 组合性:我方自设的限制被自己的实验推翻(自我推翻 #21

五判据里最后一条未验证的(I2 组合性)已测。前面所有探针都来自同源微世界——那测的是泛化,不是组合

跨域探针要求两步组合:① a ripe banana 是 yellow(预训练世界知识)× ② romi = yellow(推理期习得)⟹ Is a ripe banana romi? 从未被明说

域内探针 ★ 跨域探针
base(无概念、无记忆) 0.485 0.500
L1 上下文注入 1.000 0.840
L4 参数化记忆 0.992 0.949
L4 − base +0.507 +0.449
L4 − L1 −0.008 +0.109

前置检查:base 对这些真实物体颜色的世界知识命中 1.00(否则实验无意义)。

🔴 这推翻的是我方自己声明的限制

P5 §4 写过「final-layer memory 缺深度组合性」,并据此在 Method 草稿 §6(i) 写入 "we do not verify criterion I2"
该断言从架构位置推测、从未实测——一测就反了。现已撤回,只保留结构事实:不参与中间层表征计算

⟹ 新增纪律:自己声明的「限制」也必须做实验。未测的限制和未测的优点一样不可信。

⚠️ 三条必须同时写清的限定

  1. base 跨域 0.500 是构造性的:冲突对对称(A 的 Yes 项正是 B 的 No 项),逐用户范围 [0.062, 0.938] 相互抵消 → 说明探针集跨用户平衡不代表 base 校准良好
  2. 只测了「概念 ⊗ 世界知识」:概念⊗概念、否定/量化、多跳组合全部未测不得泛化为「具备组合性」
  3. L4 为何反超 L1 是假说、未做消融(猜测上下文注入干扰了世界知识检索)——引用须标 hypothesis。

五判据最新状态

判据 状态
I1 免检索 ✅ P5(0.485 → 0.992)
I2 组合性 部分成立 — 与世界知识 ✅;概念间未测
I3 隐式触发 🔴 未测
I4 跨会话持久 ✅ P4/P5
I5 抗干扰 🔴 未测
(隔离) ✅ P3/P4/P5

同步范围

REPORT §3.9 + 自我推翻表(20 → 21 处)+ §0.2/0.4/0.5/§5/§6/§7;Method 草稿 §5.6/§6(i)/禁令 10;全景文档 L0–L5 表的 I2 列首次回填实证p5/README.md §1 与 memory_layer.py 的残留(由一致性审计器抓到);审计器新增 #21 两条规则并重跑 → 0 处残留

📌 research/learning-in-referencing/p6/README.md

oratis and others added 2 commits August 3, 2026 23:27
换 torch/transformers 环境后重跑 P6 时发现的。逐用户跨域 AUC 16/16 完全复现
(0.949、0.840、0.992、1.000 逐位相同,torch 2.13 + transformers 5.14),
但前置检查那一行:

  脚本实际打印 → red 3/4 · blue 3/4 · yellow 3/4 · green 2/4
                 平均 0.69 —— ⚠️ 世界知识不足,跨域结论受限
  我写进文档的 → 平均命中 1.00 ✅

数字错,判据也错。判据错在**重犯了 P3 的 No 偏置坑**:模型对 Yes/No 题有系统性
No 偏置,16 个【正确】颜色配对里有 5 个 p_yes < 0.5,尽管与负例分得很开(负例低至
0.001)。改用本项目已确立的阈值无关 AUC → 0.891(red .958/yellow .917/green .854/
blue .833)。⟹ **P6 结论不变**,世界知识确实可用。

修正范围:p6 脚本改用 AUC 判据并保留 raw 命中率作为偏置证据;p6/README、REPORT §3.9、
Method 草稿 §5.6 的数字与判据;REPORT §0.4 加一行"差点犯的错"。

★ 结构性防复发:新增 tools/probe_metrics.py。P3 那次的教训写进了报告**但没有变成代码**,
于是第二次照犯。auc() 是判据,hit_rate() 只作偏置证据且注释里写明不得当判据。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
I2 的最后一格补上了。同一用户学两个概念(颜色+材质,各自独立教学),
探针问从未教过的合取句式 `Is X both w1 and w2?`:

  base 0.479 → L4 合并训练 0.889 → L1 上下文 0.986   (单概念策略上界 0.500)
  前置检查:基座对真词的同句式合取 AUC 0.973;L1 min 0.986 ⟹ 任务本身可解

🔴 自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750
   (负例"只中 w1"那半与正例在 w1 上同分布贡献 0.5,"只中 w2"那半被 w1 拒掉贡献 1.0)。
   修法:判据拆成 conj|¬w2 与 conj|¬w1 两半取 min——单概念策略在此必 ≈ 0.5。
   裁决线设错会把单概念策略误判成组合。

⚠️ 自我推翻 #23:P5 的「分区解决了干扰」只对【跨用户】成立。
   同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。

★ 修法来自诊断而非猜测(子区版失败后先查):
   · w1 的槽 values 最大改动量 0.00e+00 → 梯度掩码有效,槽分毫未动
   · w1 探针 25% 的 top-4 落进 w2 子区 → **检索跨了区**
   ⟹ 分区必须同时作用于写入与检索。P5 之所以成功,正因为那里检索本来就按 uid 掩了。
   双掩码后 Δ +0.000,且每概念只有 16 槽(< seq 的 32)⟹ 容量解释被排除。

🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条:
   只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。

⚠️ 代价 —— 全景文档新增第二条张力:**可隔离性 ↑ ⟹ 组合性 ↓**
   严格按概念分区保住了单概念(0.927, Δ 0.000)却把合取压到 0.653(合并训练 0.889)。
   ⟹「顺序到达 + 强组合」目前无解,已写进 §6(i) limitations。

顺带修两个工具缺陷:
  · memory_layer 加可选子区掩码(P5 结果 JSON 逐字节相同,向后兼容已验证)
  · 审计器在子目录下会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根 + <10 份即拒绝结论

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 15 组实证,四性质端到端 + L4 参数化内化(含 21 处自我推翻) research: Learning in Referencing — 11 轮调研 + 16 组实证,四性质端到端 + L4 参数化内化(含 23 处自我推翻) Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

更正 + P7

🔴 先更正上一条评论里的一个数字

上一条我写「世界知识前置检查命中 1.00 ✅」。错的。 换 torch/transformers 环境重跑时发现,脚本实际打印的是:

red 3/4 · blue 3/4 · yellow 3/4 · green 2/4
平均 0.69 —— ⚠️ 世界知识不足,跨域结论受限

我把脚本的警告当成了通过。 而且判据也错——重犯了 P3 的 No 偏置坑(16 个正确颜色配对里 5 个 p_yes < 0.5,尽管负例低至 0.001)。改用阈值无关 AUC:0.891P6 结论不变,世界知识确实可用。

P6 本身在新环境下逐用户 16/16 完全复现(0.949 / 0.840 / 0.992 逐位相同)。

结构性防复发:新增 tools/probe_metrics.py。P3 的教训写进了报告但没变成代码,所以第二次照犯。


P7 — 「概念 ⊗ 概念」(I2 的最后一格)

同一用户学两个概念(颜色 + 材质,各自独立教学),探针问从未教过的合取句式 Is X both w1 and w2?

概念1 概念2 ★ min(两半)
base 0.510 0.444 0.479
L1 定义进上下文 0.997 0.997 0.986
L4 合并训练 0.812 0.889 0.889
L4 顺序·共享 32 槽 0.590 0.931 0.750
L4 顺序·子区(只掩梯度) 0.483 0.826 0.576
★ L4 顺序·子区(写入+检索都掩) 0.927 0.847 0.653
单概念策略 0.500

自我推翻 #22:初稿把单概念策略上界算成 0.500,实为 0.750。判据必须拆成 conj|¬w2conj|¬w1 两半取 min——单概念策略在此才必然 ≈ 0.5。裁决线设错会把单概念策略误判成组合。

🔴 自我推翻 #23:P5 的「分区解决了干扰」只对跨用户成立

同一分区内顺序写第二个概念会冲掉第一个:0.951 → 0.590(Δ −0.361)。

修法来自诊断而非猜测——子区版失败后(Δ −0.351,几乎等于不分区)先查:

检查 结果
w1 的槽 values 最大改动量 0.00e+00 → 梯度掩码有效,槽分毫未动
w1 探针 top-4 落在 w2 子区的比例 25% ← 决定性证据

分区必须同时作用于写入与检索。 P5 之所以成功,正因为那里检索本来就按 uid 掩了——子区破坏了这个对称性。双掩码后 Δ +0.000,且每概念只有 16 槽 < seq 的 32容量解释被排除

🔴 但 Δ 0.000 是构造性的,不得报作"抗遗忘"。非构造性的只有两条:只掩写入不够(−0.351 ≈ 不分区的 −0.361);修好它的那版容量更少。

⚠️ 代价:新的一条张力

可隔离性 ↑ ⟹ 组合性 ↓。严格按概念分区保住了单概念(0.927,Δ 0.000),却把合取压到 0.653(合并训练 0.889)。组合要两个概念在同一次检索里都被取到,隔离要它们永不相见——要求正好相反

「顺序到达 + 强组合」目前无解,已写进 §6(i)。另:L4 全线低于 L1(0.889 vs 0.986),参数化路线在组合上确有代价,未加掩饰。

五判据

判据 状态
I1 免检索 ✅ P5
I2 组合性 两种形态(P6 ⊗世界知识、P7 ⊗概念);否定/量化/多跳/同属性内两概念未测
I3 隐式触发 🔴 未测
I4 跨会话持久 ✅ P4/P5
I5 抗干扰 🔴 未测
隔离 ✅ 跨用户;◐ 用户内部需子区+双掩码,代价是组合性

顺带修了审计器一个缺陷:在子目录下跑会扫到 0 份文档却打印 ✅(假放行)→ 路径锚到仓库根,<10 份即拒绝给结论。

📌 p7/README.md

五判据最后两格。I5 ✅,I3 ❌,而后者的机制把前面所有结论统一了起来。

【I5 抗干扰 ✅】上下文塞进另一位老师的含义("in some dialects, w means …"):
     base 0.545 → 0.033   ← 关键对照:base 没有概念,照单全收,答案系统性反向
     L1   0.988 → 0.912   (−0.075)
     L4   0.960 → 0.910   (−0.050)  ⟹ 参数化比上下文注入更抗干扰
   base 那一行证明了干扰确实有效——L4 扛住不是因为模型没读它。

【I3 隐式触发 ❌】不问定义、要求去用(二选一行动题,训练中没有的句式):
     base 0.500 · L1 1.000 · 真词先验 1.000 · ★ L4 0.507   ⟹ 零迁移

🔴 判据在这里又错了一次:初版只报 accuracy(0.492),而伪词条件下模型 91% 选 A,
   阈值法被偏置钉死在 0.5。这是 P3(No 偏置) → P6(前置检查) → P8(A 偏置) 同一类
   仪器错误的第三次,且专为此抽出的 probe_metrics.auc 当时已 import、只用在了 I5 上。
   ⟹ 抽出工具还不够,判据必须在每个新度量上被显式选择一次。改 AUC 后结论不变,
      但那是运气不是方法。

★ 机制(先诊断,不猜)—— 否掉了"检索没取到":
     行动题 top-4 落在训练用过的槽的比例 : 0.750   ← 取到了
     cos(m(h), W_yes−W_no)              : +0.7926
     cos(m(h), W_A−W_B)                 : +0.0027   ← 近乎零
     两读出方向本身余弦                    : −0.0265
     ‖m(h_act)‖ = 14.279                             ← 不是太小,是方向不对
   ⟹ 记忆学的是"这个决策格式下往哪边推",不是概念。

★ P8b 回应显然的反驳「多训几种格式不就行了」——可证伪,测了:
     训 F1     : F1 0.960 · F2 0.555 · F3 0.755(held-out)
     训 F1+F2  : F1 0.902 · F2 0.795 · F3 0.645(held-out)
   加训 F2 使 F2 +0.240,却让 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。
   更有力的是同序关系:只训 F1 时迁移量随读出方向余弦单调
     余弦 1.000 → 0.960 · +0.1065 → 0.755 · −0.0265 → 0.555 ≈ base
   ⚠️ 只有三个点,同序而已,不得写成拟合出来的定律。

🔑 这条回溯限定了 P5–P7:它们的训练与探针全在同一个读出方向内。
   P6 变的是表层内容、P7 变的是表层句式,读出方向都没变;P8 变的正是读出方向。
   ⟹ 精确主张只有一条:**概念能跨表层句式迁移,不能跨读出方向迁移**。
      「泛化 ✅ / 组合 ✅ / 隐式触发 ❌」是同一条机制的三个侧面。
      论文中每条结论都须带作用域「在教学所用的决策格式内」。

✅ 副产品:第一次给「中间层记忆」提供了实证动机(而非审美偏好)——
   P5 曾错误声明的"缺深度组合性"已被 P6 撤回,现在有了正确版本且是测出来的。
   ⚠️ 但中间层版本未做,不得声称它能解决。

诊断脚本入库(p8/diag_i3_mechanism.py、p7/diag_subpart_failure.py);
审计器加 #24 两条规则;Method 草稿 §5.8 + §6(i) 重写 + 禁令 13–15;
全景文档 L0–L5 表的 L4 行 I3=✓ 加硬前提。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 16 组实证,四性质端到端 + L4 参数化内化(含 23 处自我推翻) research: Learning in Referencing — 11 轮调研 + 18 组实证;I3 不成立,机制=读出方向(含 24 处自我推翻) Aug 3, 2026
@oratis

oratis commented Aug 3, 2026

Copy link
Copy Markdown
Owner Author

P8 — 五判据最后两格:I5 ✅ / I3 ❌,且 I3 的机制把前面所有结论统一了

I5 抗干扰 ✅

上下文里塞进另一位老师的含义Note: in some dialects, w means <对方>.):

无干扰 无关长文 ★ 冲突定义 降幅
base 0.545 0.525 0.033 −0.513
L1 上下文注入 0.988 0.917 0.912 −0.075
L4 参数化记忆 0.960 0.953 0.910 −0.050

关键对照在 base 那一行:base 没有概念,那条注释是它唯一的定义来源,于是照单全收、答案系统性反向(0.033)。⟹ 干扰被证明有效,L4 扛住不是因为模型没读它。参数化比上下文注入抗干扰。

🔴 I3 隐式触发 ❌ —— 干净的负结果

不问定义,要求去用(二选一行动题,训练中从未出现的句式):

★ AUC accuracy 选 A 比例
base 0.500 0.488 0.910
L1 定义进上下文 1.000 0.988 0.496
真英语词先验 1.000 0.979 0.479
L4 参数化记忆 0.507 0.492 0.914

零迁移。 任务完全可解,参数化记忆没有任何效果。

🔴 判据在这里又错了一次:初版只报 accuracy,而伪词条件下模型 91% 选 A,阈值法被偏置钉死在 0.5。这是 P3(No 偏置) → P6(前置检查) → P8(A 偏置) 同一类仪器错误的第三次,而且专为此抽出的 probe_metrics.auc 当时已经 import、却只用在了 I5 上。改 AUC 后结论不变——但那是运气不是方法。⟹ 抽出工具还不够,判据必须在每个新度量上被显式选择一次

★ 机制:不是检索失败,是读出方向

观测 判读
行动题 top-4 落在训练用过的槽的比例 0.750 ✅ 检索取到了 ⟹ H_route 被否
cos(m(h), W_yes − W_no) +0.7926
cos(m(h), W_A − W_B) +0.0027 ← 近乎零
两读出方向本身的余弦 −0.0265 近乎正交
‖m(h)‖ 14.279 不是太小,是方向不对

记忆学的是「这个决策格式下该往哪边推」,不是概念。

P8b — 回应「那多训几种格式不就行了」

H_readout 对此有可证伪的预言,直接测:

F1 Yes/No F2 A/B F3 True/False(始终 held-out
base 0.540 0.550 0.510
L1 定义进上下文 0.960 1.000 1.000
L4 训 F1 0.960 0.555 0.755
L4 训 F1+F2 0.902 0.795 0.645

加训 F2:F2 +0.240,但 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。

比裁决更有力的是同序关系——只训 F1 时,迁移量随读出方向余弦单调:

测试格式 与 F1 的余弦 AUC 相对 base
F1 Yes/No 1.000 0.960 +0.420
F3 True/False +0.1065 0.755 +0.245
F2 A/B −0.0265 0.555 +0.005 ≈ 0

⚠️ 只有三个点,顺序一致而已,不得写成拟合出来的定律。

🔑 这条回溯限定了 P5–P7

实验 变的是 结果
P6 跨域探针 表层内容 · 同读出方向 ✅ 0.949
P7 合取探针 表层句式 · 同读出方向 ✅ 0.889
P8 I3 读出方向 ❌ 0.507

精确主张只有一条:概念能跨表层句式迁移,不能跨读出方向迁移。
「泛化 ✅ / 组合 ✅ / 隐式触发 ❌」不是三个互不相干的结论,是同一条机制的三个侧面
论文中 P5–P7 每条结论都已加作用域「在教学所用的决策格式内」(禁令 13)。

✅ 副产品:中间层记忆第一次有了实证动机

P5 曾错误声明 final-layer memory「缺深度组合性」(已被 P6 推翻撤回)。现在有了正确版本,而且是测出来的:它只在输出层动手,学到的东西天然绑死在训练任务的读出方向上。⚠️ 但中间层版本未做,不得声称它能解决(禁令 15)。

五判据最终状态

判据 状态
I1 免检索 ✅ P5
I2 组合性 ✅ 两种形态(P6/P7)—— 限于同一读出方向内
I3 隐式触发 不成立(0.507),且不是调参能补的
I4 跨会话持久 ✅ P4/P5
I5 抗干扰 优于上下文注入
隔离 ✅ 跨用户 · ◐ 用户内部(需双掩码,代价是组合性)

📌 p8/README.md · 诊断脚本 p8/diag_i3_mechanism.py

oratis and others added 4 commits August 4, 2026 02:49
fig1 判据类型 × M′ 宽度分层 —— 压缩增益 0.915/0.883/0.766 vs 语义熵 0.269/0.137/0.507
fig2 五判据 × 参数化 vs 上下文注入 —— I3 那一格灰底标 fails
fig3 (a) 迁移量 vs 读出方向余弦  (b) 记忆插入位置(P9 跑完后自动补全)

🔴 出图时抓到一处会与正文打架的错:我先用了**配对胜率**,得核心域 0.958 / 0.208,
   而正文引用的是**汇总 AUC** 0.915 / 0.269 —— 两个不同的统计量。
   已改为与 p2_three_arm.py 的 report() 同一估计量,并加了闸门:
   图上的核心域数值若与 p2 自己产出的 summary 差 >1e-6 即 sys.exit 拒绝出图。

分层口径与 p2/README §3.2 严格一致(M′ 更窄 = G1 合取 + G2 范畴层级)。
灰度可读,不靠颜色区分;单栏 3.3in / 8pt。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
⚠️ 本 commit 只落原始结果与脚本;**解释待 P9b 词绑定控制**(正在跑,见下)。

只训 F1 Yes/No,F2 A/B 与 F3 True/False 始终 held-out:

  插入位置            F1(训练)  F2      F3      跨方向均值
  base               0.540   0.550   0.510   0.530
  L1 定义进上下文       0.960   1.000   1.000   1.000
  ★ L7 全位置         0.945   0.935   0.945   0.940
  ◇ L7@last          0.820   0.565   0.600   0.583
  post-norm(=P5–P8)  0.970   0.555   0.770   0.663

✅ P8 的推论成立:中间层比 post-norm 高 +0.277,几乎追平上下文注入。

🔴 但控制条件否掉了「深度」这个解释:L7@last(同样在 L7、其上同样有 20 层去变换它,
   只是**仅改最后一个位置**)只有 0.583,**比 post-norm 还低 0.080**。
   ⟹ 增益来自**位置覆盖**——记忆必须改写**描述物体的那些 token** 的表征,
      而不是在决策点上加偏置。没有这个控制,这条结论会被一句话打掉。

🔴 而这恰好打开一个新漏洞:既然它改写物体表征,它可能只学会了「给蓝色物体打标」、
   根本没绑定到那个词。三种格式全过也解释得通。⟹ P9b 换词控制已启动,
   在它出结果之前**不写任何「学到了一个概念」的结论**。

工程:
· 正确性闸门 —— 批处理左填充必须显式传 position_ids,否则 rotary 整体移位;
  实测与逐条前向最大 logit 偏差 8.77e-05、argmax 5/5,不过闸门即 sys.exit。
· 每条件即时落盘 + --preload 合并(上一轮中断白跑 99 分钟的教训),
  合并时核验重算的 base/L1 与 preload 逐位相同(差 ≥1e-6 即拒绝)。
· 未测:L14/L21 深度曲线(单条件 ~99 分钟,本轮裁掉)。

fig3(b) 补全插入位置对比。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9 说"概念能跨读出方向迁移"。那个结论有个明显漏洞我自己去堵,结果堵塌了。

控制:训练完全不变,**只把提示里的伪词换成另一位用户的伪词**,其余一字不改。

  插入位置      提示里的词        F1      F2      F3
  L7          本词            0.945   0.935   0.935
              ★ 换成别人的词     0.930   0.895   0.935     落差均值 0.018
  post-norm   本词            0.970   0.555   0.770
              ★ 换成别人的词     0.975   0.505   0.765     落差均值 0.017

⟹ **两个方案都不是"学会了一个词的含义",而是"给一类物体打了标"。**
   L7 的跨格式迁移之所以成立,正因为被打标的是**物体表征**——任何读出格式都能读到它。
   这与 P9 查到的"增益来自位置覆盖"完全自洽,但把结论的性质整个改变了。

🔴 波及范围:所有**每个用户只教一个概念**的实验(P5 I1、P6 I2⊗世界知识、P8 I5、P9)。
   在那些设置里,「w 指蓝色」与「给蓝色物体打标」**在训练集上外延完全相同**——
   梯度没有任何理由去关心那个词。**是实验设置欠定,不一定是方法的性质。**

★ 唯一可能的例外是 P7(每人两个词,同一物体在两词下标签不同,光打标不可能同时高分)。
  P9c 正在直接验这一点(三档换词:本词 / 换成同用户的另一个词 / 换成别人的词)。
  **在 P9c 出结果之前,不得写任何"学到了一个概念"的结论。**

工程:本轮把训练好的记忆存盘(P9 没存,导致这个控制不得不整个重训);权重不入库。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
P9b 之后剩一个可能的辩解:单概念设置**欠定**(一个词时"w 指蓝色"与"给蓝色物体
打标"在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——
直接测,全部针对 w1 的探针与 w1 的标签:

  提示里用的词          F1      F2      F3
  w1(本词)          0.785   0.505   0.695
  ★ 换成同用户的 w2    0.790   0.570   0.645
  换成别人的词         0.790   0.515   0.675
  own − within      -0.005  -0.065  +0.050
  (前置:w2 自己的探针 0.890 —— 两个词都"学会"了,不是没学会导致的)

⟹ 两概念也逼不出词绑定。

★ 机制诊断(diag_word_independence.py)—— 两个方案因**不同原因**失败:
                          L7        post-norm
  m(h) 换词后余弦        0.99998      0.787
  路由命中槽重合率        1.000        0.957
  决策方向上的投影          —      +1.690 → +1.047
  ★★【正例−负例】投影差    —      +4.443 → +4.327(保留 97%)

  L7        路由层面就看不见那个词。
  post-norm 看得见词,但 AUC 只看排序,而判别分量保留 97% ⟹ 词只平移偏置。

🔴 我在这里差点得出相反结论:只看 m(h) 余弦 0.787 会判成"路由读到了词 ✅"。
   是补了"决策方向上的正负例投影差"才发现变化分量与判别正交。
   ⟹「输出变了」不等于「行为变了」;度量必须对准被解释的那个量。

措辞处置:
· REPORT 顶部加最高优先级警告 + §3.12 + 自我推翻 #25
· p5/p6/p7/p8 四页 README 加降级横幅
· Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17
· 审计器加 #25 两条规则(中英各一),并把 🔴 补进 ALLOW
· 能站住的只有:「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」
· 不受影响:压缩增益门(P0–P4,概念以文本存在、词是显式的)、按对话者隔离(P3/P4)

修法方向(全部未做,不得声称已解决):键取在**词的 token 位置**而非整段末位;
让**两个词在同一物体上给出相反标签**(P9c 方向对但强度不够——两词问不同属性,
一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title research: Learning in Referencing — 11 轮调研 + 18 组实证;I3 不成立,机制=读出方向(含 24 处自我推翻) research: Learning in Referencing — 22 组实证;🔴 换词控制推翻了参数化记忆线的「概念」解读(25 处自我推翻) Aug 4, 2026
@oratis

oratis commented Aug 4, 2026

Copy link
Copy Markdown
Owner Author

🔴 P9 / P9b / P9c — 我把自己整条参数化记忆线推翻了

先是好消息:P8 的推论成立

把记忆从输出层移到中间层,跨读出方向迁移成立。而且控制条件查清了真正的原因:

插入位置 F1(训练) F2 F3 跨方向均值
base 0.540 0.550 0.510 0.530
L1 定义进上下文 0.960 1.000 1.000 1.000
L7 全位置 0.945 0.935 0.945 0.940
L7@last(只改最后位置) 0.820 0.565 0.600 0.583
post-norm(=P5–P8) 0.970 0.555 0.770 0.663

L7@last 同样在 L7、其上同样有 20 层,只是仅改最后一个位置0.583,比 post-norm 还低。⟹ 增益来自位置覆盖(改写描述物体的 token),不是深度

然后这条结论自己打开了漏洞,我去堵,堵塌了

既然它改写的是物体表征,就可能只学会了「给蓝色物体打标」、根本没绑定到那个词。控制:训练不变,只换提示里那个伪词

插入位置 本词 → 换成别人的词 落差均值
L7 0.945/0.935/0.935 → 0.930/0.895/0.935 0.018
post-norm 0.970/0.555/0.770 → 0.975/0.505/0.765 0.017

还剩一个辩解:单概念设置欠定(一个词时「w 指蓝色」与「给蓝色物体打标」在训练集上外延完全相同,那个词是常量、零信息)。P7 的两词设置是唯一例外——直接测,也不行

提示里用的词 F1 F2 F3
w1(本词) 0.785 0.505 0.695
换成同用户的 w2 0.790 0.570 0.645
own − within −0.005 −0.065 +0.050

前置:w2 自己的探针 0.890,两个词都"学会"了 ⟹ 不是没学会导致的。

机制:两个方案因不同原因失败

观测 L7 post-norm
m(h) 换词后余弦 0.99998 0.787
路由命中槽 换词后重合率 1.000 0.957
决策方向上的投影 +1.690 → +1.047
★★ 【正例−负例】投影差 +4.443 → +4.327(保留 97%)
  • L7:路由层面就看不见那个词
  • post-norm看得见词,但 AUC 只看排序,而判别分量保留 97% ⟹ 词只平移偏置。

🔴 我在这里差点判反:只看 m(h) 余弦 0.787 会得出"路由确实读到了词 ✅"。是补了决策方向上的正负例投影差才发现变化分量与判别正交。⟹「输出变了」不等于「行为变了」。

处置

必须撤回:参数化记忆线不得写"学会了一个词 / 建立了一个概念"。
能站住的只有:「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」。

受影响 不受影响
P5 I1 · P6 I2⊗世界知识 · P7 I2⊗概念 · P8 I5 · P9 跨读出方向 的概念性解读 压缩增益门(P0–P4)——那条线里概念以文本存在、词是显式的
按对话者隔离(P3/P4)——隔离的是分区,与绑定到什么无关

已落地:REPORT 顶部最高优先级警告 + §3.12 + 自我推翻 #25;p5–p8 四页 README 加降级横幅;Method 草稿加 SCOPE CORRECTION + §6(0) + 禁令 16/17;审计器加 #25 中英两条规则。

修法方向(全部未做,不得声称已解决):键取在词的 token 位置而非整段末位;让两个词在同一物体上给出相反标签(P9c 方向对但强度不够——两词问不同属性,一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。

📌 p9/README.md · 诊断 p9/diag_word_independence.py

oratis and others added 3 commits August 4, 2026 14:19
设计把 P9c 的后门焊死:w1=颜色A、w2=颜色B,训练物体只取这两色
⟹ 同一物体在两词下标签**严格相反** ⟹ 只看物体的策略在数学上恰好 0.500。
训练准确率本身就是判据。

结果(8 用户 / 900 epoch / post-norm):训练 acc **0.974**

  提示里的词              F1      F2      F3
  w1(本词)            0.770   0.535   0.595
  ★ 换成 w2(含义相反)    0.350   0.515   0.450
  换成别人的词           0.380   0.510   0.530

✅ 绑定是真的:换成含义相反的词后 F1 掉到 0.350 —— 低于随机,是**答案跟着词翻转**,
   不是失效。P9b/P9c 里落差只有 0.017/−0.005,完全看不到这个。
⟹ #25 的**原因**改写为「我们没让它必须做到」,但**撤回本身不变**:
   P5–P9 跑的仍是欠定设置,测到的仍是与词无关的物体级偏置。

⚠️ 差点犯的错:60 epoch 时训练 acc 0.542 ≈ 只看物体的上限,按判据就是"架构不能",
   而且会直接推出一条不必要的架构修改建议。加了训练曲线检查点才发现不是:
     ep150 0.771 → ep300 0.891 → ep600 0.943 → ep900 1.000
   **P5–P9 全部用的 300 步恰好落在还没收敛处。**
   已把这条写成硬分支:末段仍在上升 >0.03 时输出 ⚪ 不可判,不允许下结论。

🔴 代价两条:
   · held-out 泛化 0.992(P5 不强制)→ 0.770。⚠️ 非严格控制(训练量翻倍、任务更难),
     不得归因为"绑定必然损害泛化",只能说本设置下同时成立。
   · 跨读出方向**消失**(F2 0.535 / F3 0.595 ≈ 随机)。与 P8 的机制一致——
     P9 在 post-norm 上还有 F3 0.770,是因为没绑定时那个物体级标本身跨格式可读;
     一旦逼它条件化于词,这条便车就没了。
   ⟹ **在 post-norm 上「绑定」与「跨格式」互斥**。L7 能否兼得,L7 臂正在跑。

工程:每个**用户**跑完即落盘 + --merge 合并(P9 丢过 99 分钟、P10 又整条臂丢过,第三次才修)。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
L7 中间层在强制设置下**真的绑定到词了**,而且比 post-norm 干净得多:

  臂                   训练acc   F1      F2      F3
  base                  —     0.585   0.540   0.525
  L1 定义进上下文          —     0.855   0.905   0.995
  post-norm 本词        0.974   0.770   0.535   0.595
  post-norm 换相反词             0.350   0.515   0.450
  ★ L7 本词            1.000   0.925   0.545   0.670
  ★ L7 换相反词                 0.070   0.410   0.290

  换词落差:L7 −0.855(0.925→0.070,不是失效,是答案跟着词整个翻过去)
           post-norm −0.420 · P9b 未强制时仅 −0.018

🔴🔴 但跨读出方向随之消失:L7 的 F2 0.545 / F3 0.670,base 是 0.540 / 0.525;
    而 P9 **未绑定**时是 0.935 / 0.945。
    ⟹ **P9 那个漂亮的跨格式迁移,正是"没绑定到词"换来的**——
       未绑定时记忆给**物体表征**打了个与词无关的标,任何读出格式都能读到。

★ 四格全测下来,从来没有一格同时拿到两者:
                          绑定到词        跨读出方向
  post-norm + 欠定(P5–P8)  ❌ 0.017       ❌
  L7 + 欠定(P9)            ❌ 0.018       ✅ 0.940
  post-norm + 强制(P10)    ◐ −0.420      ❌ 0.565
  L7 + 强制(P10)           ✅ −0.855      ❌ 0.608
  L1 上下文注入             ✅ 构造上必然    ✅ 0.905/0.995
  ⟹ 参数化路线最多只拿到其一;上下文注入两者都有。**该路线目前最强的负面证据。**

补的两处方法学漏洞:
· base/L1 参照臂(主脚本初版漏了)——逐用户 base 的 F1 从 0.240 到 0.880 都有,
  个别用户像"F3=0.080"这种极端值大半来自基座,不可单独解读。新增 p10_ref_arms.py。
· 两臂优化量不对等:900 步是为 post-norm 定的(它 ep900 才收敛),
  而 L7 在 ep150 就 loss 0.000 ⟹ 过训 6 倍,逐用户 held-out F1 方差极大(含一个 0.48)。
  早停版未测,已写进限制。

同步:REPORT 顶部警告 + §3.13 + 自我推翻 #26 + §0.4 两条新的"差点犯的错";
Method 草稿 SCOPE 补充 + §6(0-b) + 禁令 18/19。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Aug 4, 2026

Copy link
Copy Markdown
Owner Author

P10 强制词绑定 —— 能绑定了,但跨格式随之消失(自我推翻 #26

P9b/P9c 的失败可能是设置欠定(一个词时「w 指蓝色」与「给蓝色物体打标」外延完全相同,那个词是常量、零信息)。P10 把后门焊死:w1 = 颜色 A、w2 = 颜色 B,训练物体只取这两色 ⟹ 同一物体在两词下标签严格相反 ⟹ 只看物体的策略在数学上恰好 0.500,训练准确率本身就是判据。

训练 acc F1 Yes/No F2 A/B F3 True/False
base(无记忆) 0.585 0.540 0.525
L1 定义进上下文 0.855 0.905 0.995
post-norm · 本词 0.974 0.770 0.535 0.595
post-norm · ★换成含义相反的词 0.350 0.515 0.450
L7 · 本词 1.000 0.925 0.545 0.670
L7 · 换成含义相反的词 0.070 0.410 0.290

✅ 绑定是真的

L7 落差 −0.855(0.925 → 0.070)——不是"失效"(那会是 0.5),是答案跟着词整个翻过去。对照 P9b 未强制时只有 −0.018

#25 的原因改写:不是"架构做不到词绑定",而是"我们没让它必须做到"。⚠️撤回本身不变——P5–P9 跑的仍是欠定设置。

🔴🔴 但跨读出方向随之消失

L7 的 F2 0.545 / F3 0.670,而 base 是 0.540 / 0.525;P9 未绑定时是 0.935 / 0.945

⟹ P9 那个漂亮的跨格式迁移,正是「没绑定到词」换来的。 未绑定时记忆给物体表征打了个与词无关的标,任何读出格式都能读到它。逼它条件化于词,这条便车就没了。

★ 四格全测下来:从来没有一格同时拿到两者

绑定到词 跨读出方向
post-norm + 欠定(P5–P8) ❌ 0.017
L7 + 欠定(P9) ❌ 0.018 0.940
post-norm + 强制(P10) ◐ −0.420 ❌ 0.565
L7 + 强制(P10) −0.855 0.608
L1 上下文注入 ✅ 构造上必然 0.905 / 0.995

参数化路线在测过的每一种配置里最多只拿到其一;上下文注入两者都有。 这是目前对该路线最强的一条负面证据,已写进 §6(0-b)。

⚠️ 两处方法学漏洞,都是这轮补的

① 差点把优化不足报成架构限制。 60 epoch 时训练 acc 0.542 ≈ 只看物体的上限——按判据就是"架构不能",而且会直接推出一条不必要的架构修改建议。训练曲线检查点救回来的:

post-norm  ep150 0.771 → ep300 0.891 → ep600 0.943 → ep900 1.000
L7         ep150 1.000(loss 0.000,已收敛)

P5–P9 全部用的 300 步,对 post-norm 恰好落在还没收敛处;对 L7 又是过训 6 倍。 已写成硬分支:末段仍在上升 >0.03 即输出 ⚪ 不可判。

② 主脚本漏了 base/L1 参照臂。 没有它们,像"某用户 F3 = 0.080"这种数字无法解释。补跑后发现逐用户 base 的 F1 从 0.240 到 0.880 都有——个别用户的极端值大半来自基座,不可单独解读。新增 p10_ref_arms.py

未测(已写进限制)

L7 的早停版(它 ep150 就收敛,900 步是过训,逐用户 held-out F1 含一个 0.48);三词以上 / 非互斥 / 部分重叠的含义——两词互斥时记忆只需编码一个轴 + 一个随词翻转的符号,比真实词汇简单得多。

📌 p10/README.md

oratis and others added 2 commits August 4, 2026 16:10
两份草稿里的裸 arXiv 号与命名占位符全部换成 \cite{}(31 处),
交叉核验:正文引用的 24 个 key **全部**在 bib 中,无悬空引用。

★ 会场填写纪律(写在文件抬头)——这条是自我推翻 #9 换来的:
  当初把 LMLM 写成「NeurIPS 2025 主会」,实为 CCFM workshop Oral。
  ⟹ booktitle/journal 只在两种证据之一存在时才填:
     (a) arXiv 元数据的 comment/journal-ref 自陈;(b) 我方 r9/r10/r11 全文核查记录。
  其余一律 @misc + eprint。我方文档声称过、但两条证据都没有的,
  标 % VENUE-UNVERIFIED 并保留 @misc(目前 2 条:Delétang ICLR'24、SEMA CVPR'25)。

其它纪律写进各条目的 note 字段,让引用时无法绕过:
  · chen2024generativeadapter — 不得写"天然按用户隔离"(#16,全文无 isolation 一词)
  · kujanpaa2024injection    — 不得写"多规模超过 RAG"(#14,HotpotQA 上 RAG 全面占优)
  · ye2026opcd               — 不得写"更好保留 OOD"(#15,是退化更少;checkpoint 按 test acc 挑)
  · tan2025dyprag            — 不得写"平均互相干扰"(#17,说反了)
  · chen2026continual        — teacher 是自教师不是外部强模型;坍缩归因不得改写(#18/#19)
  · huang2024sharpening      — DPI 论点须归 cover1999elements,不得写成该文定理(#10)
  · stein2026gates + huang2022selfimprove — 禁止写"尚无 GT-free 写入准入门控"(#13)
  · li2025selfsizing         — 🚨 必须钉 v3,v1/v2 是另一篇
  · colaco2026ratedistortion — 🔴🔴 最高优先权风险,同构提案;投稿前必须重扫

元数据来源:arXiv Atom API(2026-08-04);Farquhar 一条走 Crossref DOI 取全字段。
未入库的 6 个背景引用(LOCI/DEN/CN-DPM/DER++/GSS/MIR/iCaRL)已在正文标 %TODO-BIB,
不静默留着——它们只出现在族 5/6 概览句里,不承载我方主张。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按 §6 待办做的 ⏰ 重扫,一个月的时间差就抓到一篇直接命中的。

★ ConsistencyGate(arXiv:2607.22962,2026-07-25,晚于第十一轮)
  「a write-time admission gate that, before committing a candidate fact m extracted
   from context c, queries the LLM K times for a soft support score and admits m only
   when the average exceeds a threshold」——**GT-free**、**推理期**、**按条**、**持久**、
   外部记忆写入。⟹ 与我方门控环节**完全重合**。

  原声明把新颖性放在两轴:判据类型(压缩/MDL)× 门控环节(推理期按条持久写入,
  理由是"已有 GT-free 门均作用于训练期")。**后半句已被证伪,第二条腿倒了。**

  ⟹ 定稿措辞(第五次收紧):
     「尚无方法以**压缩增益/MDL 为判据**做写入准入门控——已有 GT-free 准入门
      (GATES、LMSI、ConsistencyGate)用自洽度,SAGE/SEMA 用新颖度,
      Write-Time Gating/TRUSTMEM 用来源可信度,**没有一个用描述长度**。」

★ 但它同时是**最好的动机引用**,而且比"无人做过"更强:
  它的信号正是我方 P2 实测在 gavagai 对上失效的那一类——语义熵 AUC 0.269,
  且 **M′ 更窄时 0.137(系统性反向)**,而 M′ ⊂ M 正是最常见的 gavagai 形态。
  ⟹ 贡献 C1 改写为「我们不是断言这个区别重要,而是证明了它重要」。
  ⚠️ 禁令 4:引用它时**必须**同时给出失效实证,否则读者会以为问题已被解决。

同轮另核 MemRefine(2606.13177,2026-06-11):**事后压缩**(对已入库条目做
delete/merge/preserve)、信号是 LLM 判官的事实性判断、**无 MDL 判据** ⟹ 不构成威胁。
2607.08032(rate-distortion,唯一同构提案)**仍未被实现** ⟹ 判据类型那一轴目前仍空。

落地:
· REPORT §0.1 第五次收紧 + 收紧沿革表第 12 行 + 自我推翻 #27(共 27 处)
· Intro 抬头禁令 3 条 → 4 条;¶4 整段改写;贡献 C1 从「criterion × locus 两轴」改为一轴
· 研究文档 §7.6 的两轴表述加删除线 + 作废说明
· refs.bib +2 条(zhang2026consistencygate / kim2026memrefine),27 条
· 审计器加 #27 两条规则 —— 加完立刻抓到 6 处残留(含研究文档 743 的两轴原句),已全部处理

⏰ 投稿当月须再扫一次:该方向 1 个月内就冒出一篇直接命中的。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Aug 4, 2026

Copy link
Copy Markdown
Owner Author

转入投稿打磨:bib + 🔴 第十二轮重扫(贡献声明第五次收紧)

参数化路线四格已封闭,不再加实验。转去打磨压缩门那条线。

1. refs.bib — 27 条正式条目

两份草稿的裸 arXiv 号与命名占位符全部换成 \cite{}(31 处),交叉核验:正文引用的 24 个 key 全部在 bib 中,无悬空引用

会场填写纪律写进了文件抬头,这条是自我推翻 #9 换来的(当初把 LMLM 写成「NeurIPS 2025 主会」,实为 CCFM workshop Oral):booktitle/journal 只在 (a) arXiv comment/journal-ref 自陈 或 (b) 我方 r9/r10/r11 全文核查记录 存在时才填,其余一律 @misc + eprint。我方文档声称过但两条证据都没有的,标 % VENUE-UNVERIFIED(目前 2 条)。

各条目的 note 里写死了引用纪律,让引用时无法绕过 —— 例如 chen2024generativeadapter 注明不得写"天然按用户隔离"(#16),tan2025dyprag 注明不得写"平均互相干扰"(#17,说反了),li2025selfsizing 注明🚨必须钉 v3。

2. 🔴 重扫抓到 ConsistencyGate —— 第二条腿倒了

arXiv:2607.22962(2026-07-25),晚于我方第十一轮。摘要原文:

a write-time admission gate that, before committing a candidate fact m extracted from context c, queries the LLM K times for a soft support score and admits m only when the average exceeds a threshold

GT-free、推理期、按条、持久、外部记忆写入 —— 与我方门控环节完全重合

原声明把新颖性放在两轴:判据类型(压缩/MDL)×门控环节(推理期按条持久写入,理由是"已有 GT-free 门均作用于训练期")。后半句已被证伪。

⟹ 第五次收紧的定稿措辞
尚无方法以压缩增益/MDL 为判据做写入准入门控——已有 GT-free 准入门(GATES、LMSI、ConsistencyGate)用自洽度,SAGE/SEMA 用新颖度,Write-Time Gating/TRUSTMEM 用来源可信度没有一个用描述长度

★ 但它同时是最好的动机引用,而且比「无人做过」更强

它的信号正是我方 P2 实测在 gavagai 对上失效的那一类:语义熵 AUC 0.269,且 M′ 更窄时 0.137(系统性反向)——而 M′ ⊂ M 正是最常见的 gavagai 形态。

贡献 C1 据此改写为:我们不是断言这个区别重要,而是证明了它重要。 禁令 4 同时规定:引用 ConsistencyGate 时必须同时给出失效实证,否则读者会以为问题已被解决。

同轮另核

  • MemRefine(2606.13177):事后压缩、LLM 判官信号、无 MDL 判据 ⟹ 不构成威胁
  • 2607.08032(唯一同构提案,rate-distortion):仍未被实现 ⟹ 判据类型那一轴目前仍空

审计器加规则后立刻抓到 6 处残留

包括研究文档 §7.6 那句两轴原表述。全部已处理,重跑 0 处残留

投稿当月须再扫一次——该方向 1 个月内就冒出一篇直接命中的。

📌 paper/refs.bib

三项待办全部处理,并在过程中抓到第十二轮的第二篇。

【1】refs.bib 25 → 37 条
· 补齐正文全部背景引用:GDumb / Chaudhry / GSS / MIR / iCaRL / DER++ / CN-DPM / DEN
  会场一律只在 arXiv comment 或 journal-ref 自陈时才填 —— 实际拿到 5 个:
  CN-DPM ICLR 2020 · DER++ NeurIPS 2020 · MIR NeurIPS 2019 · GSS NeurIPS 2019 · iCaRL CVPR 2017;
  DEN 与 Chaudhry 无字段佐证 ⟹ 保留 @misc(不按"通行认知"填)。
· 两条 VENUE-UNVERIFIED 已清零:
  Delétang ICLR 2024(ICLR proceedings PDF 页眉自陈)· SEMA CVPR 2025(CVF Open Access, pp.10087-10098)。
· 🔴 LOCI 未通过复核:第四轮记为 TDCommons 11091,第十二轮无法再定位、作者标题未能核实
  ⟹ **已从投稿正文删除**(只在族 6 概览句里,不承载主张),bib 条目标红待决。
· 交叉核验:正文 34 个 \cite 全部命中,无悬空引用;唯一未被引用的是刻意排除的 loci2026。

【2】§7.6.2 十类代理表定稿 —— **末列换轴**
原末列是「正确性 ✓/✗」,读法是"正确性那列空着由我方填"。**该框架第八轮起就不成立**
(GATES/LMSI 用一致度作 GT-free 正确性代理),第十二轮 ConsistencyGate 再补一刀。
⟹ 定稿末列改为「**判据是否为描述长度/压缩增益**」——唯一仍然空着的一轴。
新增 5 行证据(GATES / LMSI / ConsistencyGate / DeMem / MemRefine)+ 定稿读法三条;
第四轮读法整段标为沿革、不得引用。

【3】🔴 又抓到一篇:DeMem(arXiv:2605.10870,2026-05-11)
「Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory」
—— 标题几乎就是我方 P0 的核心发现,是**判据轴上离我方最近的一篇**。
按 r9-r11 协议读全文(水印核验 arXiv:2605.10870v1),词边界扫描:
  description length = 0 · MDL = 0 · admission = 0 · interlocutor = 0 · isolation = 0
  rate-distortion = 4 · reward = 46 · oracle = 21
三条结构性差异(均有原文支撑):
  ① 需要观测到的奖励 —— contextual bandit,"the learner observes a reward R_t ∈ [0,1]",目标是 regret;
  ② 是预算下的分区/压缩(什么可以忘),不是准入(要不要写);
  ③ 压缩的是智能体自己的动作,我方压缩的是对话者的后续用词。
⟹ 贡献声明再加两条限定(自我推翻 #28),否则被它击穿。
✅ 但它**独立佐证了我方 P0 最硬的一条**(决策 vs 描述,7.2× margin)——
   我方那条不再只是自家实验结论,而是有独立理论工作支持的观测量选择。
⚠️ 按禁令 2,"不需要奖励"只能写成作用域区分,不得当独立卖点。

同步:Intro ¶4 与划界段改写(新增 STaR/MemRefine/DeMem 三方划界);Method ¶1 加旁证;
REPORT §0.1 定稿措辞 + 自我推翻 #28(共 28 处)+ §7 索引补 refs.bib 与 figures 两行。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis

oratis commented Aug 4, 2026

Copy link
Copy Markdown
Owner Author

打磨项清空 —— 过程中又抓到一篇(自我推翻 #28

1. refs.bib 25 → 37 条

补齐正文全部背景引用(GDumb / Chaudhry / GSS / MIR / iCaRL / DER++ / CN-DPM / DEN)。会场仍然只在 arXiv comment/journal-ref 自陈时才填,实际拿到 5 个:CN-DPM ICLR 2020 · DER++ NeurIPS 2020 · MIR NeurIPS 2019 · GSS NeurIPS 2019 · iCaRL CVPR 2017。DEN 与 Chaudhry 没有字段佐证,保留 @misc——没有按"通行认知"填 ICLR 2018。

两条 VENUE-UNVERIFIED 已清零:Delétang ICLR 2024(ICLR proceedings PDF 页眉自陈)· SEMA CVPR 2025(CVF Open Access, pp. 10087–10098)。

🔴 LOCI 未通过复核:第四轮记为 TDCommons 11091,第十二轮无法再定位,作者与标题未能核实 ⟹ 已从投稿正文删除(只出现在族 6 概览句里,不承载主张),bib 条目标红待决。

交叉核验:正文 34 个 \cite 全部命中,无悬空引用

2. §7.6.2 十类代理表定稿 —— 末列换轴

原末列是「正确性 ✓/✗」,读法是"正确性那列空着、由我方填"。这个框架第八轮起就不成立(GATES/LMSI 用一致度作 GT-free 的正确性代理),第十二轮 ConsistencyGate 再补一刀。

⟹ 定稿末列改为「判据是否为描述长度 / 压缩增益」——唯一仍然空着的一轴。新增 5 行证据(GATES / LMSI / ConsistencyGate / DeMem / MemRefine),第四轮读法整段标为沿革、不得引用

3. 🔴 又抓到一篇:DeMem(arXiv:2605.10870)

「Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory」——标题几乎就是我方 P0 的核心发现,是判据轴上离我方最近的一篇

按 r9–r11 协议读全文(水印核验 arXiv:2605.10870v1),词边界扫描:

命中
description length / MDL 0 / 0
admission 0
interlocutor / isolation 0 / 0
rate-distortion 4
reward / oracle 46 / 21

三条结构性差异,均有原文支撑

  1. 需要观测到的奖励 —— contextual bandit,the learner observes a reward R_t ∈ [0,1],目标是对 full-information oracle 的 regret;
  2. 是预算下的分区/压缩(什么可以忘),不是准入(要不要写)
  3. 压缩的是智能体自己的动作,我方压缩的是对话者的后续用词

⟹ 贡献声明再加两条限定(#28),否则被它击穿:

尚无方法以压缩增益/MDL 为判据新条目的准入做门控,且该压缩算在对话者后续的用词上。

✅ 但它其实是旁证,不是威胁

DeMem 独立论证了「该保住的是决策不是描述」——与我方 P0 最硬的那条同向(自由陈述 +0.68 nats/p=0.36 → 用词决策 +4.92 nats/p=0.00397.2×)。⟹ 我方那条不再只是自家实验结论,而是有独立理论工作支持的观测量选择

⚠️ 按禁令 2,"不需要奖励"只能写成作用域区分,不得当独立卖点。


当前状态:25 组实证 · 28 处自我推翻 · 贡献声明五次收紧 + 一次再限定 · bib 37 条无悬空引用 · 三张图带交叉核对闸门。

⏰ 唯一未决项:投稿当月再扫一次(两个月内已冒出两篇直接命中的),以及 LOCI 补全或永久删除。

oratis and others added 6 commits August 4, 2026 18:55
从两份 markdown 草稿组装成可投稿的 LaTeX 全文,中文编辑注记全部剥离。

结构:Intro / Related work / Method / Setup / Results / **§6 参数化基质的负面结果** /
Limitations / Conclusion + 附录 A(27 行完整分类表)+ 附录 B(撤回记录)。
36 条引用零悬空;图 1(判据类型分层)与图 2(读出方向 + 插入位置)已嵌入。

★ 论文的落脚点(五次收紧 + 一次再限定后):
  新颖性只在**判据类型**一轴,且带两条限定(压缩**对话者的用词** / 门决定**要不要写**)。
  立论不是"无人做过",而是**证明了这个区别重要**——最接近的先例用的正是自洽度,
  而我方实测它在 gavagai 对上系统性反向(M′ 更窄时 AUC 0.137)。

★ §6 把参数化那条线写成**结构化负面结果**而非失败:
  换词控制(落差 0.017–0.018)+ 强制绑定后跨格式塌到 base(0.545/0.670 vs 0.940)
  ⟹ "parametric route attains word binding or cross-format transfer, never both"。

附录 B 单独列出四条**改变了贡献声明本身**的撤回(GT-free 门 / locus / 内化 / DPI 归因),
避免读者从现稿反推出错误的历史。

工程:
· refs.bib 的编辑纪律从 `note` 改为 **`annote`** —— note 会被 plainnat 排进参考文献,
  中文与 emoji 导致编译失败(实测 main.bbl:52 "You can't use `macro parameter character #'")。
  抬头已写明新增条目须沿用 annote。
· LOCI 按建议**整条删除**(TDCommons 11091 无法再定位、作者标题未能核实;
  只出现在族 6 概览句里,不承载主张)⟹ bib 当前无未过核条目。
· 表 1 过宽(270pt overfull)已改 p{} 列宽;附录表 caption 的分组说明与 GT-free 列对齐修正。
· 新增 paper/CHECKLIST.md:22 条禁令 → main.tex 落实位置的逐条映射 + 每次改稿的机械检查命令。
· .gitignore 排除编译产物。

未决(已写进 CHECKLIST 的「投稿当月必做」):
  ⏰ 重扫 rate-distortion 方向(两个月内已冒出两篇直接命中的)。
  L7 早停版、E5 条件化失败、单模型族——按建议不再补实验,全部进 Limitations。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
论文 §6 的负面结论(参数化路线最多只拿到「词绑定」或「跨格式」之一)指向一个
结构性修法:把上下文注入赢下两者的那两个性质——**键是词的 token、值进入表征**——
做成不占上下文、跨会话持久的形式。

三条约束全部来自实测失败,不是想出来的:
  · 键必须是词本身且推理时可观测(post-norm 换词后 h 只变 0.006 ⟹ 落差 0.017)
  · 值必须进表征不能进 logits(cos(m,W_yes−W_no)=+0.79 vs cos(m,W_A−W_B)=+0.003)
  · 不能靠相似度路由去找那个词(L7 换词后路由命中槽重合率 1.000)

★ 八轮正反方辩论,其中五轮是我方让步,全部须原样进 limitations:
  反1 基质不新(textual inversion 等)—— 让步,且不得声称新;
       新的只在组合:门决定建不建条目 + 值拟合于用法 + 键含 interlocutor_id。
  反2 token 触发是查表、绕过了绑定 —— 部分让步;主张须限定为
       「不丢失门已认可性质的存储基质」,不得写成「模型学会了绑定」。
  反3 早层注入可能破坏该词的身份 —— 真风险,加**复述控制**且先于主结果跑。
  反5 固定向量扛不住多义 —— 让步,结论限定在语境无关词汇项。
  ★反6 词不出现就不点火 = 把 I3 从"没做到"改成"不可能" —— 最贵的代价,
       让步:**它绕开而非修复 I3**。唯一辩护是按知识类型分基质
       (词汇→token 触发;命题→我们已做出的那个"物体级偏置",它在那里不是 bug)。
  反7 上下文注入 0.905/0.995 已最好 —— 让步:质量上确实更好;
       参数化只买到不占 token / 跨会话免检索 / 拟合于用法的含义三样,
       三样都不要就该直接推荐上下文注入。
  反8 你的架构直觉这轮已错两次 —— 成立,故先做最简单的输入嵌入版。

及格线**跑前写死**:F2/F3 须从 ~0.55 抬到 **≥0.85**(上下文注入天花板 0.905/0.995),
换词须 ≤0.30,且复述控制必须先过。任一 ★ 项不达标即记为负面结果、机制推理撤回。

另设两个**双向控制**(各故意破坏一条约束):词触发但值进 logits(预测 F2/F3 仍塌)、
值进表征但不按词位置(预测换词落差回到 ~0.02)。它们若不按预测失败,
说明我方对失败原因的归因本身是错的。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
按 docs/DESIGN_LEXICAL_ENTRY.md §6 推进。两步都没走顺,但都是控制实验在起作用。

【第 1 步 复述控制】通过(无注入 1.00 → 同量级随机注入 0.88)
  ⚠️ 但这个"通过"本身有问题:用的是**随机方向**的向量。
     换成**学出来的真实 v**(同样 ‖v‖/‖h‖=1.00)⟹ 复述成功率 **0.00**。
  ⟹ 范数不是正确的约束,问题在**方向**:梯度只优化决策,
     没有任何一项保护 token 身份,于是径直落在覆盖身份的方向上。
  ★ 教训:**控制实验必须用真实产物跑,不能用同量级的替身。**
  已把「用学到的 v 重跑复述」写进脚本,作为解读主结果的前置。

【实施顺序被推翻】设计文档原写「先做 ℓ=0,够就不做 ℓ=7」。
  ℓ=0 恰恰是**词的身份所在的层**,注入必然最具破坏性 ⟹ 改为先做 ℓ=7。
  **这是被控制实验改的顺序,不是直觉。** 文档已留痕。

【实现 bug】范数上限一律用**嵌入层**的 ‖h‖(1.09)算,但残差范数随深度增长
  (P5 实测末层 ≈172)⟹ L7 上的上限小了两个量级,几乎等于没注入,
  训练 acc 卡在 0.500(= 只看物体的上限),**看着像"架构不能"**。
  修:上限在**注入层**上量。修后训练 acc 1.000,而 v 只用了隐状态范数的 **2%**。

【冒烟 n=2,不下结论】L7 修正后:
  own F1 0.920 · F2 0.420 · **F3 0.920**(held-out 格式,base 0.525,此前最好 0.670)
  换成含义相反的词:0.000 / 0.020 / 0.000 —— **三种格式一起翻转**
  但 F2 未过线、复述仍 0.00。
  ⟹ 全量 8 用户 × 4 条件(含两个双向控制)已启动,跑完再判。

⚠️ 另需处理一处**我方原措辞过强**:辩论反 3 写「拼不出 ⟹ 绑定是假的」。
   实测换词后 AUC=0.000(完全翻转),**绑定行为是真的**,丢掉的是"还能把词说出来"。
   精确表述:**词条【替换】了该词的表征而非【丰富】它** —— 真缺陷,但不否定绑定。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
8 用户 × 4 条件 + base/L1 参照,全部完成。按设计文档 §4.1 跑前写死的及格线判定:**未达标**。

  条件                  F1      F2      F3
  base                0.585   0.540   0.525
  L1 上下文(天花板)     0.855   0.905   0.995
  L7 词条 · 本词        0.835   0.570   0.775
        · ★换相反词      0.080   0.330   0.125
        · 换别人的词     0.550   0.430   0.395
  emb 词条 · 本词       0.855   0.585   0.670
        · ★换相反词      0.175   0.310   0.145
  ◇ emb_allpos(控制)  0.500   0.445   0.595   训练 acc 0.531
  ◇ postnorm_word(控制)0.585   0.540   0.525   ← 与 base **逐位相同**

✅ 绑定拿到了,而且是新拿到的:换成含义相反的词 → 0.080(P9b 未强制时落差仅 0.017);
   换成**别人的词** → 0.550 ≈ base,正是"触发器不点火"应有的样子。
🔴 但跨格式未达线:F2 0.570(base 0.540)· F3 0.775(及格线 0.85,上下文注入 0.995)
   ⟹ 「早层 + 词位置就能拿到跨格式」这条机制推理**撤回**。

★ 两个双向控制**都按预测失败** —— 本轮唯一完全达标的部分:
  · 值进 logits ⟹ 与 base 逐位相同(常量末位平移不改排序,构造性必然);
    它解释了为什么 P5–P8 必须用输入依赖的路由。
  · 键不是词(全位置注入)⟹ **连训练集都拟合不了**(acc 0.531 ≈ 只看物体的上限 0.5):
    加在所有位置的常量无法区分"问的是 w1"还是"w2"。
  ⟹ **两条约束的归因成立,错的是"满足它们就够"。**

⚠️ 论文 §6 与摘要那句 "never both" 已软化为「最多只【完整】拿到其一」:
   P11 是第一个同时拿到**完整绑定**与**部分跨格式**的配置 ⟹ 不是非此即彼,是**权衡曲线**。
   main.tex 已改并零 error 编译通过。

⚠️ 复述控制主条件未过(L7 0.50 / emb 0.00)⟹ 按预注册规则主结果"不可解读",
   **规则不改**。但辩论原写的「拼不出 ⟹ 绑定是假的」被实测证明过强——
   换词后 0.080 说明**绑定行为是真的**;精确表述是
   **词条【替换】了该词的表征而非【丰富】它**。正确处置是改设计(目标函数缺身份保持项),未做。

两个我方 bug,都是控制实验抓的(已进 §0.4 "差点犯的错"):
  · 复述控制初版用**随机方向**同量级向量验证得 0.88 ✅,换真实 v → 0.00
    ⟹ 控制实验必须用真实产物,不能用同量级替身;
  · 范数上限一律算在**嵌入层**(1.09),而注入在 L7(‖h‖ 大两个量级)
    ⟹ 训练 acc 卡 0.500,**又一次差点把实现问题报成架构限制**。

未做:F2 为何完全不响应未单独诊断(P8 记录该格式有 91% A 位置偏置);完整回路(门→词条)未接。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
直接看 p(A) 的分布,与上下文注入(同格式 0.905)逐项对照:

  臂            AUC   p(A|正例) p(A|负例)  正负例差   p(A)展幅  选A率
  词条(L7)     0.570    0.534    0.514    +0.021    0.569   0.562
  base        0.540    0.589    0.585    +0.004    0.223   0.700
  L1 上下文     0.905    0.487    0.287    +0.200    0.340   0.237

❌ H_sat 被否:词条的 p(A) 展幅 **0.569 > L1 的 0.340** —— 比 L1 还展得开,不是饱和。
✅ H_weak 成立:正负例之差仅 +0.021,而 L1 是 +0.200 ⟹ **词条确实没迁到这个读出方向**。
✅ H_item 也成立:逐用户 AUC [0.20,0.20,0.32,0.68,0.76,0.76,0.80,0.84] —— 明显双峰。

★ 相对 base 的增益 +0.030(σ 0.116),**符号逐用户翻转**(+.12/−.16/+.16/−.04/+.12/−.08/+.16/−.04)
  ⟹ n=8 下与 0 无法区分。**P11 §1 表里的 0.570 vs 0.540 不构成提升**,已在正文标明。

★ 附带发现:**F2 作为测量仪器对非上下文方法不可靠**——
  base 自己就逐用户 0.20–0.84(两个用户系统性反向),而 L1 在同样用户上 0.60–1.00(7/8 ≥0.96)。
  把定义显式放进上下文能压过基座的固有倾向,一个细微的词条压不过。
  ⟹ **F3 才是干净仪器**(base 0.525、L1 0.995、无逐用户反向),
     论文跨格式主证据应以 F3 为准,F2 只作"更难的格式"报告。
  ⚠️ 但**不改变判定**:F3 也只有 0.775,仍低于跑前写死的 0.85。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant