Skip to content

[七问法] Wiki-Link Retrieval:研究故事线与下一阶段验证合同 #7

Description

@ShuhaoZhangTony

七问法研究合同

这是基于当前仓库证据的下一阶段建议。历史负结果继续保留;本合同不会把 smoke、replay、simulation、projected profile 或 host fixture 升格为端到端效果。

  1. 问题定义:在大规模文档链接图上,能否只物化对当前查询有价值的局部子图,避免全量图物化的数量级开销?
  2. 重要性:先在真实 workload/runtime 上量化该问题的发生频率、资源损失和 SLO/正确性影响;若 M0 不能复现可重复病理,则停止机制实现。
  3. 现有工作缺口:已完成的全量 materialization 保持了正确性但 p95 开销约为 baseline 的 23.7 倍,说明全图预处理是错误抽象。
  4. 核心机制假设:关闭全量配置,转向 query-conditioned lazy materialization 或增量局部更新;价值判定必须只使用查询时可见字段。
  5. 最小可行设计:只实现能够区分 baseline/treatment 的最小真实 seam;所有 runtime、算法和数据依赖必须由本仓库 submodule 固定,禁止依赖 ambient shared core。先做 correctness gate,再申请扩大设备/模型矩阵。
  6. 实验合同:以无图检索、全量物化旧机制和惰性局部物化为三臂;在 HotpotQA 等真实链接图上要求 evidence/answer oracle 不退化、访问边数下降至少 50%、端到端 p95 不高于 1.25 倍;否则停止新机制。 两臂必须使用同一 commit、模型、数据顺序、硬件和运行模式;至少 10 次重复或完整真实事件集,报告完整分布。正确性必须 100%,性能门须预注册;未过门只关闭本机制,不修改阈值迎合结果。
  7. 预期知识增量:Link-graph retrieval is viable only when graph construction is query-scoped rather than globally materialized.

下一次提交要求

  • 先在本 Issue 回复:架构/数据事实、matched baseline/treatment、指标阈值、correctness oracle、停止条件、证据等级、硬件与预计时长。
  • 随后用独立分支提交最小实现、测试、原始结果、manifest 和 Draft PR。
  • 不得把准备度检查、dry-run 或 projected 数字写成论文效果。

Metadata

Metadata

Labels

No labels
No labels

Type

No type

Projects

No projects

Milestone

No milestone

Relationships

None yet

Development

No branches or pull requests

Issue actions