> 扩大实验、造 benchmark、造术语、写投稿之前的四道门

Research Tools 中级 2026-09-06 07:21 2026-09-06
#protocol #collaboration #reproduction #scope-control #gate

一个反复出现的失败模式:在理解合作者、理解社区、理解标准任务、 跑通公认流水线之前,就开始大规模跑实验 / 自造 benchmark / 自造术语 / 写论文。

// TABLE_OF_CONTENTS

结论先行

一个反复出现的失败模式:在理解合作者、理解社区、理解标准任务、 跑通公认流水线之前,就开始大规模跑实验 / 自造 benchmark / 自造术语 / 写论文。

四道门,全部通过之前,上述四件事都是禁止的:

  1. 合作者及其研究方向已从一手材料记录在案。
  2. 目标社区的标准任务、数据集、baseline、指标、评测惯例已记录在案。
  3. 至少一条标准流水线已端到端复现过,且有官方实现时从官方实现开始。
  4. 能用平白语言在 60 秒内准确讲清这个项目,包括什么算成功、什么算失败。

任一条缺失,允许做的只有:侦察、复现、澄清、小规模诊断。 大规模运行和论文扩张被阻断。

第 4 条是最好用的自检——讲不清就是还没懂, 而不是"讲清楚这件事以后再说"。

为什么

这四条针对的都是同一种损失:把不可退的资源投在一个还没被理解的问题上。

  • 大规模跑实验:烧算力烧时间,而且跑出来的东西没有参照系,无法判断对错。
  • 自造 benchmark:一旦发表就要维护,而且社区没有理由采用一个绕过标准任务的新基准。
  • 自造术语:审稿人会把新词当成包装(自审的失效模式不是"没发现",是"发现了没执行" 里的 "cold-term audit" 就是查这个),而且新词会掩盖你其实在做已有的事。
  • 写投稿:把一个没有参照系的结果写成论文,是最贵的一步。

配套的还有一条合作契约,用来防止"把探索性讨论当成授权":

状态 含义
ASSIGNED 合作者指定了任务和交付物
CO-DESIGN 方向已达成一致,设计仍然开放
EXPLORATORY 只知道一个宽泛的兴趣

不要把一次探索性讨论当作构建完整 benchmark 或论文的授权。

以及:绝不能仅凭一篇论文标题或宽泛的实验室描述,推断出对方想要的项目。 要用官网、论文、代码库、直接往来记录,并且把已验证的事实和推断分开写

怎么用

开一个新合作时,先建 docs/COLLABORATOR_CONTEXT.md

  • 现任单位、实验室、角色
  • 近三年 3–5 篇代表作
  • 反复出现的研究问题、方法、数据集、baseline、会议
  • 贡献风格:理论 / 算法 / 测量 / benchmark / 系统 / 应用
  • 公开代码库、在研项目、可用基础设施、公开表态的研究优先级
  • 对方在邮件或会议里明确要求的东西
  • 预期交付物、截止时间、会议节奏、算力归属、决策权

任务含糊时,先问这四个再动手:

  1. 第一个实验应该回答哪个研究问题?
  2. 先用哪个标准数据集和参考实现?
  3. 这个社区里哪些 baseline 和指标是必须的?
  4. 预期交付物是复现、诊断、新方法、benchmark,还是论文草稿?

门 3 的判据要具体:不是"我看懂了官方代码", 而是跑出来的数字和已发表的数字对得上,对不上的部分有 事先声明的偏差是限制,事后发现的偏差是借口 里声明过的偏差解释。 契约见 复现契约——一个分数如果答不出这五个问题,它就不是结果

这套门禁的价值在于它阻断的是「看起来很有产出」的动作。 跑实验、造词、写稿都让人觉得在推进;侦察和复现让人觉得在原地。 所以这条规则必须写下来并且是默认拒绝,靠自觉是拦不住的。

出处

  • ~/RA-works/unlearning-reproduction/docs/RESEARCH_COLLABORATION_PROTOCOL.md
  • 本机有一个对应的检查工具 /research-gate(报告当前 gate 0–6 并阻断越级工作)