> 扩大实验、造 benchmark、造术语、写投稿之前的四道门
一个反复出现的失败模式:在理解合作者、理解社区、理解标准任务、 跑通公认流水线之前,就开始大规模跑实验 / 自造 benchmark / 自造术语 / 写论文。
结论先行¶
一个反复出现的失败模式:在理解合作者、理解社区、理解标准任务、 跑通公认流水线之前,就开始大规模跑实验 / 自造 benchmark / 自造术语 / 写论文。
四道门,全部通过之前,上述四件事都是禁止的:
- 合作者及其研究方向已从一手材料记录在案。
- 目标社区的标准任务、数据集、baseline、指标、评测惯例已记录在案。
- 至少一条标准流水线已端到端复现过,且有官方实现时从官方实现开始。
- 能用平白语言在 60 秒内准确讲清这个项目,包括什么算成功、什么算失败。
任一条缺失,允许做的只有:侦察、复现、澄清、小规模诊断。 大规模运行和论文扩张被阻断。
第 4 条是最好用的自检——讲不清就是还没懂, 而不是"讲清楚这件事以后再说"。
为什么¶
这四条针对的都是同一种损失:把不可退的资源投在一个还没被理解的问题上。
- 大规模跑实验:烧算力烧时间,而且跑出来的东西没有参照系,无法判断对错。
- 自造 benchmark:一旦发表就要维护,而且社区没有理由采用一个绕过标准任务的新基准。
- 自造术语:审稿人会把新词当成包装(自审的失效模式不是"没发现",是"发现了没执行" 里的 "cold-term audit" 就是查这个),而且新词会掩盖你其实在做已有的事。
- 写投稿:把一个没有参照系的结果写成论文,是最贵的一步。
配套的还有一条合作契约,用来防止"把探索性讨论当成授权":
| 状态 | 含义 |
|---|---|
ASSIGNED |
合作者指定了任务和交付物 |
CO-DESIGN |
方向已达成一致,设计仍然开放 |
EXPLORATORY |
只知道一个宽泛的兴趣 |
不要把一次探索性讨论当作构建完整 benchmark 或论文的授权。
以及:绝不能仅凭一篇论文标题或宽泛的实验室描述,推断出对方想要的项目。 要用官网、论文、代码库、直接往来记录,并且把已验证的事实和推断分开写。
怎么用¶
开一个新合作时,先建 docs/COLLABORATOR_CONTEXT.md:
- 现任单位、实验室、角色
- 近三年 3–5 篇代表作
- 反复出现的研究问题、方法、数据集、baseline、会议
- 贡献风格:理论 / 算法 / 测量 / benchmark / 系统 / 应用
- 公开代码库、在研项目、可用基础设施、公开表态的研究优先级
- 对方在邮件或会议里明确要求的东西
- 预期交付物、截止时间、会议节奏、算力归属、决策权
任务含糊时,先问这四个再动手:
- 第一个实验应该回答哪个研究问题?
- 先用哪个标准数据集和参考实现?
- 这个社区里哪些 baseline 和指标是必须的?
- 预期交付物是复现、诊断、新方法、benchmark,还是论文草稿?
门 3 的判据要具体:不是"我看懂了官方代码", 而是跑出来的数字和已发表的数字对得上,对不上的部分有 事先声明的偏差是限制,事后发现的偏差是借口 里声明过的偏差解释。 契约见 复现契约——一个分数如果答不出这五个问题,它就不是结果。
这套门禁的价值在于它阻断的是「看起来很有产出」的动作。 跑实验、造词、写稿都让人觉得在推进;侦察和复现让人觉得在原地。 所以这条规则必须写下来并且是默认拒绝,靠自觉是拦不住的。
出处¶
~/RA-works/unlearning-reproduction/docs/RESEARCH_COLLABORATION_PROTOCOL.md- 本机有一个对应的检查工具
/research-gate(报告当前 gate 0–6 并阻断越级工作)