< 学习笔记 />
Hard top-K 路由的未选中专家没有梯度——它永远学不会自己该被选中
MoE 用 topk + softmax(top_k_logits) 做 hard routing 时:
检查渲染产物,不是源码——Django 的 {# #} 只支持单行
Django 模板的 {# ... #} 注释只支持单行。跨行写的那一刻它就不是注释了, 会被原样渲染给每一个访问者:
扩大实验、造 benchmark、造术语、写投稿之前的四道门
一个反复出现的失败模式:在理解合作者、理解社区、理解标准任务、 跑通公认流水线之前,就开始大规模跑实验 / 自造 benchmark / 自造术语 / 写论文。
事先声明的偏差是限制,事后发现的偏差是借口
复现别人的工作时,你的环境一定会和官方配置有出入。 处理办法不是消除出入(做不到),而是在受影响的实验跑之前把它写下来:
把失败归因给模型之前,先审 verifier——41% 的"模型错误"其实是判分 bug
跑一个自动判分的 benchmark,拿到 81% 通过率之后, 第一件事不是分析模型为什么错,是逐条看那 19 个失败案例。
24 of 24 SAST Findings Were False — The Real Bug Was Three Lines Away
Bandit flagged every mark_safe() call in the codebase. All 24 were false positives. The actual stor…