按时间倒序,没有分页。标签可以筛选,⌘K 可以直接搜。
一句话说清这篇讲什么。会显示在列表页和搜索引擎结果里,建议 40–80 字。
验证集里有 4.7% 的样本以另一种表述出现在训练集中。这篇写数据去重、评测污染的检测方法,以及为什么漂亮的指标往往是最危险的信号。
把 Linformer、Performer、Mamba、滑动窗口放在同一张坐标系里比较,看它们各自放弃了什么样的长程依赖能力。
RLHF 里最被低估的失效模式不是 reward hacking,而是标注者偏好的不一致性如何被模型放大成一种稳定的人格缺陷。
