按时间倒序,没有分页。标签可以筛选,⌘K 可以直接搜。
验证集里有 4.7% 的样本以另一种表述出现在训练集中。这篇写数据去重、评测污染的检测方法,以及为什么漂亮的指标往往是最危险的信号。
把 Linformer、Performer、Mamba、滑动窗口放在同一张坐标系里比较,看它们各自放弃了什么样的长程依赖能力。
RLHF 里最被低估的失效模式不是 reward hacking,而是标注者偏好的不一致性如何被模型放大成一种稳定的人格缺陷。
从 PagedAttention 的显存碎片,到投机解码里草稿模型的接受率调参。包含两个把 P99 搞得更糟的失败尝试。