<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>LATENT</title><description>研究大语言模型的训练、对齐与推理效率。记录一些不那么正确但足够真诚的思考。</description><link>http://your_server_ip/</link><language>zh-CN</language><item><title>为什么你的 loss 掉得漂亮，模型却越来越笨</title><link>http://your_server_ip/posts/loss-looks-good-model-gets-dumber/</link><guid isPermaLink="true">http://your_server_ip/posts/loss-looks-good-model-gets-dumber/</guid><description>验证集里有 4.7% 的样本以另一种表述出现在训练集中。这篇写数据去重、评测污染的检测方法，以及为什么漂亮的指标往往是最危险的信号。</description><pubDate>Sat, 18 Apr 2026 00:00:00 GMT</pubDate><category>llm</category><category>training</category><category>thoughts</category><author>Surely</author></item><item><title>重读 Attention：从 O(n²) 到线性的六种妥协</title><link>http://your_server_ip/posts/attention-six-compromises/</link><guid isPermaLink="true">http://your_server_ip/posts/attention-six-compromises/</guid><description>把 Linformer、Performer、Mamba、滑动窗口放在同一张坐标系里比较，看它们各自放弃了什么样的长程依赖能力。</description><pubDate>Mon, 30 Mar 2026 00:00:00 GMT</pubDate><category>llm</category><category>infra</category><author>Surely</author></item><item><title>奖励模型是一面哈哈镜</title><link>http://your_server_ip/posts/reward-model-funhouse-mirror/</link><guid isPermaLink="true">http://your_server_ip/posts/reward-model-funhouse-mirror/</guid><description>RLHF 里最被低估的失效模式不是 reward hacking，而是标注者偏好的不一致性如何被模型放大成一种稳定的人格缺陷。</description><pubDate>Tue, 24 Feb 2026 00:00:00 GMT</pubDate><category>rlhf</category><category>thoughts</category><author>Surely</author></item><item><title>把首 token 延迟砍掉 60% 的那一周</title><link>http://your_server_ip/posts/first-token-latency/</link><guid isPermaLink="true">http://your_server_ip/posts/first-token-latency/</guid><description>从 PagedAttention 的显存碎片，到投机解码里草稿模型的接受率调参。包含两个把 P99 搞得更糟的失败尝试。</description><pubDate>Mon, 15 Dec 2025 00:00:00 GMT</pubDate><category>infra</category><category>inference</category><author>Surely</author></item></channel></rss>