LATENT
首页
文章
归档
关于
搜索
⌘K
TAG · 1 篇
RLHF
← 全部文章
LLM 2
随想 2
Infra 2
训练 1
推理 1
001
奖励模型是一面哈哈镜
02 / 24
2 MIN
RLHF 里最被低估的失效模式不是 reward hacking,而是标注者偏好的不一致性如何被模型放大成一种稳定的人格缺陷。
RLHF
随想
导航
首页
文章
归档
关于
文章
为什么你的 loss 掉得漂亮,模型却越来越笨
重读 Attention:从 O(n²) 到线性的六种妥协
奖励模型是一面哈哈镜
把首 token 延迟砍掉 60% 的那一周
命令
切换亮/暗主题
T
订阅 RSS
↑↓ 选择
↵ 打开
ESC 关闭
微信
扫码添加 · 点击任意处关闭