2026.07.29 · 周三行业动态
←返回首页话题 · Topic
#RLHF
共 9 条相关资讯
2026.07.26 · 周日研究论文
LLM-as-a-Judge 实战指南:从起源到前沿
2026.07.21 · 周二研究论文
研究者尝试复现 OpenAI「持久有益模型」论文:单卡 GRPO 仅提升 2.4 分
2026.07.21 · 周二研究论文
RLHF 偏好数据存评分者状态偏差:研究提出审计框架
2026.07.06 · 周一行业动态
AI 也会「玩心眼」?背后是人类的奖励心理学
2026.07.04 · 周六研究论文
信息论视角:为什么 AI 写作听上去都一个味
2026.07.01 · 周三研究论文
AI 管基站:强化学习如何拯救演唱会现场的卡顿网络
2026.06.29 · 周一行业动态
一句「你确定吗」,大模型为何集体改口?
2026.06.29 · 周一行业动态
