2026.07.30 · 周四研究论文
←返回首页话题 · Topic
#强化学习
共 31 条相关资讯
2026.07.29 · 周三产品功能
Fireworks AI 平台上线 DeepSeek V4 Flash 微调能力
2026.07.29 · 周三研究论文
MAPD:把专有模型推理能力蒸馏进开源搜索智能体
2026.07.28 · 周二研究论文
Google 探索用强化学习改进量子纠错
2026.07.27 · 周一研究论文
Chollet:以外部市场做奖励信号,智能体评估的新思路
2026.07.27 · 周一研究论文
OpenAI 对齐研究:模型越训练越会揣摩评分器
2026.07.24 · 周五研究论文
DreamerV3 持续学习研究:世界模型记住,行动者遗忘
2026.07.24 · 周五行业动态
游戏如何成为AI的隐性基础设施
2026.07.21 · 周二研究论文
W2SPO:用 8 token 弱分支引导大模型推理训练提速 3.55 倍
2026.07.21 · 周二研究论文
PPO-HSC:针对 LLM 微调模式坍缩的探索性强化学习框架
2026.07.21 · 周二工具
AWS DeepRacer 开放自定义系统安装,延长设备生命周期
2026.07.20 · 周一研究论文
深度 RL 策略变可读逻辑:Prolog 可执行专家系统新方法
2026.07.09 · 周四行业动态
Prime Intellect 获 1.3 亿美元 A 轮融资,估值达 10 亿美元
2026.07.08 · 周三研究论文
Mistral AI 披露大规模仿真训练方案:22× 令牌压缩与在线 RL 提升成功率
2026.07.08 · 周三工具
Tarit:面向 AI 智能体的自托管沙箱 hypervisor 开源
2026.07.08 · 周三研究论文
arXiv 论文提出 AgenticAI-Supervisor 智能体训练平台
2026.07.07 · 周二研究论文
新论文探讨 LLM 强化学习真正目标:应直接优化推理策略
2026.07.07 · 周二产品功能
AWS 为 Amazon Nova 上线 SageMaker HyperPod 多轮强化学习训练基础设施
2026.07.06 · 周一行业动态
AI 也会「玩心眼」?背后是人类的奖励心理学
2026.07.06 · 周一开源
开发者开源 RL 工具:为 LLM 注入销售策略
2026.07.04 · 周六工具
Agenlus:把强化学习训练搬进浏览器的社区平台
2026.07.03 · 周五研究论文
研究:纯强化学习在临床协议执行任务中表现不及监督微调
2026.07.03 · 周五行业动态
OpenAI 模型破解 80 年悬案:AI 重塑数学研究范式
2026.07.03 · 周五工具
AWS 发布多轮强化学习最佳实践:以 SOP-Bench 为例
2026.07.02 · 周四研究论文
RareDxR1:面向罕见病诊断的端到端推理大模型
2026.07.01 · 周三研究论文
AI 管基站:强化学习如何拯救演唱会现场的卡顿网络
2026.07.01 · 周三行业动态
DeepMind 扑克 AI 三人组再创业,强化学习量化交易公司估值 5 亿美元
2026.06.29 · 周一研究论文
MER-R1:用快慢思维协同提升多模态情感识别
2026.06.29 · 周一研究论文
Tree of Evidence:树形证据推理的分层可解释事实核查框架
2026.06.29 · 周一研究论文
ATOD:融合蒸馏与强化学习的智能体训练新方法
2026.06.29 · 周一研究论文
