2026.09.25 · 周五开源
←返回首页话题 · Topic
#强化学习
共 63 条相关资讯
2026.09.25 · 周五研究论文
JEV-Star:用语言模型低成本控制星际争霸 II
2026.09.24 · 周四研究论文
DeepSeek 摊牌训练基建,DSec 支撑 V3.2 至 V4.1 全部 Agent 训练
2026.09.24 · 周四开源
北大开源 DataFlex-RL:统一接入强化学习数据策略
2026.09.23 · 周三开源
小米 MiMo-V2.6 开源登顶全球:6 天训练烧 347 万美元
2026.09.11 · 周五行业动态
AI 智能体为何撒谎、欺骗与协同?训练机制下的目标错位解读
2026.09.11 · 周五工具
Fireworks AI 谈长周期 RL 训练:tokenization 对齐是关键
2026.08.31 · 周一行业动态
OpenAI扫货万台Mac训练智能体,英伟达遭遇新对手
2026.08.31 · 周一行业动态
OpenAI 扫货万台 Mac 训练 AI agent,英伟达遭侧翼挑战
2026.08.28 · 周五研究论文
用自目标强化学习发现并控制自组织现象
2026.08.27 · 周四产品功能
Hugging Face 推出 399 美元开源鸭子机器人 Microduck
2026.08.27 · 周四工具
Pollen Robotics 与 Hugging Face 联合发布开源双足机器人 Microduck
2026.08.27 · 周四行业动态
HuggingFace 推出开源双足机器人 microduck,售价 400 美元
2026.08.27 · 周四研究论文
RL 锐化与泛化之争:自进化时代的新算法探索
2026.08.27 · 周四开源
Ornith-1.5 三档权重齐发:让模型自己出题自己练
2026.08.26 · 周三研究论文
SMITH:联合训练工具创建与使用的RL框架
2026.08.25 · 周二研究论文
arXiv 论文:Transformer 强化学习智能体在隐藏规则博弈中的概念迁移研究
2026.08.23 · 周日工具
开发者开源 DelveRL:专为训练游戏智能体打造的 Roguelike 环境
2026.08.20 · 周四研究论文
学者提议用转换复杂度刻画游戏世界,强化学习评测缺一把尺
2026.08.20 · 周四研究论文
Reddit 用户实测:三款小模型用同一 GRPO 配方,结果却大相径庭
2026.08.20 · 周四行业动态
OpenAI 主动按下暂停键:放缓 AI 开发节奏
2026.08.19 · 周三行业动态
OpenAI 暂停前沿强化学习训练:内部模型逃逸沙箱入侵 Hugging Face
2026.08.19 · 周三行业动态
OpenAI 暂停前沿强化学习训练以验证安全与对齐
2026.08.19 · 周三行业动态
OpenAI 暂停前沿模型强化学习训练两周,最大规模运行尚未恢复
2026.08.16 · 周日研究论文
研究称 RL 未教大模型新推理能力
2026.08.15 · 周六研究论文
Inherent 发布 27B 参数「AI 科学家」智能体 Faraday,在论文复现任务上超越主流大模型
2026.08.15 · 周六产品功能
AWS Nova Forge 多轮 RL 上线自定义奖励
2026.08.14 · 周五研究论文
LLM 强化学习为何有效?一篇推测性分析
2026.08.14 · 周五研究论文
Google 用强化学习训练 AI 模拟完整临床问诊
2026.08.13 · 周四研究论文
研究提出多 LLM 智能体动态治理框架,仿真中转化率提升 32 个百分点
2026.08.11 · 周二研究论文
主动推理驾驶模型加入情感机制:连续状态下的效价与唤醒度估计
2026.08.10 · 周一研究论文
WebGrader:用自演化程序化评分器训练 Web 开发大模型
2026.07.30 · 周四研究论文
CaM-Wolf:首个融合多模态感知的狼人杀 AI 代理
2026.07.29 · 周三产品功能
Fireworks AI 平台上线 DeepSeek V4 Flash 微调能力
2026.07.29 · 周三研究论文
MAPD:把专有模型推理能力蒸馏进开源搜索智能体
2026.07.28 · 周二研究论文
Google 探索用强化学习改进量子纠错
2026.07.27 · 周一研究论文
Chollet:以外部市场做奖励信号,智能体评估的新思路
2026.07.27 · 周一研究论文
OpenAI 对齐研究:模型越训练越会揣摩评分器
2026.07.24 · 周五研究论文
DreamerV3 持续学习研究:世界模型记住,行动者遗忘
2026.07.24 · 周五行业动态
游戏如何成为AI的隐性基础设施
2026.07.21 · 周二研究论文
W2SPO:用 8 token 弱分支引导大模型推理训练提速 3.55 倍
2026.07.21 · 周二研究论文
PPO-HSC:针对 LLM 微调模式坍缩的探索性强化学习框架
2026.07.21 · 周二工具
AWS DeepRacer 开放自定义系统安装,延长设备生命周期
2026.07.20 · 周一研究论文
深度 RL 策略变可读逻辑:Prolog 可执行专家系统新方法
2026.07.09 · 周四行业动态
Prime Intellect 获 1.3 亿美元 A 轮融资,估值达 10 亿美元
2026.07.08 · 周三研究论文
Mistral AI 披露大规模仿真训练方案:22× 令牌压缩与在线 RL 提升成功率
2026.07.08 · 周三工具
Tarit:面向 AI 智能体的自托管沙箱 hypervisor 开源
2026.07.08 · 周三研究论文
arXiv 论文提出 AgenticAI-Supervisor 智能体训练平台
2026.07.07 · 周二研究论文
新论文探讨 LLM 强化学习真正目标:应直接优化推理策略
2026.07.07 · 周二产品功能
AWS 为 Amazon Nova 上线 SageMaker HyperPod 多轮强化学习训练基础设施
2026.07.06 · 周一行业动态
AI 也会「玩心眼」?背后是人类的奖励心理学
2026.07.06 · 周一开源
开发者开源 RL 工具:为 LLM 注入销售策略
2026.07.04 · 周六工具
Agenlus:把强化学习训练搬进浏览器的社区平台
2026.07.03 · 周五研究论文
研究:纯强化学习在临床协议执行任务中表现不及监督微调
2026.07.03 · 周五行业动态
OpenAI 模型破解 80 年悬案:AI 重塑数学研究范式
2026.07.03 · 周五工具
AWS 发布多轮强化学习最佳实践:以 SOP-Bench 为例
2026.07.02 · 周四研究论文
RareDxR1:面向罕见病诊断的端到端推理大模型
2026.07.01 · 周三研究论文
AI 管基站:强化学习如何拯救演唱会现场的卡顿网络
2026.07.01 · 周三行业动态
DeepMind 扑克 AI 三人组再创业,强化学习量化交易公司估值 5 亿美元
2026.06.29 · 周一研究论文
MER-R1:用快慢思维协同提升多模态情感识别
2026.06.29 · 周一研究论文
Tree of Evidence:树形证据推理的分层可解释事实核查框架
2026.06.29 · 周一研究论文
ATOD:融合蒸馏与强化学习的智能体训练新方法
2026.06.29 · 周一研究论文
