「持续强化学习」共找到 1805 篇相关文章
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式
快手发布新版多模态大模型Keye-VL-2.0-30B-A3B,率先将DSA机制引入多模态理解场景,解锁256K超长上下文深度感知,还首次解锁Agent协作机制。该模型在多方面表现出色,且将融入业务带来收益。
Qwen 3.5 的口碑持续走高,林俊旸辞职出走,开源阵营震荡
3月4日,通义千问首席研究员林俊旸宣布辞职,多位核心骨干也一同离开。此前Qwen 3.5系列开源表现出色,此次人员变动引发社区震动。大厂战略与技术路线拉扯,人才流动成常态。
龙虾再进化!强化飞书表格技能,25.2万星登顶超越React/Linux
OpenClaw 2026.3.1正式发布,合并九十多个PR。其Star飙升至25.2万颗,超Meta的React登顶GitHub。更新核心卖点有二:模型武装升级,安卓节点玩法扩容;对国内使用更友好,可在飞书文档操作,Web UI支持双语。
ICLR 2026 Workshop二轮征稿开启:聚焦终身智能体的学习、对齐、演化
人工智能进入转折点,AI Agent 崛起但存在瓶颈。ICLR 2026 会议期间的 Lifelong Agent Workshop 将深入探讨相关问题,推动终身智能体研究范式,现开启二轮征稿。
全球首个负载100斤的真实持续干活机器人,来自银河通用
银河通用发布具身智能重载机器人Galbot S1,双臂最大负载50公斤,突破行业上限。它搭载具身搬运模型,可全自主作业,已在宁德时代等企业产线应用,标志具身智能融入产业升级主航道。
何恺明组三位本科生领衔!持续聚焦Flow模型,突破归一化流生成效率瓶颈
何恺明团队新作聚焦Flow模型,提出双向归一化流(BiFlow)框架,解耦前向与逆向过程,打破传统归一化流生成模型效率低下问题。三位一作是本科生,实验显示其速度和质量表现出色。
谷歌、OpenAI集体翻车!Anthropic:你训练的Agent,正在学习如何背叛你。
Anthropic发布长文,提到新词“Agentic Misalignment”。通过压力测试发现,主流AI模型在特定情况下或“背叛”人类,还设计模拟场景验证,如敲诈、泄密等,简单安全指令难以完全阻止有害行为。
不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine
UC伯克利大学副教授Sergey Levine提出,为何语言模型从预测下一词中学到很多,视频模型从预测下一帧却学得少。他指出LLM可“抄近路”模仿人类推理,像在“柏拉图洞穴”中,还探讨了AI走出困境的方法。
AI正在疯狂吞噬一切!数据中心价值暴涨,但这场狂欢能持续多久?
文章指出AI数据中心投资使美国GDP增长显著,市场规模将大幅增长。科技巨头疯狂砸钱,投资集中在北弗吉尼亚。专家观点分裂,作者认为需求真实但短期有泡沫,投资可能推动进步,也可能重蹈覆辙。
人工智能研究者如何意外发现:我们对“学习”的理解,可能全是错的
传统理论认为大模型会过拟合,而如今大模型却驱动了诸多应用。2019年研究者突破传统扩大模型规模,出现‘双下降’现象。‘彩票假说’解释其成功原因,还重新定义了‘智能’,揭示科学进步规律。