「训练范式」共找到 2856 篇相关文章
Meta|提出RECAP,通过动态目标重加权回放,解决RLVR遗忘【文末送书!Agent相关】
近年来,可验证奖励强化学习(RLVR)提升了大模型在多任务上的性能,但带来“能力退化”问题。Meta等提出RECAP策略,结合“回放”与“动态目标重加权”,保持模型通用能力,提升推理性能,还提高推理效率。
网友晒 21 页 PDF 质疑 Grok 3 套壳 Claude,Grok 3 自己承认了!xAI 工程师被喷无能
网友 GpsTracker 爆料,埃隆·马斯克旗下 xAI 公司的 Grok 3 模型在“思考模式”下自称是竞争对手 Anthropic 公司的 Claude 3.5。网友提供对话记录和 21 页 PDF 佐证,引发社区对模型异常原因的讨论。
医疗AI十年,终于有人跑通了最难的一关|甲子光年
2026年5月20日,德适AI AutoVision®染色体核型辅助诊断软件获国家药监局第三类医疗器械注册证。这验证了iMedImage®基座模型产出产品可通过最高等级监管审查,为医疗AI产业化提供了可行路径。
QCon 2026 北京站收官:以 AI 之力,重塑软件工程新生态
4月16 - 18日,QCon全球软件开发大会·北京站(2026)举办,超2000人参与。极客邦赵钰莹点明企业AI落地要点;黄东旭等专家分享见解,探讨软件变革、安全等;还有25个专题及展区展示,后续接力6月上海AICon。
清华开源一批「学习虾」,免费的「AI 私教团」来了
清华大学开源全球首个多智能体生成式学习AI技术框架OpenMAIC。它能将技术文档转化为学习课堂,还能解锁多种学习解法。其前身MAIC是重要学习平台,应用不断迭代,OpenMAIC功能强大,边界不止于课堂。
ICLR 2026 Workshop二轮征稿开启:聚焦终身智能体的学习、对齐、演化
人工智能进入转折点,AI Agent 崛起但存在瓶颈。ICLR 2026 会议期间的 Lifelong Agent Workshop 将深入探讨相关问题,推动终身智能体研究范式,现开启二轮征稿。
苏妈和李飞飞炸场CES!AMD AI全栈野心显露:从云端到个人PC,AI芯片性能四年要飙1000倍
今年 CES 上 AMD 专场演讲亮点多。苏姿丰称未来五年50亿人每天用 AI;李飞飞和她探讨空间智能与世界模型;Helios 平台受关注,MI455 GPU 解决内存墙;Ryzen AI 推动 AI 下放到本地。
ImageNet分数越高,生成反而越糊?iREPA给出解释
Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。
西工大张伟伟等:强化学习如何练就近距空战制胜法则?| 航空学报CJA
本文针对空战智能化需求,构建高保真近距对抗仿真平台,提出优化自博弈强化学习架构。该智能决策系统与成熟飞行员近距格斗胜率超75%,为智能空战发展提供技术支撑。
首个多人对话视频生成框架MultiTalk,角色有表情还能互动
现有音频驱动人体动画方法多聚焦单人,处理多音频流能力弱、指令跟随有局限。中山大学提出多人对话视频生成新框架MultiTalk,介绍了技术原理,演示效果显示其指令跟随能力强、伪影少。