两阶段训练策略」共找到 3209 篇相关文章

新闻资讯7

模力工场 032 AI 应用榜:桌面 Agent 强势来袭,阶跃登顶本周榜首

模力工场032周AI应用周榜出炉,25款应用上架。本期用户讨论最高的是桌面Agent形态,AI从“对话框助手”走向“接管桌面执行者”。还精选十款应用解读行业风向,反映AI正进入执行与交付阶段

AI前线
算法论文8

LLM-in-Sandbox:给大模型一台电脑,激发通用智能体能力

来自中国人民大学、微软研究院和清华的研究者提出LLM - in - Sandbox范式,让大模型在代码沙盒完成任务,实验显示其能提升多领域表现,无需额外训练,还能减少token消耗,研究者认为应取代纯LLM推理。

机器之心
算法论文8

无需奖励函数!我们意外构建了自我进化的AI系统

牛津大学发现LLM可通过“部署 - 验证 - 再训练”循环自我进化,绕开人工奖励函数设计瓶颈。在三个经典规划领域实验效果惊人,还在理论上证明其与强化学习的数学等价关系,有优势也有隐患。

AI工程化
开源动态8

LeCun预言成真!790年长视频,炼出最强开源「世界模型」

2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。

新智元
算法论文8

AGI前夜重磅:RL突破模型「认知上限」,真·学习发生了!

AI研究圈争论RL能否赋予模型超越基础模型的推理能力。UC Berkeley等团队提出DELTA框架,观察到“RL grokking”现象,还设计新任务验证,提出两阶段奖励调度,总结两种模式等,为争论带来新依据。

新智元
算法论文8

超越90%城市规划师!清华、MIT等提出人机协作新范式 | Nature子刊

清华大学联手MIT等机构提出「大语言模型+规划师」新框架,让AI作「智能规划助手」。框架含概念设计、方案生成、效果评估三阶段,实验显示AI表现超九成人类规划师,未来将人机协同。

新智元
开源动态8

开源播客生成MoonCast:让AI播客告别"机械味",中英双语对话更自然!

MoonCast是革新性对话式语音合成模型,已开源。它借助LLM让剧本有干货与人味,采用全面规模化策略使音频合成更自然,性能在双语长对话播客上提升显著,接近真人播音效果。

量子位
算法论文7

LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%

最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。

新智元
推荐文章8

从Vibe Coding到Harness—— 一套大仓AI工程化实战

这是腾讯后端微服务与前端微应用大仓的 Harness 实战分享。介绍了 TAB 工程背景、Harness 组成部分,阐述阶段划分、Agent 演进等,还提及人工关卡、门禁脚本等要点,总结了经验与限制。

腾讯技术工程
算法论文8

CMU&NYU最新工作解释:存储在权重里的“智能”是从哪来的?

论文《From Entropy to Epiplexity》指出经典信息论在AI面前有三大悖论,提出用Epiplexity度量信息。它将数据信息拆为Time - bounded Entropy和Epiplexity,通过神经网络训练近似计算,实验验证其有效性,并给出启示。

深度学习自然语言处理