两阶段推理」共找到 3117 篇相关文章

开源动态8

多人会话视频生成新突破:香港科技大学,浙江大学用单人数据实现多人交互视频生成

香港科技大学、浙江大学等开源 AnyTalker,提出音频驱动多人交互生成新范式。它用创新机制和阶段训练策略,以少量数据实现多人视频生成,还构建评估指标,性能超现有方法。

AIGC开放社区
算法论文8

谷歌发布首个AI+教育RCT实验,传统教材要凉?

谷歌论文提出Learn Your Way AI增强型教科书系统,有阶段AI生成框架,构建完整学习体验。经专家评审和RCT证明,使用该系统的学生学习效果和体验更好,还介绍了其可用场景。

CourseAI
推荐文章7

本周六直播预约 | Test-Time Reasoning综述分享!

当大模型训练成本飙升、数据枯竭,推理阶段扩展Test-Time Scaling(TTS)成研究热点。论文提出四维正交分析框架,梳理主流技术路线,提炼发展路径,给出操作指南与未来思考,本周六将直播分享该综述。

深度学习自然语言处理
算法论文7

人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架

人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整阶段

CourseAI
算法论文8

MoCa:首个大规模双向多模态表征模型

为解决VLM用于嵌入的痛点,中国人民大学等机构研究者提出MoCa框架,可将单向注意力VLM训练成双向多模态编码器。它分阶段,实验效果好,未来可拓展模态、提升多语言适应等。

PaperAgent
产品应用8

字节跳动2步突破,复杂文档布局解析,为啥如此惊艳?

文章指出现有文档图像解析方案有局限,介绍字节跳动的Dolphin解决方案。它采用分析 - 解析范式分阶段解析文档,避免传统方法弊端,运行效率高,还给出训练方案、实战代码和试用链接。

CourseAI
算法论文8

NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?

深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。

深度学习自然语言处理
产品应用7

AI 当导演编剧和剪辑?FilMaster打开自动化电影创作新纪元

当前多数AI电影生成系统难达‘专业级’,香港大学推出FilMaster系统。它融合摄影语言与后期制作流程,分阶段创作电影,能生成高质量作品,但高级后期制作技术未纳入。

带你学AI
开源动态8

阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源

阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。

量子位
算法论文8

ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架

北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备可解释性和可编辑性。

机器之心