算法论文8
智象未来DreamWorld:3D先验驱动视频扩散
机器之心
AI 摘要
智象未来:现有视频扩散模型缺显式3D结构,提出DreamWorld,采用Geometry-then-Appearance两阶段框架,结合3D先验与生成能力,在多基准测试领先。
# Video Diffusion Model# 3D Foundation Model# DreamWorld# Geometry-then-Appearance# Camera-Controlled Video Generation
阅读原文 · 机器之心
用3D几何先验驱动视频扩散,实现更一致的世界生成
视频扩散模型生成新视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在多基准测试表现领先。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
人大与阿里:LoD 0.25秒识破未见攻击
大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。
量子位
算法论文8
吴恩达:丢弃推理token可提速3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
PaperAgent
算法论文7
UniSteer:人类指导让 VLA 强化学习更高效
视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。
机器之心
算法论文8
ClawBench:AI agent真实网站任务集体翻车
ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。
机器之心