多视角视频扩散框架」共找到 1329 篇相关文章

算法论文8

智能体如何学会「想象」?深度解析世界模型嵌入具身系统的三大技术范式

长期以来具身智能系统缺预测力,世界模型让智能体有了‘想象’未来的能力。中科大等机构团队综述将现有研究划分为模块化、顺序、统一三大架构集成范式,并指出未来研究方向。

机器之心
推荐文章8

和快手聊了之后才知道,传统搜索早变天了

文章从工程师视角剖析现代搜索,指出传统搜索难适应多模态内容世界。快手推出 UniDex 和 UniSearch,前者变革搜索倒排,后者为统一生成式搜索架构,二者成快手新一代工业搜索‘双引擎’,有广阔应用前景。

MacTalk
算法论文8

谢赛宁×李飞飞×LeCun首次联手!寒武纪-S「空间超感知」AI震撼登场

Yann LeCun、李飞飞和谢赛宁联手发布论文「Cambrian - S:迈向视频中的空间超感知」。他们认为LLM虽能力强,但无法像人类一样感知世界,为此构建Cambrian - S系列模型,开源相关数据和模型,还开发了新原型。

新智元
新闻资讯8

OpenAI引爆新赛道:AI不再卖技术,而是卖「活人感」!

一段小女孩与AI玩具深情告别的视频走红,揭示对话式AI融入人类情感世界。声网Convo AI&RTE 2025大会指出对话式AI将成下一代AI Infra重要部分,情感陪伴、智能硬件、在线教育将率先规模化落地。

新智元
开源动态8

超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦

中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。

量子位
推荐文章7

如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性

文章通过分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在大规模 AI 训练中的表现。介绍三类训练负载及新的 Checkpointing 负载,分析共享文件系统类别,给出比较视角,解读各负载测试结果并总结选型要点。

InfoQ
新闻资讯7

知名机器人专家喊话:投人形机器人初创公司的数十亿美元,正在打水漂

知名机器人专家罗德尼・布鲁克斯质疑特斯拉、Figure等公司技术路线,称让机器人看人类视频学操作是‘空想’。他指出触觉数据无技术积累、安全有隐患,预测成功‘人形’机器人未来将大不同,投资难量产。

AI前线
新闻资讯7

Sora 2数手指翻车,奥特曼成第一批「受害者」,被AI玩成最惨打工人

Sora 2虽强大,但数手指测试翻车,模拟场景也有瑕疵。奥特曼成其首批“受害者”,AI生成视频将他玩坏。同时,OpenAI研究员对Sora应用发布存担忧,而奥特曼解释资金投入原因。

机器之心
新闻资讯8

又来了!OpenAI 发布 Sora 2,同时推出 AI 版Tiktok

9月30日,OpenAI发布新一代视频生成模型Sora 2,相比Sora 1有显著提升。同时推出iOS社交应用Sora,类似TikTok。应用有安全措施,已在美加iOS平台邀测。社区反应两极分化,OpenAI野心大但或面临挑战。

AI工程化
推荐文章8

对话经济周期大师拉斯·特维德:AI 创造了万亿价值,但在统计上,你我可能都因它而“变穷”了

本文是对经济周期大师拉斯·特维德的访谈。他与他人合著《超智能与未来》,写作中大量用AI。他认为AI如工业革命,虽创造巨大价值,但面临能源挑战,且经济周期仍会存在,还探讨了AI对社会各方面的影响。

AI科技大本营