生成式推理」共找到 4269 篇相关文章

新闻资讯7

刚刚,Google Veo 3.1 发布,Sora 还香吗?

Google 发布 Veo 3.1,重新定义 AI 视频生成天花板。它对叙事深度理解,新增音频生成,有四大核心能力。网友将其与 Sora 2 对比,二者各有千秋。还介绍了 Veo 3.1 使用方及 Flow 平台成果。

AGI Hunt
算法论文8

细节直逼亚毫米级!港科广分层建模突破3D人体生成|CVPR 2025

港科广团队提出MultiGO创新方案,借助分层建模思路突破3D人体生成难题。该方案通过三级几何学习框架提升重建质量,在多个测试集上性能领先,且在多领域有应用优势,研究成果入选CVPR 2025,项目代码将开源。

量子位
算法论文8

Monet:赋予多模态大模型如人类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心
算法论文8

ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流

大语言模型在空间领域应用广泛,复杂地理分析问题需组织自然语言成可执行流程。Spatial - Agent 加入 GeoFlow Graph 中间层,借用 GIScience 理论,实验显示能提升准确率,不过仍受数据质量等限制。

机器之心
新闻资讯8

小米罗福莉:MiMo-V2.5如何做到又快又强又便宜? | ICML 2026

2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。

AI科技评论
算法论文8

港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型

香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。

机器之心
新闻资讯7

GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem

北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。

新智元
新闻资讯8

Veo 3逼真脱口秀爆火全网,网友:彻底超越恐怖谷!Sora已被完爆

Veo 3生成的脱口秀视频全网爆火,人物、场景真实,声音和嘴型能对上,已超越恐怖谷。它或让人类进入‘模糊时代’,还会颠覆游戏、电影、广告等行业,未来AI生成内容或远超非AI内容。

新智元
新闻资讯8

Jeff Dean最新访谈:基础模型越来越强,小团队如何与谷歌等巨头竞争?

Jeff Dean 在 Y Combinator 活动中与 Diana Hu 对谈,探讨 AI 创业者面临的问题。他指出推理成新瓶颈,预计有更多推理硬件;Agent 执行复杂任务进步快;小团队可找 1%成功率问题;还提及稀缺能力及创业建议。

DeepTech深科技
开源动态8

抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o

抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。

量子位