世界模型生成」共找到 8925 篇相关文章

算法论文8

ICLR 2026 | Rebuttal 是一场「带着镣铐的舞蹈」?港科 RebuttalAgent 用心智理论「读懂」审稿人

香港科技大学研究团队提出 RebuttalAgent 框架,将心智理论引入学术 Rebuttal 任务。它通过 TSR 框架拆解任务,先‘读心’再‘落笔’,能生成有说服力回复,还可作为‘思维外挂’提升小模型表现。

机器之心
新闻资讯8

寻找最强具身大脑!全球机器人顶会ICRA开启报名,智元全程陪跑带你拿奖

由智元主办的AGIBOT WORLD CHALLENGE @ICRA 2026赛事开启报名,设推理 - 操作和世界模型两赛道。智元提供顶配硬件、仿真平台、数据集和基线模型,还有超百万美元奖金与资源,助力开发者。

量子位
8

4倍无损压缩Diffusion,6倍加速!仅需时间特征维护 | TPAMI'25

扩散模型时间特征对量化敏感,现有量化方法会致其扰动,影响图像质量。港科大等多校团队提出TFMQ - DM框架,优化时间特征相关模块,提升低比特量化性能,实现硬件加速。

新智元
新闻资讯9

The Batch: 981 | Ox Alpha 被揭晓为 GLM-5.3-Flash

本文是DeeplearningAI The Batch专栏的AI行业资讯,揭秘此前匿名上线爆火的Ox Alpha模型,公开其为Z.ai推出的GLM-5.3-Flash,详细介绍该模型的架构、性能、定价与授权信息。

DeeplearningAI
产品应用7

SkyReels-Audio让嘴型和音频完美匹配不再难

音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。

带你学AI
开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。

机器之心
产品应用8

全网实测Gemini Omni!一句话改视频,草图变大片

谷歌在Google I/O大会推出Gemini Omni,它结合推理与生成能力,在多方面有重大飞跃,能生成逼真视频等。它打破命名体系,训练目标不同,有涌现能力,谷歌还为其设置限制。

新智元
开源动态8

最强大脑组合!全球SOTA的逻辑和记忆CodeBrain-1&MemBrain1.5同时开源

世界模型初创公司Feeling AI正式发布并开源MemBrain1.5和CodeBrain-1,终结AI“无状态”工具时代。CodeBrain提升模型操作成功率、降低成本,MemBrain重构记忆系统,二者助力Agent能力升级。

机器之心
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
算法论文9

零样本刷新三项基准:ZeroDiff++让AI边考试边学习 | TPAMI'26

本文介绍发表于IEEE TPAMI 2026的ZeroDiff++模型,是ICLR 2025 ZeroDiff的扩展工作,针对生成式零样本学习的虚假语义关联、分布脱节问题提出新框架,在三项主流基准刷新成绩

量子位