双模式引擎」共找到 982 篇相关文章

算法论文8

从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范

在生成视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测体系,实验表现优,有效率和 3D 应用潜力。

机器之心
推荐文章8

藏师傅开发的 Codepilot 保姆级入门攻略

本文是藏师傅开发的 Codepilot 全平台通用开源 Agent 客户端的保姆级入门攻略,介绍了其特色功能,涵盖安装、配置服务商、聊天、技能使用等方面,助读者快速上手。

歸藏的AI工具箱
算法论文8

港中文薛天帆团队:实现 4K 全景视频生成,普通视频也能「长出空间」丨CVPR 2026

香港中文大学薛天帆团队提出CubeComposer框架,可将普通视角视频扩展成原生4K的360°视频。研究在两个数据集测试,结果显示其在多指标上优于基线。该成果突破技术上限,让普通人也能制作360°视频。

AI科技评论
开源动态7

静态技能已死:cognee怎么让AI自己修自己的prompt

文章指出当前agent技能存在silent drift问题,Cognee作为开源知识引擎,将skills视为活的系统组件,通过Skill Ingestion、Observe、Inspect、Amend、Evaluate & Update五步实现自我进化,还介绍了相关应用及社区反应。

AI工程化
新闻资讯7

一年一度最值得关注的AI榜单来啦!申报即日启动

中国生成AI进入产业深水区,值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品,介绍了参选条件、评选维度,即日起报名,4月27日截止,结果5月峰会公布。

量子位
算法论文8

ERNIE 5.0:走向原生统一的万亿参数多模态基础模型

过去多模态模型‘拼接’方案存在理解与生成割裂问题,ERNIE 5.0 借此提出,用统一自回归框架做多模态理解与生成,在架构、训练与系统层面有创新,评测中各模态能力表现出色。

深度学习自然语言处理
算法论文7

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了

过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。

AINLPer
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
开源动态8

罗福莉携小米MiMo-V2-Flash首次亮相:一次在推理与Agent上的下注|甲子光年

大模型进入新阶段,效率成能力一部分。小米MiMo团队12月16日晚发布并开源MiMo - V2 - Flash,负责人罗福莉首亮相。该模型在推理、编程和智能体场景表现出色,在架构、训练方法等有创新。

甲子光年
新闻资讯7

天孚通信市值1600亿,小镇青年如何逆袭江西宜春首富?

A股市场上,由新易盛、中际旭创、天孚通信组成的光模块“易中天”走红。天孚通信市值达1600亿,其创始人邹支农出身农村,带领公司造出国产陶瓷套管并上市。公司前瞻性布局契合AI算力需求,深度绑定英伟达,业绩增长显著。

芯师爷