「多模态融合」共找到 1363 篇相关文章
钉钉不说话,默默把 AI 表格干到了 1000 万热行
钉钉 AI 表格单表容量突破 1000 万热行,成业内首个实现该能力的智能表格。它基于阿里 AI 技术重构底层架构,实现性能与智能融合,在业务场景应用效果好,推动 AI 办公进入‘原生时代’。
老黄回应英伟达入股英特尔
英伟达50亿美元入股英特尔,将持有超4%股份成大股东之一。双方要联合开发用于PC和数据中心的AI芯片,未来芯片或成CPU与GPU融合的超级芯片。此合作或冲击AMD和台积电。
ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成
本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。
生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025
上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。
DeepSeek-V3.2正式版发布,将开源模型的能力推向极致
DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。
深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas
近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。
瓦卡奖AI视觉创意大赛·从人工智能专家跨文化对话到全球AI厂商的竞技
10月17 - 19日,第二届瓦卡奖AI视觉创意大赛在深圳举行。期间AI全球视觉工作坊汇聚专家探讨AI与艺术融合,竞技日集结全球AI视频厂商民间团队参赛。大赛还发布国内首部《AI视觉创意应用蓝皮书》。
这个真人版《火影忍者》竟然是AI做的,来自中国AI视频新王者Vidu Q3
开年国产AI竞争激烈,AI视频生成圈新出全球首个支持16秒音视频直出的Vidu Q3。它能全自动生成,语言支持多语种,经权威认证排名中国第一、全球第二,可实现图生和文生音视频,提升了AI视频生成能力。
2026 初的大模型,离电影 Her 还有多远?
作者重看电影《Her》后,对比 2026 年初现实 AI 与电影中萨曼莎的能力,从七个维度分析差距。指出功能性上已接近,但存在性层面差距大,还探讨了 AI 发展趋势与存在意义。
一个模型统一4D世界生成与重建,港科大One4D框架来了
港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。