「全模态统一建模」共找到 815 篇相关文章
扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%
论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供新范式。
腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒
腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。
刚刚,面壁小钢炮开源进阶版「Her」,9B模型居然有了「活人感」
2月4日,面壁开源全双工全模态大模型MiniCPM - o 4.5,在多方面达SOTA水平。它能边看边听边说,实现自主交互。实测中表现如真人,其架构和机制有创新,还适合端侧部署,或开启人机交互新时代。
大模型API的大众点评来了:7×24小时实测,毫秒级延迟智能路由,选API必备
清程极智推出的AI Ping像大模型API领域的大众点评,用7×24小时实测数据为开发者提供参考,解决信息差和重复劳动问题。它有持续评测榜单、智能路由匹配等功能,还统一了API度量衡,推动选型从经验走向数据驱动。
对话八位具身智能大咖:模型之争、数据来源与第一性原理|甲子光年
在11月20日智源具身OpenDay上,甲子光年创始人张一甲与八位具身智能领域核心践行者对话。探讨世界模型、统一架构等问题,指出具身智能虽前景好,但面临数据、模型等困境,各方分享应对策略与决策原则。
Nano banana手办玩法火爆出圈!无需抽卡,效果惊了(°o°)
小某书被AI手办图刷屏,原来是谷歌的nano - banana(Gemini 2.5 Flash Image)模型爆火。文章实测其手办玩法,还介绍多种玩法,团队透露以文本渲染评估、原生多模态等核心技术,谷歌未来想整合模态实现AGI,还将举办黑客松。
Tair 短期记忆架构实践:淘宝闪购 AI Agent 的秒级响应记忆系统
本文从淘宝闪购与千问合作的‘一句话点外卖’项目出发,介绍 Tair 在 AI Agent 记忆管理中的数据模型设计、压缩策略与并发控制等关键实践,展示其在低延迟、数据建模、并发安全和弹性抗压等方面的能力。
GPT-5 终于发布:别慌、AGI 还没来,第一手的上手体验在这里
GPT-5 发布,距离 GPT-4 发布已过 2 年。它能力强、定价有竞争力,是首个「统一」AI 模型,幻觉率低、代码能力强。免费用户可默认使用,Plus 和 Pro 订阅用户有不同使用额度。开发者可使用三种模式,代码能力测试案例可参考相关网站。
阿里一口气发了N款新模型,让我们向源神致敬。
阿里云栖大会发布众多模型,有Qwen3 - Max、Wan2.5等。Qwen3 - Max对标顶尖模型;Wan2.5支持音画同出;Qwen3 - VL是强大视觉语言模型且已开源;Qwen3 - Omni是全模态模型。此外还有多个新模型,构建全场景生态。
Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%
为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。