「通用多模态推理」共找到 3298 篇相关文章
这张信息图,居然是8B开源模型做的??
商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。
关于具身智能「触觉」,你想知道的都在这篇综述里了
本文由香港科技大学(广州)熊辉教授团队牵头,联合多所高校,全面梳理截至2026年第一季度具身智能触觉前沿研究。介绍触觉重要性、多模态触觉融合流程、全景蓝图,指出面临挑战并展望未来。
360发布全球最强视觉语言对齐模型!榜单全面领先!
360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。
开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具
Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。
GPT-5:我更强了,就这?“看不见”的升级
OpenAI 发布 GPT - 5,它未带来 AGI 相关的震撼升级,而是更注重实用。其训练有新特点,具备推理强、编程能力提升等特性,是 AI 从‘模型炫技’到‘产品体验打磨’转变的标志。
先别急着给OpenAI加冕!陶哲轩:这种「金牌」,含金量取决于「赛制」
OpenAI 官宣推理模型在 IMO 获金牌水平成绩,此前各模型表现不佳。数学家陶哲轩劝谨慎看待,认为无严格测试条件难比较 AI 与人类。网友看法不一,模型训练方法及 Alexander Wei 受关注。
AI数学能力暴涨100%,自进化直逼RL极限!CMU新作颠覆认知
数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM自我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。
刚刚,DeepSeek首曝V3降成本秘诀!软硬协同突破Scaling天花板
DeepSeek最新论文从硬件架构和模型设计双重视角,探讨如何相互配合实现低成本大规模训练和推理,分析硬件特性对架构选择的影响,研究两者相互依赖关系,还为未来协同设计提出建议。
90后量子计算团队「向量奇点」完成超亿元天使轮融资 | 5Y News
近日,北京量子信息科学研究院孵化的「向量奇点」完成超亿元天使轮融资,由 IDG 资本领投。资金用于研发第一代中性原子通用量子计算机。全球量子科技竞争升温,该团队由青年科研人员组成,未来将攻关核心技术。
谷歌深夜双发!最便宜Nano Banana来了
谷歌深夜上线Nano Banana 2 Lite和Gemini Omni Flash。前者是最快最便宜文生图模型,4秒生图且成本低;后者是视频生成模型,支持多模态输入和对话式编辑。二者串联打通创作流水线,还集成SynthID水印技术。