多模态能力」共找到 3767 篇相关文章

开源动态8

阿里开源Mobile-Agent-v3:多模态GUI智能体,实现跨平台自动化突破!

全新自动化时代,GUI智能体融入日常。阿里巴巴通义实验室推出GUI - Owl与Mobile - Agent - v3,实现跨平台自动化突破。文章解析其发展历程、技术创新,且项目开源,商业化潜力引关注。

AIGC开放社区
算法论文8

仅需152个样本,性能提升48%:Memory-R1如何重塑Agent记忆能力

这篇文章解读论文Memory - R1,其由多所高校研究团队完成,旨在解决LLM在长对话和多轮任务中的‘记忆难题’。通过强化学习让LLM学会管理记忆,用152个问答对训练,大幅超越现有基线模型。

深度学习自然语言处理
7

Meta两员大将回流OpenAI,30天爆赚800万?刚入职闪回巢,小扎钞能力失效

Meta成立两月的“梦之队”MSL痛失三位核心研究员,两位前OpenAI员工入职一月回流,另一位因小扎一句话离职,十年老将也将加入OpenAI。Meta高薪挖人,却因内部重组、研发问题等面临人才流失。

新智元
产品应用8

阶跃星辰发布新一代基模 Step 3,原生多模态推理模型,性能达到开源 SOTA

WAIC 2025期间,阶跃星辰上线新一代基础大模型Step 3,7月31日将面向全球开源。还成立“模芯生态创新联盟”,与上海国有资本投资有限公司合作。Step 3性能达开源SOTA,推理效率高,适配多种芯片。

Founder Park
开源动态8

碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强

国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。

AIGC开放社区
算法论文8

传统RAG只会翻书不会用?RAG+让Reasoning能力上一个新高度!

现有检索增强生成(RAG)技术在需复杂推理领域表现不佳,像只给菜谱不给实操演示。RAG+开创性新增“应用案例库”,与知识库构成双料库,在数学、法律、医疗场景测试中全面碾压传统方案,团队还透露了未来方向。

深度学习自然语言处理
算法论文8

扩散语言模型扛把子LLaDA迎来新版本,数学、代码、对齐能力均提升

中国人民大学与蚂蚁集团团队基于前期 8B 扩散语言模型 LLaDA,提出方差缩减的偏好优化方法 VRPO,推出 LLaDA 1.5。它在数学、代码、对齐任务上性能提升,VRPO 为扩散语言模型对齐提供框架。

机器之心
产品应用8

Karpathy教你值回ChatGPT 200刀「票价」,初创工程师揭秘ChatGPT最核心能力

AI大神Andrej Karpathy用一张图教你选ChatGPT模型,给出使用指南,如简单问题用4o,困难问题用o3等。初创工程师Eric Hayes揭秘其背后复杂记忆系统,含保存记忆、聊天历史等,提升了用户体验。

新智元
新闻资讯7

多模态扩散模型开始爆发,这次是高速可控还能学习推理的LaViDa

近期基于扩散模型的视觉 - 语言模型 LaViDa 出现,它继承扩散语言模型优点。与自回归模型不同,扩散模型能并行、处理双向上下文。LaViDa 在多任务测试有竞争力,推理蒸馏和文本填空表现好,还能权衡速度与质量。

机器之心
算法论文8

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。

机器之心