多模态任务」共找到 2681 篇相关文章

算法论文8

RAG 2.0 深入解读

文章深入解读RAG 2.0,指出其虽在多行业落地,但面临多模态处理、检索质量等挑战。还介绍架构升级,阐述检索、重排序等关键技术,最后探讨统一多模态大模型、安全等发展方向及挑战。

阿里云开发者
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
产品应用8

智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化

北京智源研究院发布大规模多模态世界模型“悟界·Emu3.5”,它能模拟复杂动态物理世界,揭示“多模态Scaling范式”。该模型继承深化Emu3技术哲学,在多方面有提升,为世界模型领域提供进化路线。

AI科技评论
推荐文章7

99%的人只发挥出了龙虾的1%的能力:龙虾邪修养法

博主Alex Finn分享让OpenClaw效能提升100倍的核心方法论,即构建专属任务控制中心。介绍了任务看板、日历面板等核心工具模块,还指出不要盲目抄袭,要用反向提示词定制工具面板。

AI寒武纪
新闻资讯7

现实魔幻!我在AI跑腿网站标价350,和2万碳基同胞一起排队抢单

AI开始雇佣人类跑腿,rentahuman.ai这个赛博“用工市场”上线不到48小时,AI储备的人类劳动力就破万,AI发任务和报酬,人类注册接单,任务内容多样,有网友已收到报酬。

量子位
开源动态8

DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude

DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。

AIGC开放社区
算法论文8

不止修bug:Agentic Coding评测走向复杂feature交付新阶段

中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。

机器之心
产品应用8

从0到1带你速通 Marvis马维斯

AI 时代,Agent 产品虽强但普通用户使用门槛高。本文详细介绍腾讯 Marvis,它能让 AI 直接理解电脑,可执行多项任务。作者实测 6 个任务展示其功能,认为它是面向普通用户的系统级 AI 管家。

腾讯技术工程
产品应用8

谷歌Nano Banana全网刷屏,起底背后团队

谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。

机器之心
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位