「多任务能力」共找到 7220 篇相关文章
让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力
上海交大等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。
最强协作模型?MiniMax M2.7 实测:AI开始更会合作了 | Claude Teams
MiniMax M2.7模型发布,强调模型自我进化、Agent Harness和Agent Teams。它能构建复杂Agent Harness,完成高难度生产力任务。其能力达国际一线水平,在多测试中成绩优异。还介绍了Harness、Agent Teams等概念及应用场景。
微软发布多智能体 Web 操作系统!让 AI 成为真正“可控、协同、透明”的网页执行助手!
微软推出新一代多智能体 Web 操作系统 Magentic - UI,它能自动浏览网页、处理数据等,具备多智能体协同能力。其界面透明可控,功能丰富,安装使用友好,适用于多种复杂场景。
企业级 Agent 多智能体架构与选型指南 -- 来自1000+行业应用实践积累
本文基于超1000+智能体应用实践经验,介绍企业级Agent多智能体架构。强调单智能体优先,介绍AgentScope支持的多智能体模式,对比工作流与对话模式,给出架构选型指南,还提及Spring AI Alibaba Graph为多智能体提供的能力。
Agent RL和智能体自我进化的关键一步: TaskCraft实现复杂智能体任务的自动生成
当前智能体训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能体任务,构建并开源含约 41,000 条任务的数据集,支撑智能体训练评估。
AI 驱动的多代理金融工作台
Vibe-Trading 是 AI 驱动的多代理金融工作台,能将自然语言请求转化为交易策略等。它有自然语言转策略、多数据源、专家团队等核心能力,具备面向交易的深度研究等功能,还介绍了安装方式、环境变量和推荐模型。
从 RLVR 到 RLSVR:开放式任务如何获得可核验奖励
COLM 2026 论文提出 RLSVR 及 SpyRL,把摘要等开放任务变成“谁是卧底”游戏,用投票生成可核验奖励,在多任务有提升,但也暴露代理目标与质量关系、成本等问题。
JinaVDR: 一个图文混排文档搜索任务的基准集
现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。