多任务能力」共找到 7220 篇相关文章

开源动态8

让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现模态智能体能力

上海交大等团队推出模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在任务超 GPT-4o。

机器之心
开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM任务处理潜力,为自动驾驶等领域带来前景。

新智元
开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为领域带来前景。

新智元
产品应用7

最强协作模型?MiniMax M2.7 实测:AI开始更会合作了 | Claude Teams

MiniMax M2.7模型发布,强调模型自我进化、Agent Harness和Agent Teams。它能构建复杂Agent Harness,完成高难度生产力任务。其能力达国际一线水平,在测试中成绩优异。还介绍了Harness、Agent Teams等概念及应用场景。

AI进修生
开源动态8

微软发布智能体 Web 操作系统!让 AI 成为真正“可控、协同、透明”的网页执行助手!

微软推出新一代智能体 Web 操作系统 Magentic - UI,它能自动浏览网页、处理数据等,具备智能体协同能力。其界面透明可控,功能丰富,安装使用友好,适用于种复杂场景。

开源星探
推荐文章8

企业级 Agent 智能体架构与选型指南 -- 来自1000+行业应用实践积累

本文基于超1000+智能体应用实践经验,介绍企业级Agent智能体架构。强调单智能体优先,介绍AgentScope支持的智能体模式,对比工作流与对话模式,给出架构选型指南,还提及Spring AI Alibaba Graph为智能体提供的能力

阿里云开发者
开源动态8

Agent RL和智能体自我进化的关键一步: TaskCraft实现复杂智能体任务的自动生成

当前智能体训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能体任务,构建并开源含约 41,000 条任务的数据集,支撑智能体训练评估。

机器之心
产品应用7

AI 驱动的代理金融工作台

Vibe-Trading 是 AI 驱动的代理金融工作台,能将自然语言请求转化为交易策略等。它有自然语言转策略、数据源、专家团队等核心能力,具备面向交易的深度研究等功能,还介绍了安装方式、环境变量和推荐模型。

GitHubStore
算法论文7

从 RLVR 到 RLSVR:开放式任务如何获得可核验奖励

COLM 2026 论文提出 RLSVR 及 SpyRL,把摘要等开放任务变成“谁是卧底”游戏,用投票生成可核验奖励,在任务有提升,但也暴露代理目标与质量关系、成本等问题。

深度学习自然语言处理
开源动态8

JinaVDR: 一个图文混排文档搜索任务的基准集

现有文档检索基准大只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含语言、领域数据,可评估模型在复杂视觉文档的检索性能。

Jina AI