「任务感知能力」共找到 4751 篇相关文章
视觉强≠能干活!清北普林斯顿等开源WorldArena,世界模型评测被颠覆
2026 年 2 月 13 日,清华、北大等顶尖机构联合推出的 WorldArena 面向全球开源。这是首个‘功能 + 视觉’统一评测体系,撕开了‘美丽视频’伪装,让评测从‘审美导向’走向‘功能导向’。
首个自主数据科学的智能体
DeepAnalyze是业界首个能自主完成数据科学任务的智能体大语言模型,可自动执行数据准备、分析等任务,支持多种数据源,且模型、代码等全部开源,还给出了使用和开发方法。
CVPR2026 | 鬼手想点谁就点谁?LaSM让GUI智能体把注意力「收回来」
文章聚焦弹窗式环境注入攻击,指出多模态智能体易受环境干扰致目标漂移。提出 LaSM 方法,通过放缩关键层权重让智能体注意力回到任务,实验显示其提升防御效果,且对正常任务影响小。
国产开源大模型:再见9月,你好10月~
9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。
研究表明:资深开发者在使用AI工具时,完成任务的时间比不使用时延长了19%。
研究通过随机对照试验,发现2025年初资深开源开发者使用AI工具完成任务时间比不使用时延长19%。当前衡量AI能力多依赖标准化评测,可能高估或低估其真实能力,研究旨在更准确评估。
Harness is the New Dataset:模型智能提升的下一个关键方向
文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。
魔法原子,105亿瞄准具身智能终局
2026 年很多行业被 AI 重塑,具身智能赛道尤为明显。魔法原子推动生态基金布局,撬动超 105 亿资金,完成 5 亿融资。它推进多维度‘连接能力’,构建系统能力与落地场景,成资本与行业关注样本。
Nano Banana Pro上线!集成Gemini 3与Veo 3,谷歌不给竞争对手喘息机会
谷歌推出最强文生图模型Nano Banana Pro,又名Gemini 3 Pro Image,整合Gemini 3 Pro多模态理解能力与谷歌搜索知识库。它提升文字渲染等能力,支持多种分辨率和格式,还集成视频生成模型,覆盖多类用户。
机器人学会「眼看手摸」!FreeTacMan 实现人类指尖亲自「授课」
OpenDriveLab提出的FreeTacMan,将人类视觉、触觉和动作技能高效传输给机器,破解精细操作难题。它配备高分辨率触觉“皮肤”,实现人类“手把手”教机器人“感知”,还通过融合时间感知的触觉预训练,提升机器人策略性能。
腾讯混元CL-bench续作发布,让大模型读懂你的日常生活
腾讯混元团队推出CL - Bench Life,用于精准衡量AI在现实生活中的“上下文学习”能力。测试12个语言模型,结果显示模型处理高噪声零碎context能力不足,揭示当前顶尖AI模型还远未读懂日常。