长程任务能力」共找到 4566 篇相关文章

算法论文8

CVPR2026 | 鬼手想点谁就点谁?LaSM让GUI智能体把注意力「收回来」

文章聚焦弹窗式环境注入攻击,指出多模态智能体易受环境干扰致目标漂移。提出 LaSM 方法,通过放缩关键层权重让智能体注意力回到任务,实验显示其提升防御效果,且对正常任务影响小。

机器之心
开源动态7

国产开源大模型:再见9月,你好10月~

9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。

PaperAgent
算法论文7

研究表明:资深开发者在使用AI工具时,完成任务的时间比不使用时延长了19%。

研究通过随机对照试验,发现2025年初资深开源开发者使用AI工具完成任务时间比不使用时延长19%。当前衡量AI能力多依赖标准化评测,可能高估或低估其真实能力,研究旨在更准确评估。

宝玉AI
推荐文章8

Harness is the New Dataset:模型智能提升的下一个关键方向

文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。

海外独角兽
推荐文章8

通用Agent长啥样

视频探讨大厂做基于命令行编程工具的原因,介绍命令行Agent,剖析其等于庞大工具生态、经典Unix组合哲学与现代AI调度能力,指出通用Agent骨架由AI大脑、命令行身躯和MCP感官构成。

newtype AI
新闻资讯8

魔法原子,105亿瞄准具身智能终局

2026 年很多行业被 AI 重塑,具身智能赛道尤为明显。魔法原子推动生态基金布局,撬动超 105 亿资金,完成 5 亿融资。它推进多维度‘连接能力’,构建系统能力与落地场景,成资本与行业关注样本。

量子位
产品应用8

Nano Banana Pro上线!集成Gemini 3与Veo 3,谷歌不给竞争对手喘息机会

谷歌推出最强文生图模型Nano Banana Pro,又名Gemini 3 Pro Image,整合Gemini 3 Pro多模态理解能力与谷歌搜索知识库。它提升文字渲染等能力,支持多种分辨率和格式,还集成视频生成模型,覆盖多类用户。

量子位
开源动态8

腾讯混元CL-bench续作发布,让大模型读懂你的日常生活

腾讯混元团队推出CL - Bench Life,用于精准衡量AI在现实生活中的“上下文学习”能力。测试12个语言模型,结果显示模型处理高噪声零碎context能力不足,揭示当前顶尖AI模型还远未读懂日常。

机器之心
产品应用7

企业级靠谱龙虾升级,拒绝失控

OpenClaw爆火又降温,凸显轻量化智能体短板,企业需具精准业务理解和多技能协同能力的AI员工。滴普科技升级Deepexi企业大模型,其与两平台构成DeepexiOS,支撑企业AI体系化建设。

量子位
开源动态7

我用GLM-5肝出一个Rust版Agent系统,Opus 4.6迎来了最强开源对手。

作者实测智谱发布的GLM - 5后,用其开发出Rust版Agent系统并开源。还对比GLM - 5与Kimi 2.5、Opus 4.6,认为GLM - 5写后端能力强,让普通开发者也能用高级架构能力

开源AI项目落地