「Agent应用」共找到 4377 篇相关文章
7个月翻一番!AI agent能力飙升,METR报告揭示指数级进化规律
非营利研究机构METR报告显示,Agent能力每7个月翻一番,这在9项基准测试中得到验证,任务涉及编程、数学等领域,大模型正迈向高度自动化,且Agent性能提升快,未来处理复杂任务能力或更强。
业界对 Agent 的最大误解:它能解决所有问题
业界认为 AI Agent 规模应用“拐点时刻”已至,但 IBM 强调不必过度“神化”AI。其推出 watsonx Orchestrate 解决方案,还指出企业落地 AI 要考虑数据、流程自动化等问题,强调回归业务本质看技术价值。
深度解读 AGI-Next 2026:分化、新范式、Agent 与全球 AI 竞赛的 40 条重要判断
文章总结了 AGI-Next 2026 活动上核心观点。指出模型分化是趋势,有 To B 和 To C 等场景差异;自主学习是新范式;模型即 Agent,Agent 即产品;还分析了中美 AI 竞赛的现状与挑战。
对谈 DeepSeek-Prover 核心作者辛华剑:Multi Agent 天然适合形式化数学 |Best Minds
文章是对 DeepSeek-Prover 核心作者辛华剑的访谈。他认为强化学习是 AGI 关键解法,Multi Agent 适合形式化数学。还探讨了 DeepSeek Prover 进展、数学与 AGI 关系、评测基准等,指出未来有全才模型和自主 Agent 出现。
当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL
随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。
首个Gemini桌面端曝光,系统级Agent空降PC!
5月20日Google I/O 2026前夕,谷歌提前“放大招”,Gemini桌面端曝光,Mac版先上线。它具备四大核心功能,如系统级Agent操控PC等。全新Gemini 3.2闪现,编程能力惊人,谷歌还更新Workspace应用图标。
CHI 2026 Best Paper|社会模拟迈入可控、可量化时代:为AI Agent加上「认知滑条」
UCSD团队在CHI 2026 Best Paper论文CoBRA中提出可量化、可验证、可复现的Agent控制框架。它将经典社会科学实验转化为校准环境,使Agent行为可控,标志着AI社会模拟走向实验科学范式。
国产Agent第一股要来了?但官网都打不开,什么妖魔鬼怪?
国内最大AI数字员工公司冲刺IPO,要做企业Agent第一股,但其官网无法访问。该企业级Agent平台是RPA+AI组合,RPA有致命问题,大模型加入后虽有变化,但事情本身护城河不深,公司靠定制化冲击IPO,且仍亏损。
14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1
如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。
公司用了Agent,4000个员工丢了工作!CEO 大刀砍研发:让人和AI协作,各干一半的活儿
CRM软件巨头Salesforce首席执行官Marc Benioff透露,因采用AI Agent裁掉4000人。公司战略转向聚焦Agent业务,还调整人力结构,人和AI各干一半活儿,Marc认为AI影响因行业、地区而异。