任务性能」共找到 3534 篇相关文章

开源动态8

最详细的 DeepAgents 实战拆解:一次看懂LangChain全新深度智能体框架

本文深入解读了LangChain推出的全新开源项目DeepAgents。它定位为“深度Agent”框架,能提升复杂场景下Agent能力。文中通过股票分析实例展示其任务规划、文件系统、子智能体三大核心机制,还介绍原理与未来发展方向。

AI大模型应用实践
新闻资讯7

HBM更“热”了

HBM正从高性能计算领域向消费电子等市场渗透,技术迭代迅速。TSV等关键技术推动其性能提升,各企业技术路线有差异。应用领域广泛,但推广面临挑战。市场竞争激烈,各企业积极布局。

芯师爷
算法论文8

多模态推理新范式!DiffThinker:用扩散模型「画」出推理和答案

上海人工智能实验室等团队提出全新生成式多模态推理范式,发布模型 DiffThinker。它打破传统定式,以图像到图像生成任务重构推理过程,在多项复杂任务中表现优于顶尖闭源模型,有四大核心特性。

机器之心
开源动态8

开源Agent新标杆:通义WebSailor多榜夺魁,挑战OpenAI高难度Agent基准BrowseComp

信息爆炸时代,传统搜索引擎难满足需求,开源Web Agent在极端复杂任务表现不佳。阿里巴巴通义实验室推出WebSailor,通过创新数据构造和训练方法,在BrowseComp等挑战上取得突破,缩小与顶级封闭系统差距。

机器之心
算法论文8

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

机器之心
开源动态8

首个自主数据科学的智能体

DeepAnalyze是业界首个能自主完成数据科学任务的智能体大语言模型,可自动执行数据准备、分析等任务,支持多种数据源,且模型、代码等全部开源,还给出了使用和开发方法。

GitHubStore
开源动态8

让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力

上海交大等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。

机器之心
产品应用7

智算,云厂商的下一个战场

随着大模型技术走向产业,企业需算存网数一体的高性能智算底座。领先云厂商积极升级能力,如腾讯云推出“云智算”,在计算、存储等方面布局迭代,还在多领域与企业合作,推动智算发展。

InfoQ
算法论文8

CVPR2026 | 鬼手想点谁就点谁?LaSM让GUI智能体把注意力「收回来」

文章聚焦弹窗式环境注入攻击,指出多模态智能体易受环境干扰致目标漂移。提出 LaSM 方法,通过放缩关键层权重让智能体注意力回到任务,实验显示其提升防御效果,且对正常任务影响小。

机器之心
新闻资讯7

产学研深度融合样本:高校教授携手昇腾,共筑AI算力生态基石|甲子光年

本文对话华南理工大学陆璐教授,他有丰富业界经验,回归学界后聚焦AI算力平台性能优化。其团队与昇腾合作解决性能挑战,成果用于开源与产品集成。陆璐还对算力生态未来给出战略与实操建议。

甲子光年