智能体任务」共找到 4885 篇相关文章

算法论文8

斯坦福7B智能全面超越GPT-4o,推理流登顶HF

传统智能系统难兼顾稳定性和学习能力,斯坦福等团队提出AgentFlow框架,通过模块化和实时强化学习优化策略,使7B参数模型在多任务上超越GPT - 4o等大模型,为AI发展提供新思路。

新智元
推荐文章7

智能工程的隐形技术债:10分钟造出一个 Agent,公司却要为它养一个平台团队

如今构建智能容易,但投入生产后会面临诸多问题。文章围绕智能绘制出集成、上下文湖等七个基础设施模块,分析各模块隐性技术债务,并指出不同阶段债务表现,还提及应对措施及相关会议推荐。

AI前线
产品应用8

Qoder 发布首个自进化的智能:看 Quest 如何重构了 Quest

Qoder 发布首个自进化智能 Quest,它能自主完成重构自身长程任务执行逻辑等任务。Quest 从上下文管理、工具选择、Agent Loop 三方面优化架构,还具备自主进化能力,正探索自主编程新可能。

阿里云开发者
开源动态8

第二代PPTAgent来了!中科院软件所开源首个本地通用幻灯片智能,9B参数打平GPT-5

中科院软件所开源第二代PPTAgent -- DeepPresenter,将幻灯片智能模型与智能沙箱环境一同开源。它解决了AI制作PPT的痛点,以9B参数打平GPT - 5,在消费级显卡上有出色表现。

机器之心
算法论文8

用“因果规划”解决多智能协作中的任务依赖难题|港科广&腾讯

港科广和腾讯研究团队提出CausalMACE方法,将因果推理机制引入开放世界多智能系统。该方法含全局因果任务图,框架分“判断”“规划”“执行”环节,在基准任务中表现出色,已中稿EMNLP 2025 Findings。

量子位
新闻资讯7

Salesforce 最新研究:LLM 智能 CRM 测试成功率低至 35%,保密意识还低,企业敢用吗?

Salesforce AI 研究团队新基准测试显示,LLM 智能在 CRM 测试中表现欠佳,单步任务成功率约 58%,多步任务降至 35%,且保密意识低,与企业需求差距大。

InfoQ
开源动态8

让AI自动构建AI模型:UCSD 推出 AIBuildAI 智能,斩获OpenAI MLE-Bench榜单第一

近日,加州大学圣地亚哥分校研究团队开发 AIBuildAI 智能,可全自动构建 AI 模型。它在 OpenAI MLE - Bench 基准测试 75 个任务上以 63.1% 获奖率居榜首,实现端到端自动化。

机器之心
推荐文章8

关于 Multi-Agent 到底该不该做,Claude 和 Devin 吵起来了

有两篇多智能文章引发热议。Anthropic分享多智能研究系统构建经验,指出适合特定任务;Cognition认为当下AI Coding暂不适用多智能。文章还介绍多智能架构、提示词原则等内容。

Founder Park
开源动态8

卡帕西630行代码炸出81个智能,4天协作跑2333次实验,公布预训练十大发现

Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能协作,智能自发形成同行评审制度。项目发起者公布十大发现,还衍生出表现出色的auto - discovery项目。

量子位
产品应用8

告别胶水代码,5倍飚速!无问芯穹首次揭秘,Infra智能蜂群登场

无问芯穹推出基础设施智能蜂群,这是新一代基础设施智能化解决方案。它封装多个智能模块,构建全生命周期智能闭环,提升资源利用率等。在重点客户业务流程落地效果好,能让开发者解放价值。

新智元