「推理任务」共找到 3606 篇相关文章
Andrej Karpathy:AI本质是「软件2.0」,并非电力或者工业革命
Andrej Karpathy分享AI影响经济的思考,认为应将AI视为“软件2.0”,提出预测AI自动化能力的“可验证性”指标,回顾软件1.0,阐述软件2.0,指出“可验证性”决定AI进展的“锯齿状”前沿。
Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化
上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。
Salesforce 最新研究:LLM 智能体 CRM 测试成功率低至 35%,保密意识还低,企业敢用吗?
Salesforce AI 研究团队新基准测试显示,LLM 智能体在 CRM 测试中表现欠佳,单步任务成功率约 58%,多步任务降至 35%,且保密意识低,与企业需求差距大。
求码10天,我终于过上了在微信上使唤🦞的日子
腾讯鹅虾产品QClaw升级,将微信入口变为小程序,支持传文件,上线灵感广场。作者求码10天体验它,测试其在微信和电脑端操作能力,肯定便捷性,也指出执行流程不透明等问题。
ICLR 2026 | Rebuttal 是一场「带着镣铐的舞蹈」?港科 RebuttalAgent 用心智理论「读懂」审稿人
香港科技大学研究团队提出 RebuttalAgent 框架,将心智理论引入学术 Rebuttal 任务。它通过 TSR 框架拆解任务,先‘读心’再‘落笔’,能生成有说服力回复,还可作为‘思维外挂’提升小模型表现。
Meta通过简单算术解锁LLM SoTA性能
大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。
普林斯顿等高校提出AgentDistill:无需任何训练即可继承大Agent复杂能力,性能提升48%,成本降低90%
在AI领域,大型语言模型智能体计算需求大限制部署,传统蒸馏技术对智能体效果有限。AgentDistill提出解决方案,让学生智能体复用教师智能体的MCP工具包,无需训练继承复杂能力,小模型性能显著提升。
刚刚,Anthropic 宣布:Claude 自己长出了意识
Anthropic新研究《语言模型中的全局工作空间》,在Claude神经网络里找到特殊区域J - space,它有独特性质,对应全局工作空间理论。还介绍了发现方法及多个实验,探讨其与意识关系,研究已开源。
分享2篇最新Harness论文,一篇谷歌,一篇微软
在LLM Agent迅速发展的当下,如何为其设计合适的Harness成关键问题。本文分享微软M⋆和谷歌AutoHarness两篇论文,分别从记忆系统和动作约束维度提出自动化的Harness进化方法,并介绍了实验结果。
OpenClaw大考!上海AI Lab InternLM团队WildClawBench 60题,把「龙虾」AI打回原形
上海人工智能实验室InternLM团队推出WildClawBench,含60道高难度任务,在真实OpenClaw环境端到端评测AI Agent。评测涵盖多类别任务,已测14个模型,国产模型表现亮眼,项目开源可复现。