「推理深度」共找到 2693 篇相关文章
清华团队首发OpenClaw研究报告!
清华沈阳教授团队发布《OpenClaw发展研究报告1.0》和《OpenClaw自我研究报告1.0》,对OpenClaw做深度解读。团队在OpenClaw领域形成完整闭环,包括理论研究、模型研发等多方面工作。
MMLU已死?「人类最后考试」登Nature:全球AI模型集体不及格!
AI发展迅猛,现有基准测试难以跟上其步伐。近1000名研究人员组成的全球联盟创建「人类最后的考试」(HLE),涵盖多领域难题,目前最强AI准确率不足50%,凸显AI与人类专家的差距。
OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了
OpenAI发布GPT - 5.4,全面反击Gemini 3.1 Pro和Claude Opus 4.6。它是首个有「原生电脑使用」能力的通用模型,各维度无短板,成绩炸裂,定价也创新高。
多智能体大语言模型中的人类自适应协作
尽管大语言模型有进展,但纯自治多智能体系统有局限。为此提出 HILA 框架及双环策略优化机制,结合 DLPO 的 HILA 在基准测试中表现出色,为构建 Agentic 系统提供指导。
别再让语音机器人“答非所问”:AI Force任务型语音对话技术总结
本文围绕企业级任务型语音Agent核心挑战,提出解决“拟人化”与“专业化”问题。介绍三段式语音对话解法、架构演进,还提及‘衍算’推理框架等技术及未来方向,团队来自蚂蚁集团AI force。
AI 智能体界的 npm 来了!Vercel 推出 Skills.sh,欲统一智能体指令集
Vercel 发布开源项目 Skills.sh,为 AI 智能体打造“标准动作库”,让其通过命令行执行可复用操作。它是开放生态,开发者能定义、分享指令。项目获广泛关注,社区认为其实用性强。
上交大智能计算研究院论文:不只算对答案,大模型如何真正学会运筹建模丨ICLR 2026
上海交大智能计算研究院提出 StepORLM,通过生成式过程监督提升运筹建模可靠性。研究反思传统训练范式局限,在多数据集测试中,小参数的 StepORLM 表现超大型模型,还分析现有方法缺陷并提出解决框架,有重要方法论和应用意义。
传Claude sonnet 5即将发布:能自动组建开发团队,一人即一公司,价格爆降50%
小道消息称Anthropic下一代AI模型Claude Sonnet 5或于北美时间2月3号发布,代号“耳廓狐”。它有全新功能,能化身虚拟开发团队,编程能力强,价格将降50%,还与谷歌深度合作。
蚂蚁抛弃向量推荐!用8B小模型构建「用户“话”像」,实现跨模型通用并拿下SOTA
2026年AI开发者关注爆款大模型应用,个性化是关键。蚂蚁集团和东北大学团队推出AlignXplore+,实现文本化用户建模新范式,有全域通用、极致迁移、实战适配特性,小参数超越基线,未来将继续探索。
裁4000人换来的AI全白搞?Salesforce悄悄改架构:用 “老技术”故障少还省钱,网友怒喊:CEO零遣散费滚蛋
Salesforce曾大举部署AI并裁员,宣称Agentforce能降本。但如今高管称不过度依赖大模型时运行更好,已引入基础自动化技术。其应用遇瓶颈,故障频发、成本高,还面临AI“漂移”等问题。