「自主推理能力」共找到 4887 篇相关文章
OpenAI不Open!7年功勋老将投奔宿敌,实验室沦为API代工厂
2026开年,OpenAI的「推理之父」Jerry Tworek离职,他入职近七年,是推理技术核心人物。Scaling Laws失效,后训练成主要出路,但深度推理成本高,在强调盈利环境下,Tworek不满研究受限而离开,OpenAI或失去通往AGI的机会。
让GPT-4.1「头皮发麻的考试」!OpenAI给大模型上强度,AI能赢吗?
OpenAI 公布 MRCR 评测标准数据集,其针对 AI 模型上下文能力进行「奥运会」级别测评。MRCR 提升了测试难度,能揭示 AI 能力边界,推动模型发展,帮助更合理应用技术。GPT4.1 在一些测试中表现出色,未来 AI 能力上限充满可能。
豆包 Seed 2.0 来了:字节模型跨越鸿沟
春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。
DeepSeek V3.1 把 R1 融了,一堆新活:<think>开关、动态搜索、新ToolCall ...
DeepSeek在Hugging Face悄悄发布V3.1版本,将对话和推理模型合并为混合推理模型。它有显式推理、内置搜索、简化工具调用等特性,Aider测试成绩佳且成本低,但也存在战术回避、幻觉率升高等问题。
Meta联手UCSD发布DeepConf:计算成本暴降85%,99.9%准确率!
Meta AI联合UCSD推出DeepConf技术,解决了AI高难度推理准确率与计算成本的难题。它让AI学会“察言观色”,筛选靠谱推理路径,在AIME 2025竞赛中与GPT - OSS - 120B模型取得99.9%准确率,还节省大量计算资源。
一盘大棋!OpenAI「截胡」IMO金牌,奥特曼为GPT-5献上「核弹级」预热
OpenAI用全新通用推理模型拿下IMO金牌,抢了谷歌DeepMind的风头。此模型是融合新通用技术的推理LLM,在推理时间跨度和效率上有进步。奥特曼借此为GPT - 5预热,陶哲轩指出缺乏统一标准时对比AI表现无意义。
Prompt、Skills、MCP:大模型上下文工程核心链路
文章聚焦大模型上下文工程,介绍了Prompt、Skills、MCP核心链路。Prompt是与模型沟通基础,但其有脆弱、难管等痛点,促使向上下文工程演进;Skills是能力单元,可显式化能力、动态组合;MCP解决能力集成问题,虽有争议但理念重要。
Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键
Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。
OpenClaw 类自主智能体生态构建
文章围绕OpenClaw类自主智能体生态展开,从生态视角、记忆系统、上下文管理等多方面阐述其构建,还分析了安全风险、治理体系、角色分工及面临的挑战与机会,为理解和发展Agent生态提供参考。
性能提升400%!AutoResearchClaw自主设计多模态记忆大脑
AI助手积累海量多模态数据,记忆和提取成瓶颈。北卡罗来纳大学等团队用AutoResearchClaw让AI 72小时完成多模态记忆系统设计,性能提升超400%,新系统OMNIMEM全面碾压现有主流系统。