「多步推理」共找到 5618 篇相关文章
阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜
阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。
刚刚,DeepSeek 文档更新,Agent 开发者要注意这个字段
DeepSeek在官方API文档给出thinking mode和tool call结合样例,把模型中间思考过程成Agent系统需管理部分。关键字段`reasoning_content`从调试信息成协议流程一部分,影响状态管理、多模型适配等。
OpenAI世纪诉讼,马斯克输了!
马斯克诉OpenAI 1500亿美元案件,陪审团90分钟全票驳回,原因是诉讼时效已过。虽未审理实质指控,但庭审揭开OpenAI隐秘运作。此判决为OpenAI IPO扫清障碍,双方后续还有多起诉讼待决。
龙虾让位!硅谷顶流AI「爱马仕」一夜闯进微信,冲上全球第一
硅谷新宠Hermes Agent爆火,GitHub揽6.6万星,原生接入微信引开发者关注。其署名的首篇‘顶会级’论文提出Autoreason推理方法,指出传统‘自我优化’弊端,展示出小模型逆袭等优势。
OpenClaw 3.24发布:彻底解决最重要的Skills安装障碍!
OpenClaw 3.24 发布,改动显著。Skills 安装更顺滑,系统自动检测依赖;控制台界面大改,侧边栏更易用;修复媒体文件访问漏洞;Microsoft Teams 支持升级;还修了多平台群聊 Bug,新增 API 端点,提升 RAG 兼容性。
OpenClaw中国行北京站落幕,3万人围观养虾,本周12城活动继续
2026年3月21日,OpenClaw中国行首站北京站举办,近200名开发者参与,直播间3万多人围观。活动上开发者30分钟可跑通AI应用,多位嘉宾分享使用经验,本周末将在12城继续开展。
缩放定律Scaling正慢性死亡,算力收益递减,AI的下一个增长极是模型如何交互
前Google Brain科学家Sara Hooker论文指出,统治AI十年的缩放定律Scaling走向慢性死亡,算力收益递减,研究重点将转向推理时算力和模型如何交互,还分析了算力崇拜兴起、缩放法则裂痕及未来方向。
4680电池的大饼,马斯克不想画了
特斯拉死磕4680电池五年多后低调退堂鼓。韩国L&F供货合同金额减值超99%,几乎等同项目黄了。原因或与Cybertruck销量不佳有关,且4680电池在掺硅负极和干法电极上进展缓慢。
Claude 4.x 的提示工程实战指南
Anthropic在官方文档上线Claude 4.x提示工程指南,针对4.5系列模型优化。介绍基本原则、长期推理和状态跟踪方法、沟通风格,还给出特定场景指导及迁移考虑,助你发挥Claude 4.x实力。