「探索机制」共找到 1534 篇相关文章
AutoDev Remote 编程智能体:你何必只让 AI 在白天分析需求、设计方案
AutoDev Remote Agent 作为 AutoDev Workbench 一部分进入试运行,可运行在服务器,辅助项目分析规划、编写代码等。它是开源方案,代码可自由发布修改,还介绍了选择它而非 IDE 的原因及未来计划。
阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning
阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。
一文解读 LLM Posting-Train技术
文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。
「推理革命」爆发100天:DeepSeek-R1复现研究全揭秘!
本文深入梳理围绕DeepSeek-R1的复现研究,解析监督微调、强化学习等关键技术细节,介绍相关数据集、训练方法及奖励机制等,还探讨了推理语言模型更多发展方向,为研究提供基础。
GPT-5.6仅用一天改写数学史,「双菲」五人团队8年纪录被破!
GPT-5.6一天打破陶哲轩五人团队8年大素数空隙纪录,提出「倾斜剩余类」构造法,当天通过Lean语言机器验证。此前数学家张益唐、陶哲轩等在素数分布问题上各有探索。
独家 | 乐聚发布垂域具身模型:一倍工业提效,两项榜单第一
AI科技评论独家获悉,乐聚机器人将推出面向工业场景的“垂域具身智能模型”——KUAVO VLA,该模型用600+小时真机数据进行中训练,能提效且减少适配与训练成本,两项指标排名第一,利好二次开发者。
一篇Self-Evolving Coding Agents最新综述
当今编码智能体部署后大多静止,自进化编码智能体应运而生,可让Agent通过交互更新自身。文章介绍了其概念、分类,探讨组件进化机制、时机及评估方法,也提及带来的新挑战。
kimi K3超大杯升级背后的技术内幕
文章介绍开源模型 K3 架构设计思路。主要探讨 MoE 和 MLA 部分,在 MoE 方面提出 SiTU、Norm、QB 改进;在注意力机制选择 MLA,与 KDA 混合缓解部分问题,还谈及 DSV4、NoPE 相关特点。
Agent 的 Token 账单怎么省?
AI 行业从生成式能力向 Agent 行动力跃迁,核心矛盾转向推理成本可控性。随着企业将 Agent 编入自动化流水线,Token 消耗受关注,业界开始聚焦以「降本」为核心的技术路线。
独家|美图入局 Visual Agent,Chance AI 完成数百万美元天使轮融资
美图布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。