「推理时扩展」共找到 2933 篇相关文章
专访希姆计算陈炜博士:“技术与人才标准”双轮驱动,推动 RISC-V 生态繁荣
在2025 RISC-V中国峰会期间,希姆计算陈炜博士接受专访,介绍RISC-V在AI领域布局,提及希姆计算推动技术标准制定的贡献与挑战,还阐述国内人才缺口及培养标准,认为技术与人才标准相辅相成。
强化学习之父Richard Sutton最新演讲揭示OaK架构:通向超级智能的八步愿景
强化学习之父Richard Sutton在演讲中介绍OaK架构,认为它是通向超级智能的路径。他回顾对简单通用AI智能体架构的追求,强调从经验学习、拟合世界的重要性,还指出实现该架构需八个步骤,虽只是愿景但提供了发展路线图。
训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式
大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。
宇树机器人“撞人逃逸”火到国外,王兴兴回应:下次不遥控了
宇树机器人“撞人逃逸”片段在国外疯传,引发对机器人安全性的担忧。分析发现,“元凶”可能是人类控制员交接遥控器时未及时避让。宇树创始人王兴兴表示下次让机器人自主奔跑,还透露未来有更多突破。
Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃
大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。
Github斩获1.8K 星!!再见了按键精灵,Windows-MCP开源了!
今天介绍超酷开源项目Windows - MCP,它让AI与Windows系统互动,支持Win7到Win11。功能强大,不挑大模型,工具全、轻量开源、扩展性强。还给出安装步骤,不过使用时要谨慎。
DeepSeek V4 借实习生获奖论文“起飞”?梁文峰剑指上下文:处理速度提 10 倍、要“完美”准确率
ACL公布2025年获奖论文,中国作者比例超51%。DeepSeek梁文锋通讯、实习生袁境阳一作的论文获Best Paper奖。其提出NSA机制,实验显示性能优、准确率高、速度提升显著,成果或用于DeepSeek V4。
智谱发布GLM 4.5,不仅开源模型还把训练框架也开源了
智谱AI发布GLM 4.5,不仅开源模型,还开源整套后训练基础设施。模型规格亮眼,性能也超越qwen 235b。其开源的训练框架slime专为强化学习扩展设计,完整工具链支持多种模型。
大模型竞赛转向:决胜关键为何是“后训练”?|甲子光年
大模型价值主战场向后训练转移,Grok 4凭后训练成“宇宙最强”。产业应用中通用模型适配难,后训练方法也在进化,如采用SFT+RL等,还介绍了夸克和阿里云的后训练实践。
中国ToB软件公司想赚钱,先对AI Coding祛魅
文章指出AI Coding产品虽对专业开发者提效,但服务公民开发者时存在问题。对比‘Code + GenAI’与‘No Code + GenAI’,认为无代码平台更适配公民开发者,虽面临挑战,但短期内是企业软件定制最优解。