「算法改进」共找到 912 篇相关文章
RL是「点金石」还是「挖掘机」?CMU 用可控实验给出答案
卡耐基梅隆大学研究者构建基于GSM - Infinite的可控合成数据框架,分析预训练、中期训练和RL对模型推理泛化能力的影响,调和了RL有效性的不同观点,为改进训练策略提供基础。
突破类脑模型性能瓶颈:校正频率偏置实现性能与能效双突破|NeurIPS 2025
香港科技大学(广州)等团队在NeurIPS 2025论文指出,脉冲神经网络(SNN)性能不佳根源是频率偏置,非二进制激活。团队提出Max - Former架构,校正频率偏置,实现性能与能效双突破,卷积架构也适用。
大小模型协同架构在金融智能投顾中的应用与挑战
本文整理自北银金科高级算法专家尹辰轩分享,介绍大小模型协同架构下的大模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。
NeurIPS25高分论文|以判别式监督学习强化推理LLM,解决难度偏差和熵崩塌难题
德州农工大学博士生李港在NeurIPS25高分论文中,分析GRPO优化目标,发现难度偏差局限及与判别式监督学习联系,提出DisCO框架强化大型推理模型,其优势显著,实验表现优于GRPO及其变体。
量化投资和金融科技的开源利器来了!
金融强化学习 (FinRL®) 是首个面向金融强化学习的开源框架,已发展成生态系统,有三层结构。其特点包括支持多算法、多市场环境模拟等,有完整流水线,还支持多数据源。
Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红
Transformer有力挑战者Mamba的最新版本Mamba-3进入ICLR 2026盲审。它有三大改进,在长文本处理、实时推理和成本优化有优势。此外,FBAM也从不同角度探索Transformer下一代框架。
1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒
QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。
Cursor现在可以直接控制浏览器了
随着Claude4.5发布,Cursor更新了“@Browser”,可控制浏览器、截图、改进UI、调试客户端等。无需安装其他工具,任何模型输入@browser即可控制浏览器,在Windows下调用顺滑,需启用预览版功能。
突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO
先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。