橙篇」共找到 186 篇相关文章

算法论文8

近期,谷歌发了两Agent Scaling论文,有点东西

2025年LLM社区有Test - Time Scaling和Agent化两条主线,但‘更多agent是否更好’无人能定量回答。谷歌两论文将agent scaling拆成可预测、可度量的科学问题,涉及预算感知和多agent盈亏平衡点。

PaperAgent
算法论文8

训练数据枯竭怎么办?首「数据价值密度」综述理清思路

上海交通大学与上海人工智能实验室团队发布首「数据价值密度」综述。提出“数据价值密度”概念并定义,建立分类框架梳理现有工作,还指出该领域面临的挑战,为大模型训练提供指南。

机器之心
算法论文8

ICML 2026 现场|九 Spotlight 论文,透视 AI 最前沿

7月7日,ICML 2026正会首日,雷峰网精选九Spotlight论文,涵盖生成模型、智能体系统等多领域。如SDEVI框架解决不规则时间序列生成难题,MASpoB让多智能体提示优化可行等。

AI科技评论
算法论文7

翁荔陈丹琦加盟的840亿AI公司,公开第二论文

明星创业公司Thinking Machines公开第二研究论文,主题为“Modular Manifolds”,通过统一框架约束和优化网络不同层/模块,提升训练稳定性与效率。论文提出模块化流形思路,若应用于大模型,训练效率和稳定性将大幅提升。

量子位
算法论文8

2最新152页论文,RL+LLM被彻底讲透了!

今天分享22025最新RL×LLM的技术综述,分别聚焦“RL在LLM全生命周期的打法”和“RL如何炼成大推理模型”,梳理玩法、组件、算法演进等内容,还给出开源模型、数据等盘点。

PaperAgent
算法论文8

刚刚,腾讯姚顺雨署名首论文发布,「下半场」先搞上下文学习

腾讯混元团队和复旦联合团队发布姚顺雨署名首论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。

机器之心
算法论文8

推荐系统进入「双动力」时代!首LLM-RL协同推荐综述深度解析

强化学习是推荐系统主流建模范式,但传统 RL 推荐系统有诸多瓶颈。大语言模型崛起带来新机遇,LLM 与 RL 结合开启新范式。研究团队发布首相关综述,提出五大协同范式,总结评估体系,分析挑战与方向。

机器之心
算法论文7

DeepSeek用的GRPO有那么特别吗?万字长文分析四精品论文

文章解读 Kimi k1.5、OpenReasonerZero、DAPO 和 Dr. GRPO 四论文,分析 DeepSeek R1 里 GRPO 及改进算法。指出 GRPO 非特殊 RL 算法,当前 RL 算法实现相似,变革聚焦价值函数取舍等核心维度。

机器之心
新闻资讯7

ICML暴力清场,497论文一夜作废!审稿人偷用AI惨遭全拒

ICML 2026爆出大消息,497论文因审稿人动用AI未标注被“桌拒”,占总投稿量2%。ICML祭出“连坐”惩罚,引发争议,有人质疑检测不靠谱,也有人支持维护学术规则。

新智元
算法论文8

上海交大团队发布首「搜索智能体」综述!四个维度深度剖析搜索智能体

上海交大团队发布首「搜索智能体」综述,从如何搜索、优化、应用、评估四个维度剖析。随着LLM兴起,搜索从传统模式向搜索智能体转变,虽有潜力但缺统一研究视角与评估框架,该综述提供了路线图。

AI科技评论