算法论文8
京东&中科院连发三篇Self - Taught RLVR论文
量子位
AI 摘要
京东与中科院信工所连发三篇Self - Taught RLVR论文。RLSD解决OPSD信息泄漏问题,训练效果更好;NPO用未来自己引导当下,提升模型分数;CoPD提出专家协同进化新思路,或暗示新范式。
阅读原文 · 量子位
让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR
京东和中科院信工所开展Self - Taught RLVR系列研究,连发三篇论文。从RLSD、NPO、CoPD三个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Anthropic营收反超OpenAI,IPO占优
IPO前夕,Anthropic最新年化营收达650亿美元,8个月翻超7倍,反超OpenAI。双方在资本市场竞争激烈,A社在起跑时间、财务、商业模式上占优,但OpenAI用户规模和产品生态占优,目前A社牌面更好。
量子位
新闻资讯8
菲尔兹奖得主:AI数学优势在‘输得起’
OpenAI发布内部版模型Astra的十项成果,引发数学界震动。菲尔兹奖得主Timothy Gowers分析其成果,指出AI优势在‘输得起’,还探讨找例方法、模型短板,给出训练建议与衡量跨越门槛的标准。
新智元
算法论文8
北大等提出 TensorCast,推理首字延迟最高降 93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。
机器之心
新闻资讯8
Ilya携新模型归来,重新定义AI规模化
掌握内幕的草莓哥爆料,Ilya正构建以TTT为核心的小型推理引擎。他预见传统大模型的死穴,SSI将TTT概念落地,其引擎在数据效率等方面优势明显。SSI获投资,本月或发新模型。
新智元