「在线后训练」共找到 3837 篇相关文章
TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral
大模型推理评测多只看答案,忽略推理过程。上海多校团队提出TRM,用ME² principle刻画推理质量,DAG-based pairwise evaluation还原结构,训练奖励模型,让推理质量可度量、训练和优化。
仅需152个样本,性能提升48%:Memory-R1如何重塑Agent记忆能力?
这篇文章解读论文Memory - R1,其由多所高校研究团队完成,旨在解决LLM在长对话和多轮任务中的‘记忆难题’。通过强化学习让LLM学会管理记忆,用152个问答对训练,大幅超越现有基线模型。
一次缓存引发的文件系统数据不一致问题排查与深度解析
本文详述由自研分布式文件系统客户端 EFC 缓存架构更新引发的数据不一致问题排查过程。经多轮分析,发现是版本号回退致客户端读旧数据。修复后测试无异常,还揭秘部分 POSIX 接口底层情况。
通义实验室大火的 WebAgent 续作:全开源模型方案超过GPT4.1 , 收获开源SOTA
WebAgent续作《WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization》提出对information-seeking任务形式化建模,设计训练数据合成方法,全开源模型方案在GAIA评测获SOTA表现,还补足了训练数据不足问题。
刚刚,林俊旸官宣创业公司Pragmatik Labs!
原阿里千问技术负责人林俊旸官宣在上海创办新AI公司Pragmatik Labs,研究横跨数字与物理世界的下一代Agent。其获高榕创投、红杉中国领投,腾讯等支持,投后估值约20亿美元。
专访刘世奇 - 他用AI设计丑拖鞋,一年卖了3000万。
本文讲述97年刘世奇用AI做电商卖丑拖鞋的故事。他从土木工程专业转型,起初创业踩坑,ChatGPT爆火后,用Midjourney等工具,借AI选品、上架、接待客户、风控等,一年卖3000万,重构产业链工作流。
Ilya罕见发声:大模型「大力出奇迹」到头了
Ilya大神在近2万字采访中称,AI正从「规模时代」走向「科研时代」,主流「预训练 + Scaling」路线遇瓶颈。他还探讨了AI泛化、安全对齐、预训练范式等热门话题,给出独特见解。
SIGGRAPH Asia 2025:摩尔线程赢图形顶会3DGS挑战赛大奖,自研LiteGS全面开源
12月17日,在SIGGRAPH Asia 2025上,摩尔线程凭自研LiteGS获3DGS重建挑战赛银奖。3DGS是下一代图形渲染技术,有巨大潜力但训练耗时久。摩尔线程开源LiteGS,实现全链路协同优化。
CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了
北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。
ICLR 2026 Oral | 西湖大学发布Real PDE Bench
复杂物理系统时空演化预测是核心问题,当前AI模型多在数值仿真数据上训练,难以评估其在真实数据上的表现。西湖大学等实验室提出RealPDEBench,含真实与仿真数据,设三类任务、九个评估指标和十个基线方法。