「类R1训练」共找到 2527 篇相关文章
ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE
长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。
68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩
《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。
拟合接近满分,外推却会跑偏:Meta 给缩放律加了一个指数
大模型训练前,团队常用 Chinchilla 缩放律估算模型规模和数据量,但它在模型和数据极不平衡的边界预测易跑偏。Meta FAIR 提出的 Skaling 只增加一个耦合指数,降低外推误差,还采用 L 形采样降低试算成本。
国产GPU开始造世界!国内首个全栈具身智能仿真平台来了
摩尔线程发布国内首个全栈国产化具身智能仿真平台MT Lambda,实现Sim-to-Real真机验证。该平台像物理AI训练流水线,集成物理、渲染、AI引擎。其依托全功能GPU和MUSA架构,还构建了云端、端侧、生态闭环。
全球看中国,灵初智能用10万小时人类数据写下具身智能的中国答案
2026年,“世界模型”成具身智能高频词。灵初智能联合创始人陈源培认为其非核心方向,而是数据迁移工具。灵初关注人类操作数据转化,在10万小时量级上可大幅替代真机数据,还介绍了系统模块、数据集及商业化阶段等情况。
小模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超
浙江大学联合美团龙猫团队、清华大学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。
谷歌新研究:大模型“吵架”有利于提升推理质量
谷歌新研究发现高级推理模型自发进化出'思想社会',研究人员用LLM - as - judge方法识别出多个虚拟人格。还找到控制现象的'开关',实验表明教AI'吵架'更有效,其'社交技能'通用,给开发者带来新启示。
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。
ChatGPT本来要5天后关掉
翁家翌在播客透露,起初推出ChatGPT是为收集用户数据,预期5天后关闭。他是OpenAI多代大模型发布贡献者,还分享了OpenAI内部情况,如模型训练、迭代速度等问题,也谈及自身经历和对AGI看法。
刚刚,Figure 03人形机器人登场,能感知一枚回形针重量
Figure 03是初创公司Figure发布的第三代人形机器人,能做家务、胜任服务类工作,指尖可感知3克力。它配备新传感器和手部系统,为家庭设计,实现无线自主运行,也为量产和商业应用做了诸多优化。