「总结者训练」共找到 2707 篇相关文章
开源项目的死与新生!
本文作者从自身经历出发,分享开源项目维护经验。指出开源目的影响项目寿命,开发者要选合适项目,避免重复造轮子。还阐述维护要点,如拥抱社区标准、有决断者、不怕改变、支持渐进迁移等。
腾讯提出SPO,告别Group
腾讯团队提出Single - stream Policy Optimization(SPO),回归单流策略梯度范式,解决组基方法瓶颈。它有多项亮点,如告别组同步、采用自适应价值跟踪等,在实验中提升了模型性能和训练吞吐。
蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理
医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。
砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈
大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。
The Batch:829 | DeepSeek 是怎么做到的
DeepSeek 去年末以低成本训练出先进开源大模型引关注,近日团队披露构建 DeepSeek - R1 和 DeepSeek - V3 的软硬件方案,降低内存和计算需求,其细节公布让更多团队有机会参与前沿研发。
ACL 2026|清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成!
现有文生音频技术在精细化控制方面有挑战,清华团队提出ControlAudio方法。它通过数据构造、渐进式训练和引导采样,在统一框架下实现时间与语音内容联合建模,在多项任务上表现优于现有方法。
我们对 Coding Agent 的评测,可能搞错了方向
用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。
告别随机性:Thinking Machines Lab如何实现了LLM推理的完全确定性?
文章指出LLM推理非确定性根源并非GPU并发和浮点非结合性,而是批大小变化致核函数非不变性。作者提出实现批不变操作的策略,实验验证有效,还阐述其对训练、系统可靠性等方面的意义。
别用AI生产垃圾内容
作者不建议用AI批量生产内容发至社交媒体,称这是博傻行为,无法建立信任实现转化。还探讨AI时代做内容出路,指出未来观众、平台和创作者会转变,创作者分AI操作员和价值整合者阵营。
Qwen3深夜开源新系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA
Qwen3深夜上新Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。