「零样本扩展」共找到 913 篇相关文章
无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!
论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。
不改模型也能提升推理性能?ICLR投稿提出测试时扩展新范式OTV
ICLR 2026投稿论文提出单token验证(OTV),是测试时扩展新机制,让模型能边推理边判断正误。它基于并行思考思路,借助轻量内部验证器分析推理过程,实验显示其性能优于主流方法。
从卖token到卖结果,这些公司开始让AI背KPI了
当前企业难以衡量AI真实价值,常以调用量代替产出。一批公司开始尝试改写,如Sierra和零犀科技,直接对结果收费。Sierra覆盖超40%财富50强企业,零犀实现规模化盈利与正现金流。
扩展外部测试时Scaling Law,中关村学院新发现:轻量级验证器可解锁LLM推理最优选择
文章聚焦大语言模型‘测试时扩展’,指出内部方法接近瓶颈,外部方法的传统实现有缺陷。提出 TrajSelector 策略,用轻量级打分模型复用隐状态打分,训练无需手动标注,实验显示性能增长稳定。
谷歌公开全新极限压缩算法:LLM提速8倍、内存占用狂降6倍,精度零损失
谷歌推出全新量化算法 TurboQuant,瞄准大模型键值缓存吃内存、高维向量搜索算力瓶颈痛点,能砍内存、提速度且精度零损失。分 PolarQuant 和 QJL 两步,实验数据表现优异,将改变搜索格局。
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。
陶哲轩对谈 OpenAI 高管:“试错成本”无限趋零,AI 正在把数学变成一门重工业
菲尔兹奖得主陶哲轩与OpenAI顶尖科学家Mark Chen对谈,探讨AI在数学研究中的能力、缺陷与演化路径。指出AI试错成本低,在数学领域发展潜力大,虽目前有局限,但正改变数学研究方式。
李飞飞团队发布新一代世界模型Atlas:从零训练,一次性打通视频生成、 3D重建与机器人仿真
李飞飞创办的 World Labs 发布新一代世界模型 Atlas,称其为‘全球首个多模态世界模型’。它从零训练,能同时完成视频生成、3D 重建和时空模拟,已向少数伙伴开放测试,未来将成 Marble 底层模型。
自写驱动越狱!Gemini 3 Pro零败绩通关宝可梦:效率碾压前代8倍「Agent进化太快了」
在全自动《宝可梦 水晶版》对决中,Gemini 3 Pro击败Gemini 2.5 Pro,通关速度至少快2倍,前代或慢8倍。它还展现出诸多能力,如自写驱动绕过限制等,但也存在不验证假设等局限。
NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%
大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。