「内部实验模型」共找到 8347 篇相关文章
让LLM不再话痨,快手HiPO框架来了
当前LLM存在‘过度思考’困境,效率与成本矛盾突出。快手与南大合作推出HiPO框架,通过混合数据冷启动和混合强化学习奖励系统,让模型能自主决策思考模式,实验显示它提升了效率和准确率,还具强泛化性。
让AI像人类一样认知真实世界!UCLA谷歌强强联手,长时记忆+3D空间理解超越基线16.5%
如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM模型与3DMEM - BENCH基准,让AI有构建、维护和利用长时记忆能力,实验超基线16.5%,但有依赖模拟器预设的局限。
3D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32%
中科院自动化所提出BridgeVLA模型,将3D输入投影为2D图像并利用2D热图进行动作预测。它训练分两阶段,在多仿真基准和真机实验表现卓越,仅3条轨迹基础任务成功率达96.8%,真机性能提升32%。
刚刚,Thinking Machines Lab首次发长文,揭开LLM推理不确定性真相
Thinking Machines Lab发长文《克服LLM推理中的不确定性》,指出大语言模型推理不确定性的真正元凶是缺乏批次不变性,还解释核函数计算中数字加法顺序问题,介绍使核具有批次不变性的方法并给出实验结果。
差点被Ilya摁掉,胎死腹中!ChatGPT爆红内幕首次公开
本文深度揭秘ChatGPT爆红内幕,从产品发布、命名内幕到团队文化等方面展开。还提及OpenAI内部对发布的争议,以及ChatGPT发布方式的转变,同时指出依赖用户反馈改进模型存在的问题和OpenAI看重的人才特质。
EMNLP 2025 | T2R-bench: 业内「首个」工业级表格生成报告评测基准
中国电信人工智能研究院推出业内首个面向真实工业场景的“表格到报告”基准T2R-bench,涵盖多领域真实表格、问题与人工标注关键点,配套创新性三维度评测体系。实验显示主流大模型在该任务上表现欠佳,提升空间大。
Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃
大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。
Mira Murati 创业公司首发长文,尝试解决 LLM 推理的不确定性难题
OpenAI前CTO Mira Murati创立的Thinking Machines Lab首发文章《克服LLM推理中的不确定性》,指出大语言模型推理难获可复现结果,深入探究其不确定性根源,提出使核函数具备批次不变性的方法并给出实现与实验。
ACM MM 2025 | 小红书AIGC团队提出风格迁移加速算法STD
小红书AIGC团队提出风格迁移加速算法STD。现有一致性模型在风格化任务有缺陷,文章提出从部分噪声状态出发的训练框架STD,设计轨迹状态库减轻计算负担,引入非对称对抗损失增强风格一致性,实验显示其效果优。
NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了
大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。