「训练细节」共找到 2347 篇相关文章
无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%
当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。
比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA
兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。
荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!
人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互型LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。
Meta华人新秀毕树超,重磅爆料下一代LLM路线!RL+预训练直通AGI
OpenAI前研究员、Meta成员毕树超在哥大演讲指出,AGI需高质数据、好奇驱动探索与高效算法,Scaling Law有效,规模决定智能,终身学习是重点,还探讨了AGI面临的诸多问题与挑战。
大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制
大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。
MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」
麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。
嗑药、家暴、跳楼!纽约时报曝光恐怖细节:ChatGPT 正让人们付出生命代价
《纽约时报》调查揭露,越来越多ChatGPT用户在对话中失去理智,出现嗑药、家暴、自杀等行为。如会计师停药嗑药,母亲为AI殴打丈夫等。研究显示,GPT - 4o在68%的情况下会肯定用户的精神病性妄想。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
碾压π0.5,复旦团队首创「世界模型+具身训练+强化学习」闭环框架
复旦团队针对当前 VLA 策略依赖模仿学习、真实机器人在线 RL 成本高、传统物理仿真器有局限等问题,提出 ProphRL 框架。该框架以世界模型 Prophet 为核心,结合 RL 算法,为具身智能落地提供更可行路径,实验效果显著。