「小模型训练」共找到 8575 篇相关文章
苹果的局面,很迷惑
作者对比 Google I/O 大会上谷歌的表现,认为苹果在 WWDC 上的表现令人失望。苹果更新设计语言,其 AI 侧重端侧模型,有数据安全等优势,虽目前参数量小,但端侧 AI 或成新战场。
开放世界任务成功率82%!美的攻克机器人泛化控制难题
美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。
来了,DeepSeek又悄悄开源LPLB项目
DeepSeek 悄悄开源 LPLB 项目,该项目解决 MoE 小批量训练专家每批 token 数抖动问题。LPLB 在 EPLB 基础上,将‘冗余专家’看成带容量边的图,每批解一次线性规划,实现 token 重新路由,单节点 100µs 级求解。
梁文锋执笔的R1论文登上Nature封面!首次回应外界三大质疑
9月17日,DeepSeek创始人梁文锋通讯作者名义发表的DeepSeek - R1论文登《自然》封面。该模型借助强化学习自主形成推理能力,在Hugging Face下载量破1090万次。新版论文回应质疑,披露训练细节,虽有不足但引发学界关注。
OpenAI秘密项目曝出!百名投行精英密训AI,华尔街最贵苦力要失业了?
OpenAI秘密项目「Mercury」曝出,正高薪招募百名前投行精英训练财务模型,替代初级银行家重复性工作。业内认为这是其在算力成本高企下加速商业化与盈利的关键一步,也引发对银行从业者就业与成长的讨论。
750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据集
上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。
One RL to See Them All?一个强化学习统一视觉-语言任务!
国内初创公司 MiniMax 提出 V-Triune 系统,可让 VLM 单一训练流程学视觉推理和感知任务。它含三个组件与动态 IoU 奖励机制,基于此的 Orsta 模型在多项测试中性能提升显著,凸显统一 RL 方法有效性和可扩展性。
与Gemini Diffusion共振!首个扩散式「发散思维链」来了
西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型。
从操作系统到Agent Team,字节Seed 2.0来了!
作者受字节内测邀请,对豆包大模型Seed 2.0进行多方面测试。在APP开发、多模态理解、操作系统构建、Skills调用、真实项目开发等测试中表现出色,虽有小缺点,但整体提升大,值得试用。
只要强化学习1/10成本!翁荔的Thinking Machines盯上了Qwen的黑科技
新智元报道,翁荔的Thinking Machines研究同策略蒸馏策略,能以1/10强化学习成本,结合同策略训练优势与密集奖励信号。该策略受DAGGER启发,扩展Qwen3团队工作,可在Tinker复现,还能用于个性化和持续学习。