「Qwen团队」共找到 3746 篇相关文章
消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存
消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。
Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」
新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。
清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型
大语言模型幻觉问题待解,成本与算力需求攀升。清华孙茂松团队联合深言科技提出FaithLens模型,把幻觉检测提升为整体评估,以解释作为训练信号,8B模型在多任务上超闭源大模型。
印裔1号位删 Karpathy 团队90%代码、算力暴涨 50 倍!马斯克 Robotaxi 10年终上线,30 元乘车体验刷屏
当地时间6月22日,特斯拉在奥斯汀启动Robotaxi试点服务,仅受邀用户参与。其技术基于FSD 13.2.9微调,团队精简90%代码,算力强大。虽面临竞争,但马斯克看好其发展,认为2026年或现超级智能。
Nature公开谷歌IMO金牌模型技术细节!核心团队仅10人,一年给AI编出8000万道数学题训练
谷歌DeepMind的IMO金牌模型AlphaProof技术细节公开。团队规模小,核心成员是IMO金牌得主。它把数学证明当游戏,用30亿参数模型和改进树搜索算法。训练难题靠自动形式化解决,赛场用TTRL突破,已开放使用。
给GRPO加上运筹外挂让7B模型比肩GPT-4!Li Auto团队发布多目标强化学习新框架 | ICASSP 2026
文本摘要质量评估需兼顾多维度,但开发者优化时易顾此失彼。Li Auto团队提出HVO,基于GRPO框架,让7B模型在摘要任务媲美GPT - 4,且生成内容更简洁,成果被ICASSP 2026接收。
RL 将如何提高具身大模型 VLA 泛化性?清华大学团队NeurIPS 2025文章分析 RL 与 SFT 泛化性差异
清华大学团队在NeurIPS 2025发表文章,揭示强化学习(RL)提升具身大模型VLA泛化能力的优势,对比其与SFT差异,还提出评测基准和训练方法,为VLA训练提供新方向。
RSS 2025|从说明书学习复杂机器人操作任务:NUS邵林团队提出全新机器人装配技能学习框架Manual2Skill
新加坡国立大学邵林团队提出 Manual2Skill 框架,利用 VLMs 将说明书视觉指令转化为机器人装配技能,含层级化装配图生成、分步骤位姿估计、动作生成与执行三阶段,实验验证其在多场景的有效性。
SOTA大模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究
当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA大模型,结果显示模型表现不佳,还分析了模型“犯难”原因。
ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式
华为GTS研发部AI数据团队提出EDCO方法,将样本难度估计与动态课程编排引入领域大模型微调。该方法用推理熵动态编排训练课程,让模型面对最有学习价值的样本,已被ICML 2026接收。