「训练框架」共找到 3428 篇相关文章
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
西交大提出QQWorld:仅需10行代码,世界模型成功率提升5.33个百分点
2026 年 3 月 Yann LeCun 等人提出 LeWorldModel,西安交通大学研究团队发现其存在问题,进而提出 QQWorld,用分位数—分位数匹配替换原有的 EP 正则,提升了规划成功率,还提出 Cross - Batch QQ 解决显存问题。
本周 5 个火火火的Github开源项目,每个都很有说法!
本周介绍5个Github开源项目。ai - berkshire将投资大师方法论系统化;stremio - web聚合视频资源;archify能将大白话描述变成架构图;Maple - font是优化的编程字体;Netcatty整合SSH客户端等功能。
Linux 基金会推出 Akrites 项目,防护核心开源软件免受 AI 网络威胁侵害
Linux 基金会发起 Akrites 项目,获超 20 家机构支持,旨在保护关键开源软件免受 AI 网络威胁。它建立协调框架,改进漏洞处理方式,补充现有工作,反映网络安全理念转变。
李飞飞刚立规矩才13天,国产卡上「真物理」就来了!
李飞飞为「世界模型」立规矩13天后,中国「草根」团队Mogo推出全球首个具备高动态物理交互能力的世界模型Magpie 1.0,在国产芯片上实现超10分钟物理一致性,开辟全新技术路径。
OmniWork:面向创作者的 Agent OS
文章介绍了面向创作者的 Agent OS OmniWork,它的 Agent 围绕专业方向定制,Expert 和 Skill 可自行创建,能多 Agent 协作。通过实例展示其从热点捕捉到生成 BP、文章创作等功能,还介绍了底层逻辑,适合创作人群。
大型挂机现场:马斯克的55万英伟达GPU,利用率才11%
《The Information》报道,马斯克旗下xAI有55万英伟达GPU,利用率仅11%。原因包括大规模部署协调难、数据传输瓶颈和训练间歇性。这是行业普遍问题,xAI着手解决,设定50%利用率目标。
数学的上帝粒子!一个运算符能导出所有基本函数
波兰雅盖隆大学的Andrzej Odrzywołek在论文中指出,仅用一个叫EML的二元运算符加常数1,就能推导科学计算器上所有基本函数,还可能为机器学习符号回归提供新思路。
1M 参数干翻 200M!时序预测选模型,你可能一直都选错了
近期时序预测领域新模型频出,作者开源的 QuitoBench 显示,参数量仅 1M 的 CrossFormer 击败大模型夺冠。它还揭示模型选择与历史数据长度有关,且数据边际收益高于参数。
AI写CUDA算子准确率92%,到国产芯片只剩4%?上交方法直线拉升,DeepSeek也适用
GPT-5.2写CUDA算子正确率92%,给华为Ascend NPU写算子仅4%,因公开数据少等致‘新硬件冷启动’难。上海交大团队EvoKernel不训新模型、不标新数据,将GPT-5.2正确率从4%拉到83%,还拓展到DeepSeek架构算子。