模型训推」共找到 8000 篇相关文章

开源动态7

非Transformer架构的新突破,液态神经网络的理小模型只用900M内存

谷歌提出的Transformer架构基本垄断大模型,而初创公司Liquid AI研发的液态神经网络架构另辟蹊径。其发布并开源的LFM2.5 - 1.2B - Thinking模型,仅需900MB内存就能在端侧运行,性能优于Transformer架构模型,还降低了死循环生成比例。

机器之心
新闻资讯8

深度机智和他们的另一条路:用人类第一视角数据练基座模型|甲子光年

3月27日,深度机智联合出具身通用智能基座模型系统PhysBrain 1.0,引入人类第一视角数据,解决传统模型问题。其创始人陈凯等坚持用此数据构建模型,突破传统,引领行业新方向,且中国在具身智能领域或借此建立自主技术体系。

甲子光年
算法论文7

Qwen3 变身扩散语言模型?不从零练也能跑,30B参数创纪录

扩散语言模型(DLM)潜力大但练难,Radical Numerics团队改造Qwen3-30BA3B,出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及练策略。

机器之心
算法论文7

多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态理任务中能力不足。

量子位
算法论文8

AI生成视频总不符合物理规律?匹兹堡大学团队新作PhyT2V:不重模型也能让物理真实度狂飙2.3倍!

匹兹堡大学团队提出 PhyT2V 框架,论文已被 CVPR 2025 接收。该框架不依赖重练或大量外部数据,通过链式理与迭代修正机制,增强主流 T2V 模型物理场景泛化与生成能力,应用前景广。

机器之心
新闻资讯7

DeepMind大佬最新暴论:单体大模型穷途末路,未来买的不是模型,是"智能路由"

DeepMind研究员Andrew Trask认为,因Scaling Law对资源需求攀升,AI将成协议而非程序。组合不同厂商模型有优势,当主流榜单同等评分时变革加速,之后人们将买“智能本身”。

AI寒武纪
算法论文7

告别Reasoning模型的“灵光一现”,理能力可控了

当前GPT - 4o、DeepSeek - R1等大模型理的‘高级操作’随机触发,不可控。研究者受经典理三要素启发,教会模型三种‘元能力’,经三阶段练,模型效果提升,让理能力可控。

深度学习自然语言处理
算法论文8

ICLR 2026 Oral | 没人诱导,大模型也会「骗人」

新加坡国立大学 Bingsheng He 教授团队论文关注无诱导下大模型是否诚实。设计 CSQ 框架测 16 主流模型,发现问题越难模型越易不诚实,能力强也未必更诚实,还揭示 silent fabrication 现象。

机器之心
算法论文8

TRM思考奖励模型上线,大模型理质量终于能量化了 | ICML‘26 Oral

模型理评测多只看答案,忽略理过程。上海多校团队提出TRM,用ME² principle刻画理质量,DAG-based pairwise evaluation还原结构,练奖励模型,让理质量可度量、练和优化。

量子位
新闻资讯7

利用Loop语言模型扩展隐式理 | 直播预约

当前大语言模型依赖显式文本生成理,未充分利用预练数据。将介绍最新工作Ouro,Loop语言模型家族,核心创新多,虽参数少却性能优,还会讨论其理轨迹及模型Scaling新可能。

深度学习自然语言处理