循环Transformer」共找到 386 篇相关文章

产品应用8

“不爱龙虾爱马仕”,为什么Hermes比OpenClaw更值得

文章对比了Hermes Agent和OpenClaw,Hermes由Nous Research出品,开源免费,安装便捷,支持多模型。其核心是闭环学习循环,能自我进化,技能可自动生成和更新,记忆系统更优,在多场景有优势,安全设计好。

鲸选AI
开源动态7

马斯克罕见低头:开源𝕏推荐算法,自嘲“很烂”不过未来月更

马斯克开源𝕏推荐算法系统,这是几乎全由AI模型驱动的系统。它基于Grok - 1同款Transformer架构,通过学习用户历史互动行为推荐内容。虽获社区称赞,但算法有缺陷,马斯克也承认‘很烂’,未来将月更。

量子位
开源动态8

3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学

上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。

量子位
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
算法论文7

谁不想要一条会飞的鱼呢?他们造了个会捣蛋的机器人,拿下了最佳论文奖

庆应义塾大学徐铭阳和香港城市大学李彦衡发表论文Floating Companion,获ACM DIS 2026最佳论文奖。他们研究软体浮空机器人,探讨其与人的关系、交互可能,虽面临浮力 - 质量循环等挑战,但对其未来充满期待。

DeepTech深科技
推荐文章8

你不知道的 Agent:原理、架构与工程实践

文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。

阿里云开发者
开源动态8

英伟达龙虾模型开源,12B激活登上成功率全球第四

英伟达发布专为龙虾打造的开源模型Nemotron 3 Super,总参数120B,激活参数12B,在龙虾模型基准PinchBench上成功率全球第四。该模型结合Mamba与Transformer架构,引入多项创新技术,还开源了模型权重、数据集等。

AIGC开放社区
开源动态7

OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE

OpenAI悄悄开源新模型,0.4B参数且99.9%权重为零,是Circuit Sparsity技术的开源实现。该技术通过约束模型内部连接稀疏性,解决传统稠密Transformer黑箱问题,或让MoE模型走上末路,但目前算力成本极高。

量子位
开源动态8

The Batch: 873 | 通过自监督学习实现更好得图像处理

Meta等团队发布DINOv3权重和训练代码,参数规模扩6倍,用更多数据并引入新损失函数。它在图像分割和深度估计表现卓越,解决了自监督训练的视觉transformer的问题,提升全局和局部任务表现。

DeeplearningAI