「并行循环Transformer」共找到 616 篇相关文章
卷疯了!这个清华系Agent框架开源后迅速斩获1.9k stars,还要“消灭”Prompt?
随着大模型能力突破,Agent 从概念走向应用。清华系 Agent 框架 Cooragent 开源获 1.9k stars。其创始人王政认为 Agent 框架要适应多样需求,解决泛化与精确性平衡等痛点,还分享了对 MCP、框架融合等看法。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。
谁不想要一条会飞的鱼呢?他们造了个会捣蛋的机器人,拿下了最佳论文奖
庆应义塾大学徐铭阳和香港城市大学李彦衡发表论文Floating Companion,获ACM DIS 2026最佳论文奖。他们研究软体浮空机器人,探讨其与人的关系、交互可能,虽面临浮力 - 质量循环等挑战,但对其未来充满期待。
你不知道的 Agent:原理、架构与工程实践
文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。
英伟达龙虾模型开源,12B激活登上成功率全球第四
英伟达发布专为龙虾打造的开源模型Nemotron 3 Super,总参数120B,激活参数12B,在龙虾模型基准PinchBench上成功率全球第四。该模型结合Mamba与Transformer架构,引入多项创新技术,还开源了模型权重、数据集等。
量子芯片离商用还有多远?解读半导体的下一代革命
本文深度拆解量子芯片全产业链,指出其成突破半导体产业天花板核心方向。全球多技术路线并行研发,虽有进展但距商用有差距。其商用面临三重壁垒,将分阶段落地,普及后会重塑产业与社会,与传统芯片互补。
OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE
OpenAI悄悄开源新模型,0.4B参数且99.9%权重为零,是Circuit Sparsity技术的开源实现。该技术通过约束模型内部连接稀疏性,解决传统稠密Transformer黑箱问题,或让MoE模型走上末路,但目前算力成本极高。
The Batch: 873 | 通过自监督学习实现更好得图像处理
Meta等团队发布DINOv3权重和训练代码,参数规模扩6倍,用更多数据并引入新损失函数。它在图像分割和深度估计表现卓越,解决了自监督训练的视觉transformer的问题,提升全局和局部任务表现。
AI自动写学术综述:10分钟生成6万字,成本不到四块钱
上海人工智能实验室等单位提出SurveyForge框架,能自动化生成高质量学术综述论文。它有双数据库协同驱动的大纲生成机制、学者导航代理SANA和并行生成与协调机制。还有SurveyBench评估框架,实验显示其效果好,应用前景广。