新注意力机制」共找到 4298 篇相关文章

算法论文8

泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别解法

随着大模型和工具增长,AI 助手意图识别遇挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。

机器之心
新闻资讯7

机器人全程自主收拾客厅!390亿美元估值机器人端到端技能,英伟达持续加注

估值390亿美元、英伟达持续看好的Figure机器人有进展,能完全自主、端到端全流程整理客厅。背后是其自主研发的具身大脑Helix 02系统,仅补充数据就能掌握全任务。

量子位
新闻资讯8

氛围编程后,Karpathy又双叒有「脑洞」!PDF将死,未来99%是AI氛围阅读

Karpathy提出未来研究论文不应是PDF格式,未来99%注意力将来自AI,科研成果应为AI优化。此观点源于生物学家Michael Levin关于为AI写作的讨论,引发众多科技思想者回应。

新智元
产品应用8

d-Matrix用3D堆叠技术终结"内存墙",AI推理迎来光速时代

2025年9月Hot Chips上,d - Matrix展示3D堆叠数字内存计算技术,直击AI“内存墙”难题。其产品Corsair带宽强大,Pavehawk架构更有性能跃升,为AI推理开辟赛道,虽面临挑战但前景可期。

AIGC开放社区
开源动态8

Qwen3深夜开源系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA

Qwen3深夜上Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。

量子位
算法论文8

LLM越狱攻击的威胁被系统性高估? 基于分解式评分的「越狱评估范式」出炉

目前LLM越狱攻击评估常依赖间接指标或LLM宏观判断,易有偏差。德国、中国等研究团队提出JADES框架,用分解式评分机制,揭示过去高估越狱攻击威胁,为评估建标准。

机器之心
开源动态8

准确率92.7%逼近Claude 3.5、成本降低86%,开源代码定位神器LocAgent来了

OpenHands 等团队发布 LocAgent,这是用于代码定位的图索引 LLM Agent 框架,准确率达 92.7%。它把代码库解析成图,提供工具接口,经实验效果出色,开源微调模型降本增效,还能提升问题解决率。

机器之心
算法论文8

斯坦福&英伟达提出范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家

斯坦福和英伟达提出 TTT - Discover 范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。

深度学习自然语言处理
新闻资讯7

a16z 全球 AI 产品 Top100:DeepSeek 增长放缓,「中国开发,出海全球」成为常态

时隔半年,a16z发布第五版「Gen AI消费级应用Top 100」榜单,显示AI应用生态趋于稳定。Google旗下产品增长快,Grok移动端用户大增,DeepSeek增长放缓,「中国开发,出海全球」成AI应用常态,vibe coding类应用用户粘性高。

Founder Park
开源动态8

AgentScope 正式发布 Skills 支持 - 实现渐进式披露

文章指出大语言模型驱动的Agent系统存在核心矛盾,常见上下文加载方案有局限,缺乏灵活机制。介绍了AgentScope发布的Skill机制及渐进式披露策略,还讲了其在Java中的实现,最后分析了适用与不适用场景。

阿里云开发者