新注意力机制」共找到 4298 篇相关文章

产品应用8

手机“自动驾驶”时代来了,智谱还让手机拥有“云替身”

作者参加智谱AutoGLM版本闭门会并试用,该版本亮点多,如成全球首个手机通用Agent,操作在云设备运行,全平台覆盖等。云手机Agent能力稳定高效,能处理多类任务,还可助老人等群体用手机。

歸藏的AI工具箱
开源动态8

DeepSeek-V3.2正式版发布,将开源模型的能力推向极致

DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。

AIGC开放社区
新闻资讯7

智能体的记忆管理机制及其潜在风险 | 直播预约

大语言模型(LLM)智能体兴起,记忆机制是核心。本次报告将探讨记忆管理对其性能的影响及潜在风险,展示缓解关键挑战的策略,介绍攻击范式,揭示安全漏洞,强调需重审视与建模。

深度学习自然语言处理
算法论文8

田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索

AI大牛田渊栋团队利用连续空间“叠加态”让大模型并行推理,提升图可达性等任务表现,为连续思维链提供理论支持。还设计注意力选择器等机制,实验显示连续思维链模型准确率更高。此外,田渊栋还是科幻小说家。

量子位
算法论文8

System 3 觉醒:从“工具”到“物种”的根本改变

西湖大学与上海交大论文提出System 3概念及Sophia框架,将认知心理学概念映射到代码模块,让AI Agent像“生命体”生存。采用前向学习和混合奖励机制,实验显示其能力显著进化,为人工生命指明道路。

深度学习自然语言处理
产品应用7

Agent 的第一性问题:Proactive 与 Context 经济学

过去一年AI Agent能力提升,但用户体感未同步变好,原因在于人类注意力窗口有限。赛道分化,主动式桌面Agent是方向,AirJelly是代表产品,五源资本对其创始人黄柏特进行访谈,探讨产品设计、应用场景等问题。

五源资本 5Y Capital
算法论文8

视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26

清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷纪录,为端侧设备部署开辟路。

新智元
开源动态7

从一行代码发现DeepSeek的秘密:Model1到底是什么?

在DeepSeek - R1发布一周年时,有人在GitHub的FlashMLA代码仓库发现神秘代号Model1,可能是V4。文章分析了代码仓库用途、模型“露馅”原因,还从代码中发现Model1细节,结合论文梳理时间线,最后也提出了怀疑。

花叔
开源动态8

更高智商更快思考!蚂蚁开源最万亿语言模型,多项复杂推理SOTA

蚂蚁正式发布拥有万亿参数的通用语言模型Ling-1T,超越多个开源和闭源模型,在多项复杂推理基准中取得SOTA表现。它推理和代码能力强,研发采用‘中训练+后训练’,还提出奖励机制和LPO方法。

量子位
算法论文8

扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%

论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供范式。

深度学习自然语言处理