自注意力机制」共找到 1952 篇相关文章

产品应用8

美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局

近日美团推出多模态统一大模型 STAR,以“堆叠回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。

机器之心
推荐文章8

MCP 和 Skills 到底什么区别?一篇文章说清楚

文章解释了 MCP 和 Skills 的区别。MCP 是 AI 世界的 USB 协议,可降低开发成本,但会吃掉上下文窗口;Skills 采用渐进式披露设计,带脚本,能减少上下文消耗。未来 Skills 或承担多数工作,MCP 用于远程连接。

宝玉AI
产品应用7

谷歌发布 Gemma Scope 2,深化对 LLM 行为的理解

Gemma Scope 2 是谷歌推出的解释 Gemini 3 模型行为的工具,结合稀疏编码器和转码器,能让研究人员检查模型内部表示。它从多方面扩展了原先的 Gemma Scope,还引入针对聊天机器人的分析工具,已发布权重。

InfoQ
开源动态8

SGLang Hierarchical Sparse Attention 技术深度解析

阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。

阿里云开发者
产品应用7

模力工场 027 周 AI 应用榜:从“一键生成”到“动交付”,最会帮你干活的 AI 榜单来袭

模力工场第027周AI应用榜揭晓,上榜产品迈入新阶段,能接管关键环节。如Manus交付调研报告,秒哒将想法变应用,邀虾打通跨境电商流程。还介绍了上榜应用、趋势及上榜机制等。

AI前线
算法论文8

System 3 觉醒:从“工具”到“物种”的根本改变

西湖大学与上海交大新论文提出System 3概念及Sophia框架,将认知心理学概念映射到代码模块,让AI Agent像“生命体”生存。采用前向学习和混合奖励机制,实验显示其能力显著进化,为人工生命指明道路。

深度学习自然语言处理
新闻资讯8

“大模型第一股”打响上市前哨战!智谱GLM-4.7 刷新开源编程SOTA,修复代码、终端操作表现超Claude 4.5

冲刺大模型第一股的智谱推出开源大模型GLM - 4.7,主打编程与代理式任务提升。它在多项基准测试中表现出色,UI质量飞跃,还采用新推理机制。智谱上市在即,但亏损扩张快,研发投入大。

AI前线
新闻资讯8

硅谷还在「卷PPT」,中国机器人大军上岗!看呆歪果仁

全球具身智能顶级赛事GDPS 2025在上海张江开幕,智元与宇树等企业同台竞技。赛事分六大主题赛道,首创‘三元评审’机制,还有‘实验工坊’。上海以千亿资金、国家级创新中心和全场景实验推动具身智能发展。

新智元
7

罗永浩的十字路口:播客、年轻人和 AI 浪潮

2025年底,罗永浩在极客公园IF 2026上称,做播客要克制天分,把舞台留给精英。他看好年轻创业者,虽锤子科技失败,但遗产滋养后辈。面对AI浪潮,他斗志旺盛,认为未来十年手机难被取代,己还会折腾。

Founder Park
开源动态8

华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」

今年文本生成领域从回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。

机器之心