两阶段注意力机制」共找到 1642 篇相关文章

推荐文章8

对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」

本文是对IDEA研究院张磊的深度访谈。张磊在计算机视觉领域成就斐然,他指出具身智能落地需攻克成功率、泛化性等挑战,大脑比本体更关键。还阐述了世界模型概念及应用,定义其应具备动作依赖等内容。

AI科技评论
新闻资讯8

刚刚,DeepMind经典巨作再封神!ICML 2026大奖公布

ICML 2026大奖公布,杰出论文奖中两篇扩散模型论文获奖,立场论文奖指出AI安全工具被挪用问题。时间检验奖颁给DeepMind经典论文。获奖名单显示扩散模型研究热,AI安全需审视,AI研究进入深度清理阶段

新智元
产品应用7

全球首个完全AI编写的训练框架来了,速度反超英伟达:面壁要用 AI 把国产算力软件重写一遍

面壁智能发布全球首个全由AI编写的训练框架ForgeTrain,在华为昇腾系列上验证,速度超英伟达Megatron 10%。其构建分三阶段,目标是为不同需求“现场锻造”软件,还为国产算力软件生态赶超提供新思路。

AI前线
新闻资讯7

翁荔创业大模型首秀!告别“120亿美元估值0模型”

Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。

量子位
产品应用7

大规模替换数据库序列,保障百余个服务平稳运行

Coupang从关系型数据库迁移到NoSQL时,为解决序列替换问题,自研了专用解决方案。该方案采用双层缓存与滑动窗口预填充机制,以DynamoDB为数据源,让百余个服务无需重写代码完成迁移,性能和成本表现佳。

InfoQ
推荐文章7

Skill 火了,但它可能只是个过渡品

大家认为给 Agent 装技能包是未来,但云玦科技的“零 Skill Agent”能自己造工具并碾压基于 Gemini 3 Pro 的 Agent。文章回顾 Agent 用工具三阶段,指出 Skill 是过渡品,不过现阶段仍实用,未来会进化。

AI Reading Hub
推荐文章8

让外部知识“长入”模型:动态化与参数化 RAG 技术探索

检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。

AI前线
产品应用8

比肩Claude Opus:阶跃星辰最强模型Step 3.5 Flash发布

阶跃星辰发布最强模型 Step 3.5 Flash,参数强大,性能与前沿顶级大模型并驾齐驱。其架构平衡算力与智力,有独特注意力布局;基础设施保障训练稳定;强化学习激发智能体潜能;评测数据显示战斗力强,未来还将持续优化。

AIGC开放社区
产品应用7

Gemini盘活了谷歌全家桶,“原生”自带你10年的记忆

谷歌发布由Gemini3驱动的“Personal Intelligence”功能,底层连接旗下四大应用,让AI跨应用获取数据,还内置纠错机制。该功能现处Beta测试,未来覆盖免费用户。谷歌与苹果引入Gemini后路径不同,AI竞争也转向生态构建。

量子位
开源动态8

不到百万级,看不见 MCP 的真实问题:创始人亲述这疯狂的一年

MCP 联合创作者 David 复盘其发展,从开源协议到行业事实标准,经历多阶段演进。他指出做对死磕标准 HTTP,踩坑让关键能力成可选致双向能力被削,规模达百万级有扩展性问题,还谈及多方面发展与规划。

InfoQ