「双并行注意力机制」共找到 1187 篇相关文章
对话地平线前高管牛建伟:万亿参数大模型如何重塑具身智能
具身智能赛道分“VLA派”“智驾降维派”和“大模型派”。地平线前高管牛建伟认为VLA是弯路,主张用分层架构,以万亿参数“空间智能大模型”做大脑,VA小模型执行操作,目标是做物理世界的OpenClaw。
迎接范式革命:最新、最全的大模型Latent Space综述,NUS、复旦、清华等联合出品
大模型核心计算正从显式空间转向潜在空间,现有文献缺乏统一视角。NUS、复旦等机构的综述《The Latent Space》从五大视角构建框架,阐述潜在空间基础、演进、机制、能力,指出挑战与未来方向。
这个 skills 太硬核了,刚开源就斩获 1.7K Star!Agent 联网能力拉满!
AI开发者圈热议让AI助手真正“上网”,Claude Code原工具局限性大。web - access skill横空出世,从底层架构重新设计,解决其三大短板,让Claude Code可自由穿梭互联网,功能强大且安装使用方便。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。
谷歌研究院探索多智能体协调的扩展原则
谷歌研究院对180种智能体配置对照评估,得出‘AI智能体系统首批定量扩展原则’。发现多智能体协同效果因任务而异,还指出工具使用瓶颈等问题,且开发预测模型辅助架构选择。
我用 AI 翻译的三个阶段:提示词时代 → 推理模型时代 → Agent 时代
作者分享近 2 年 AI 翻译经验,将其分为提示词、推理模型、Agent 三个时代,介绍 Agent 翻译与提示词翻译区别,还阐述 Skill 创建迭代、三种翻译模式由来等,给出解决一致性问题等方法。
陈天桥邓亚峰联手破解大模型记忆难题!4个月打造SOTA系统,悬赏8万美元发起全球记忆挑战赛
今年全球AI圈聚焦大模型记忆技术。陈天桥和邓亚峰带队的EverMind推出世界级长期记忆系统EverMemOS,发布即SOTA。其模拟人脑记忆机制,开源且上线云服务,还发起8万美元记忆起源大赛。
DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini
DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。
首篇具身智能机器人「安全」综述:LLM如何跨越物理鸿沟?
最新综述首次系统探讨LLM控制机器人的安全威胁、防御机制与未来挑战,指出LLM的具身鸿沟导致其在物理空间可能执行危险动作,而现有防御体系存在逻辑与物理脱节等问题。
跳出「黑盒」,人大刘勇团队最新大语言模型理论与机理综述
大语言模型工程成功但理论研究滞后,被视为「黑盒」。人大刘勇团队用生命周期分类法,将LLM理论研究整合为六阶段,系统综述底层理论与机制,指出前沿挑战,为其向严谨科学转型提供路线图。