「注意力残差」共找到 555 篇相关文章
「Tokens是胡扯」,Mamba作者抛出颠覆性观点,揭露Transformer深层缺陷
Mamba作者Albert Gu在博客中探讨状态空间模型(SSM)和Transformer权衡,抛出‘Tokens是胡扯’观点,揭露Transformer深层缺陷,如分词问题、处理噪声能力弱等,还分析两类模型特点及结合优势。
开源多模态大模型EarthMind,观测地球统一框架
地球观测数据复杂,现有多模态模型难适用。意大利、德国多所高校研究人员联合开源多模态大模型EarthMind,引入空间注意力提示模块,实现跨模态融合和多粒度理解,解决地球观测难题。
小扎开9位数薪酬新建AI团队!砸千亿收购华人初创公司,Llama 4太拉胯急坏了
Meta CEO扎克伯格对Llama 4表现失望,一边开7 - 9位数薪酬从谷歌、OpenAI等公司挖人组建新AI实验室,另一边豪掷148亿美元收购初创公司Scale AI 49%股份并挖来CEO,Llama 4在第三方测试中表现不佳。
0粉丝狂卷数十亿播放,靠AI流量欺诈获利近亿!网友:这“刑”得离谱
2024年全球录制音乐市场总收入飙升,流媒体经济贡献突出,但AI技术引发的流媒体欺诈问题严峻。如北卡罗来纳州男子Michael Smith利用AI创作虚假歌曲欺诈获利,类似事件增多,平台反击成效不佳。
刚刚,OpenAI发布自主编码代理Codex,程序员的工作将被彻底颠覆?
OpenAI发布自主编码代理Codex,它能独立完成编程任务。与其他工具不同,它是面向任务的,允许并行工作。虽经强化学习微调,代码有“品味”,但有局限,如后续请求处理不佳,未完全集成工程环境。
刚刚国产双响炮炸场!智谱「牛来模型」和阿里Qwen3.8-Flash双双亮相屠榜
智谱发布GLM - 5.3 - Flash(牛来模型),原生多模态,支持1M token上下文,运行在国产芯片,价格实惠。阿里开源Qwen3.8 - Flash - Next权重,成本低性能优,在四大维度重构架构。
今年 AGI 大会上,这 10 个创业团队最受关注
在 AGI Playground 2026 的 Founder Show 活动上,10 个创业团队展示项目,横跨 Agent 基础设施、Physical AI 等方向。如 Tap8 实时生成交互视频,EigenFlux 为 AI Agent 建网络,Aceii One 是 AI 网球机器人等。
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?
PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。
6.2K Star!25 种风格配方让 AI 前端审美直接拉满!garden-skills把这事做彻底了。
AI 站点界面同质化严重,开发者陷入享受便利又抱怨产出同质化的矛盾。开源项目 garden - skills 由 ConardLi 开发,是面向 AI 编程代理的技能集合,解决了界面审美和流程不稳定问题,有多种亮点与安装方式。