自注意力层」共找到 1538 篇相关文章

新闻资讯7

小扎的残酷算术题:砸6000亿搞AI,裁1.6万人省钱

路透社爆料Meta计划裁员20%约1.6万人,这或为其2022年底以来最大规模裁员。与此同时,Meta在AI投入巨大,如6000亿美元建数据中心等,但模型表现不佳,如Llama 4反响平平、Avocado推迟发布。

新智元
产品应用8

阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了

阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。

AI工程化
新闻资讯7

起底Sharpa:一家还没赚钱的公司为何估值快赶上禾赛?

神秘具身智能公司Sharpa亮相引发关注。它以灵巧手技术获认可,后转型整机公司发布机器人North。其团队有禾赛背景,带硬科技基因,受资本青睐,反映供应链切入下游和整机的产业趋势。

AI科技评论
算法论文8

视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26

清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。

新智元
新闻资讯8

一个大脑搞定所有模态,百度ERNIE 5.0技术报告公布

模型发布近3个月后,百度ERNIE 5.0技术报告公布。其底座用超级稀疏架构,参数量万亿但推理激活参数不到3%,实现四种模态原生回归统一,还在路由调度、训练范式等多方面有创新。

量子位
开源动态8

DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?

凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。

PaperAgent
推荐文章7

围观AI对赌直播之后,我见证了一场人类画师对AI的突围。

文章围绕AI对赌直播展开,讲述了画师证、中间人角色等。回顾绘圈在AI到来前后的变化,指出AI加剧竞争与猜忌,介绍然完善对赌规则的努力,强调人类画师应坚持创作实现突围。

数字生命卡兹克
新闻资讯7

融资35亿后,Kimi神秘模型现身竞技场

大模型竞技场上,神秘模型Kiwi - do现身,报来月之暗面Kimi。网友推测它可能是K2 - VL,其通过VPCT测试或改变多模态Agent格局。2025年末Kimi获35亿融资,将用于K3模型研发。

量子位
新闻资讯8

碾压小扎!22岁成亿万富翁,2025年AI造富速度刷新人类认知

2025年AI成超级造富机,将50多位创始人送入亿万富翁俱乐部。从大模型到应用,AI渗透生活。巨额融资不断,巨头砸钱建基建,人才争夺激烈,多模态初创公司也受青睐,职场AI使用比例上升。

新智元
开源动态8

VLNVerse“宇宙降临”:吴琦团队交出2025具身导航最终答卷

2018年吴琦团队发表首篇VLN论文后,领域碎片化问题凸显。2025年末其推出全栈平台VLNVerse,涵盖场景生成、物理模拟、任务基准和通用模型,欲打通Real2Sim2Real,推动VLN向Embodied VLN跨越。

AI科技评论