联合自注意力」共找到 2259 篇相关文章

开源动态7

跳过“逐字生成”!蚂蚁集团赵俊博:扩散模型让我们能直接修改Token | MEET2026

在量子位MEET2026智能未来大会上,蚂蚁集团赵俊博称扩散架构能直接修改控制token,理论上速度更快、成本更低。他团队押注扩散架构,近期开源千亿规模LLaDA 2.0。该领域虽处早期,但发展快,吸引众多巨头和初创公司布局。

量子位
算法论文8

华为新架构砍了Transformer大动脉!任意模型推理能力原地飙升

即便Transformer是AI世界基石,但遇到复杂数学题或多步逻辑推理时表现不佳。问题出在Attention机制。华为诺亚方舟实验室推出Nexus高阶注意力机制架构,能提升模型推理能力,且参数零增。

量子位
新闻资讯8

ICLR重磅回应:评审回滚、AC重置、封禁泄密者、严查贿赂串通

11月27日OpenReview平台曝出重大API漏洞,ICLR 2026超10000篇投稿数据泄露,评审流程熔断。ICLR公布处理方案,回滚评审数据、重分领域主席,封禁泄密者,涉串通论文将拒稿。

机器之心
算法论文8

谢赛宁与Jaakkola团队重磅研究:无数据Flow Map蒸馏

麻省理工学院Tommi Jaakkola和纽约大学谢赛宁团队联合研究,提出无需数据、仅从先验分布采样实现flow map蒸馏的新方法。该方法可规避“教师 - 数据不匹配”风险,在ImageNet实验中表现出色。

机器之心
新闻资讯7

对话范浩强:10亿融资之前,我们手搓了5000元“丐版硬件”

原力灵机是具身智能新秀,9个月连融3轮获阿里数亿投资。其创始团队多出旷视,从To B工业场景切入物流行业。公司发布开源三件套,还将开源基座模型,强调创业要穿越周期,谨慎慢跑。

量子位
产品应用8

4K超分Agent修图师来了!一键救活所有模糊照片

传统图像放大模型应对复杂情况力不从心,4KAgent应运而生。它基于多智能体设计,有感知、复原等模块,能为图像定制4K超分方案,在多领域测试中表现出色,无需特定领域再训练。

量子位
算法论文8

AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型

威斯康星大学麦迪逊分校联合清华的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,使模型在心智理论测试达人类平均水平,揭示构建社交智能AI方法论。

AINLPer
推荐文章8

从华为“弃将”到打造两家上市公司,他如何成为中国“工控之王”?

过去二十多年,朱兴明打破欧美垄断,提升中国工业动化核心零部件水平。他曾是华为员工,后创立汇川技术,带领其上市,还拆分出联合动力上市。他决策有得有失,如今又瞄准新领域。

芯师爷
算法论文8

跨层压缩隐藏状态同时加速TTFT和压缩KV cache!

论文 UNCOMP 被 EMNLP 2025 主会接收,提出高效推理框架,用截断矩阵熵解释 LLM 稀疏化,据此设计 UNCOMP 框架,通过压缩隐藏状态优化 KV Cache,实现计算与内存联合优化,实验效果显著。

机器之心
算法论文8

大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位