联合自注意力」共找到 2250 篇相关文章

算法论文8

扩散语言模型真的会比回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
新闻资讯8

直击WAIC:萝卜快跑入选「国家队」,AI数字人技术升级,百度全栈研杀疯了

在世界人工智能大会 WAIC 上,百度成果亮眼。萝卜快跑入选「国家队」,出海进展快,还与 Uber 合作;数字人技术升级,发布 NOVA。百度靠全栈研技术体系支撑,目标是打造数百万个超级应用。

机器之心
开源动态7

8秒极速生成!复杂场景图像定制低成本轻松驾驭,已开源丨字节北大联合发布

字节跳动与北大联合推出支持多条件组合的统一图像定制化生成框架DreamO,能实现主体、身份等多样化定制。与商业大模型比,它开源、成本低、速度快,8 - 10秒可完成图片定制。

量子位
产品应用7

养虾时代终结?免部署、7×24小时在线、进化的“赛博骡子”来了!

全球首个进化个人AI——MuleRun(骡子快跑)正式发布,免部署、7×24小时在线、可主进化。它适配个体需求、实现群体智慧共享,能完成多类任务,还保障安全、提供售后。

量子位
开源动态8

全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品

蚂蚁通用人工智能中心然语言组联合香港大学然语言组推出PromptCoT 2.0,押注任务合成。它让30B - A3B模型在数学代码推理任务达SOTA,全面升级效果、数据和方法,还将考虑多方向发展。

量子位
算法论文8

ICML 2025 | 千倍长度泛化!蚂蚁新注意力机制GCA实现16M长上下文精准理解

在大语言模型发展中,长文本建模挑战大。蚂蚁研究团队提出注意力机制GCA,可端到端学习检索相关片段,实现超长序列处理与泛化,其Triton kernel实现已开源,论文被ICML 2025接收。

机器之心
产品应用7

AIGCode宿文:我就是要训练大模型,直接做「L5」| AI产品十人谈

AIGCode宿文坚信Coding是培育大模型的最佳场景,公司训练66B基础模型,发布锡月大模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。

AI科技评论
开源动态8

中山大学&华为联合提出 Issue Resolution 数据集构建神器SWE-Factory:每条只要$0.024

中山大学和华为联合提出低成本开源方案 SWE-Factory,可动收集代码打造高质量代码评估数据集。它能解决传统构建流程繁琐、依赖人工的问题,实现全流程动化,还构建了 SweSetupBench 数据集,表现出色。

深度学习自然语言处理
算法论文8

千万级标注成本归零!CVPR 2025清华团队成果:相机的“运动”就是最好的老师

以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。

量子位
算法论文7

token危机解决?扩散模型数据潜力3倍于回归,重训480次性能仍攀升

新加坡国立大学AI研究者Jinjie Ni团队预训练扩散语言模型(DLMs)与回归(AR)模型,发现DLMs是超强数据学习者,数据潜力超AR 3倍,重训480次性能仍攀升,还剖析同期研究方法论缺陷。

机器之心