训练导向问题」共找到 4928 篇相关文章

算法论文8

时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8

在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。

机器之心
算法论文7

ACL 2025 | 大语言模型正在偷改你的代码?

本文聚焦大语言模型在代码推荐中的「供应商偏见」,通过分析7个主流大模型在30个场景的59万次响应,发现模型会偏好特定供应商,甚至擅自修改代码,还探讨了风险、局限并给出展望。

机器之心
算法论文8

DeepMind 最新研究:智能体就是世界模型!

DeepMind研究科学家Jon Richens团队在ICML 2025发表论文,从第一性原理证明智能体就是世界模型,回答了AI界多年的根本问题,还带来多个有趣推论,引发AI社区热烈讨论。

AGI Hunt
新闻资讯7

0粉丝狂卷数十亿播放,靠AI流量欺诈获利近亿!网友:这“刑”得离谱

2024年全球录制音乐市场总收入飙升,流媒体经济贡献突出,但AI技术引发的流媒体欺诈问题严峻。如北卡罗来纳州男子Michael Smith利用AI创作虚假歌曲欺诈获利,类似事件增多,平台反击成效不佳。

AI前线
算法论文8

音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造

南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。

量子位
开源动态8

万帧?单卡!智源研究院开源轻量级超长视频理解模型Video-XL-2

长视频理解是多模态大模型关键能力,当前开源模型有短板。智源研究院联合发布 Video-XL-2,多维度优化长视频理解能力,还设计效率优化策略,在主流评测基准表现出色,有广泛应用潜力。

机器之心
开源动态8

360开源高质量图文对齐数据集!收纳1200万张图像+1000万组细粒度负样本,让模型告别“图文不符”

360人工智能研究团队的冷大炜博士团队开源FineHARD高质量图文对齐数据集,包含1200万张图像、4000万个边界框及对应描述、1000万组细粒度难负样本,能提升模型图文对齐能力,还介绍了构建方法、分析及应用前景。

量子位
产品应用8

大模型推理的“左右脑”革命!华为盘古Embedded凭昇腾之力,让快慢思考合二为一

传统大模型推理面临长链条深度思考与低时延反馈的矛盾,华为盘古团队提出盘古Embedded模型。基于昇腾NPU,其采用双系统认知架构,集成“快思考”与“慢思考”双推理模式,实现推理效率与精度协同提升。

机器之心
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【九】| 层归一化:神经网络的稳定器

本文是系列文章第九篇,介绍了神经网络中的层归一化。先回顾标准差、标准分概念,指出其可使差异可控稳定。接着说明层归一化将原思想用在神经网络,还加入可学习参数,最后总结其作用与应用位置。

AI大模型应用实践
算法论文8

博士宿舍激情脑暴,革新了Scaling Law?Qwen和浙大联手推出新定律,直接干掉95.5%推理内存!

近日,阿里与浙大合作提出并行计算缩放定律 ParScale,可在不增参数下提升大模型能力,推理效率更高。它通过引入并行流实现,在数学、编程等任务表现佳,适合边缘设备,代码已开源。

AI前线