注意力算法」共找到 756 篇相关文章

推荐文章7

AI领域并无真正的新想法,只有新的数据集

作者Jack Morris认为AI虽进步明显,但范式转变级突破不多。大语言模型四次关键突破底层理论早已有之,新在于数据。改变数据比调整模型或算法作用更明显,推动AI进步应找新数据,如YouTube或具身化数据。

宝玉AI
推荐文章7

200行python代码实现从Bigram模型到LLM

本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。

阿里云开发者
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
新闻资讯7

颠覆算力格局!全球首个星座级太空AI算力服务,在中国诞生

第四届琶洲算法大赛中,国星宇航与佳都科技联手推动「慧行·AI上星」实验,标志国星宇航成全球首个提供常态化星座级太空算力商业服务公司,验证太空算力承载行业应用可行性。

新智元
算法论文8

按token 计费,真的合理吗?

马克斯·普朗克软件系统研究所论文揭露,同样文本可被切分成不同数量token,用户难以验证是否被多收费。研究团队开发算法展示服务商多收费手段,还指出按字符计费可解决问题,但需行业达成共识。

AGI Hunt
算法论文7

AIAAJ | 西工大张巧、张伟伟等:多专家特征融合网络架构预测跨声速抖振气动噪声

为解决气动噪声数据中流动状态与空间位置分布不平衡导致的MLP预测精度不足问题,本研究提出多专家特征融合网络架构,以跨声速抖振气动噪声为算例评估,可降低MLP算法MSE,泛化性更好。

力学与人工智能
新闻资讯7

关于内存价格转跌,我们和贸易商聊了聊

3月30日,服务器内存贸易商称内存价格从前几天开始跌,30日跌得最凶。国内DDR4价格跌幅超30%,DDR3价格腰斩,DDR5较坚挺。谷歌新算法引发市场震动,从业者认为DDR4暴跌还有其他原因。

芯师爷
算法论文8

必须得让AI明白,有些不该碰的东西别碰(doge)

近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在多基准测评中优势明显。

量子位
算法论文8

谷歌的DeepSeek时刻:LLM推理加速被干到了8倍

谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。

PaperAgent
开源动态7

从一行代码发现DeepSeek的秘密:Model1到底是什么?

在DeepSeek - R1发布一周年时,有人在GitHub的FlashMLA代码仓库发现神秘代号Model1,可能是V4。文章分析了代码仓库用途、新模型“露馅”原因,还从代码中发现Model1细节,结合论文梳理时间线,最后也提出了怀疑。

花叔