「扩展计算」共找到 1086 篇相关文章
原来Scaling Law还能被优化?Meta这招省token又提效
2017年《Attention Is All You Need》提出的Transformer是主流语言模型基础范式。Meta新论文提出旋转不变型三线性注意力机制,证明其表现能改变Scaling Law系数,还证实2 - simplicial Transformer在有限token预算下更优。
重磅发现!大模型的「aha moment」不是装腔作势,内部信息量暴增数倍!
中国人民大学等联合团队研究发现,大模型推理有“信息脉冲”,特定步骤互信息值飙升形成“互信息峰值”,对应“思考词汇”。基于此提出无需额外训练提升推理性能的方法,代码已开源。
Python语言从2.7到3.14的能力变化与演进逻辑
文章从编程风格、类库生态、性能优化等多维度,阐述Python从2.7到3.14版本的能力变化与演进逻辑。如编程风格现现代化转型,类库生态战略性调整,性能优化有突破性进展等,还分析了演进背后的推动力及未来趋势。
打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力
如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。
更多thinking≠更好结果,精准thinking可砍掉一半长度
当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。
具身智能的终极命题:是造「人」还是造「生产力」?
华为开发者大会 2025 发布 CloudRobo 具身智能平台,为具身智能带来新视角。工业和商业场景实践显示,具身智能终极目标是锻造普适的「生产力引擎」,产业竞赛关键在于打造「群体智能协同」。
一文读懂深度表格数据表示学习 | 南京大学
南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。
传言:中国AI 公司人肉运硬盘到马来西亚训练模型,美国芯片禁令形同虚设?
《华尔街日报》传言中国AI公司工程师人肉运硬盘到马来西亚训练模型。美国芯片禁令下,中国公司难进口先进硬件,采用复杂方式规避。任正非和黄仁勋都认为可集群补单芯片性能,美国制裁效果堪忧。
扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反
北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。
一次又一次的「开发者要被取代了」的炒作潮,最终却催生了全新的薪资更高的技术岗位
每隔几年就有新技术称能取代程序员,如无代码、云计算等,但实际是催生新岗位且薪资更高。如今AI辅助开发也如此,软件业最宝贵的是架构设计能力,这是AI难以取代的。