「推理效率」共找到 3009 篇相关文章
刚刚,Kimi开源新架构,开始押注线性注意力
智能体时代推理计算需求成瓶颈,线性注意力可降复杂度但表达有限。月之暗面开源 Kimi Linear 新架构,结合线性与全注意力,性能和硬件效率出色,引发对线性与全注意力发展方向的思考。
DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?
凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期层节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。
刚刚,GPT-5.4 发布,百万上下文、最强全能模型
OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。
dLLM的「Free Lunch」!浙大&蚂蚁利用中间结果显著提升扩散语言模型
近年来,扩散大语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对后错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。
用“因果规划”解决多智能体协作中的任务依赖难题|港科广&腾讯
港科广和腾讯研究团队提出CausalMACE方法,将因果推理机制引入开放世界多智能体系统。该方法含全局因果任务图,框架分“判断”“规划”“执行”环节,在基准任务中表现出色,已中稿EMNLP 2025 Findings。
告别微调!斯坦福提出Agentic上下文工程
当前微调大语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福大学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为大模型发展指明新方向。
谷歌AI的“心脏”长什么样?读懂TPU就够了
文章介绍了谷歌TPU的发展历程,从2015年为解决AI计算效率瓶颈自研,发展到如今成为谷歌“经济支柱”。还对比了谷歌、英伟达、亚马逊的芯片路线,强调谷歌全栈垂直整合策略使TPU在推理时代优势明显。
DeepSeek 模型技术之旅:从 V3 到 V3.2
本文深入剖析了 DeepSeek 模型从 V3 到 V3.2 的技术演进,对比了基座与推理模型,介绍了架构、训练方法变化,如 V3.2 结合 MLA 与 DSA,更新奖励和 GRPO 算法,还提及 V3.2-Speciale 扩展思考特性。
李飞飞50亿美金赛道被开源!浙大教授章国锋带队创业,打造无限时长实时3D世界模型
2024年李飞飞创立的World Labs入局空间智能赛道,估值达50亿美元。近日影溯发布并开源实时帧生成模型InSpatio - WorldFM,由章国锋领衔,该模型突破2D局限,效率高、能无限时长推理,展现出高工程可用性。
更大,还能更快,更准!蚂蚁开源万亿参数语言模型Ling-1T,刷新多项SOTA
10月9日,蚂蚁开源万亿参数语言模型Ling-1T。它延续自研高效MoE架构,在编程、数学推理等多维度测试表现亮眼,还能兼顾精确与效率。此外,它在多场景实用性强,其创新设计提升了能效比与性能。