语言中心推理」共找到 3079 篇相关文章

算法论文8

多模态大模型持续学习系列研究,综述+Benchmark+方法+Codebase一网打尽!

近年来,生成式AI和多模态大模型进展显著,但在动态环境下实现持续学习是挑战。中科院自动化所联合香港院AI中心系统性研究,提出综述、方法、Benchmark和Codebase,为相关人员提供全面支持。

机器之心
新闻资讯7

DiT在数学和形式上是错的?谢赛宁回应:不要在脑子里做科学

X上有博主称DiT存在架构缺陷,其FID过早稳定,可能无法继续从数据中学习。还批判了DiT的设计,如使用后层归一化和adaLN - zero。DiT作者谢赛宁回应,强调做研究要基于实验,也指出DiT现存一些问题。

机器之心
算法论文8

研究者警告:强化学习暗藏「策略悬崖」危机,AI对齐的根本性挑战浮现

强化学习是大模型推理与对齐的核心方法,但常带来模型行为脆弱等问题。上海人工智能实验室徐兴成博士论文揭示‘策略悬崖’挑战,分析其成因,解释多种对齐失败现象,并提出对AI研究的启示。

机器之心
开源动态7

梳理SGLang中DP Attention及其Padding问题

作者梳理SGLang中DP Attention及其Padding问题。介绍DP Attention背景、流程,指出padding分max和sum模式,旧版sum padding浪费计算、影响cuda graph使用,v0.4.10后有优化,max padding仍待完善。

GiantPandaLLM
产品应用8

让64张卡像一张卡!浪潮信息发布新一代AI超节点,支持四大国产开源模型同时运行

浪潮信息发布新一代AI超节点“元脑SD200”,可让64张卡像一张卡。它支持四大国产开源模型同时运行,实现算力聚合突破,通过软硬协同优化提升推理性能,采用开放架构推动“智能平权”。

量子位
推荐文章7

爆肝一周看6小时长视频,解读AI时代程序员价值几何

作者花一周看完Lex Fridman对丹麦传奇程序员DHH的6小时访谈。DHH分享编程经历,谈对流行技术看法,认为AI不能取代人类创造力,还谈及创业、开源等观点,展现深刻认知与独特态度。

MacTalk
开源动态7

突发!Qwen更新模型,全面超越kimi k2,强的离谱,主打Agent

Qwen小更新非推理模型性能强劲,各项指标超kimi k2,与Claude opus 4持平,Agent能力亮眼。Qwen团队告别混合思维模式,新模型上线,独立训练两模型,新版本多方面提升,团队称还有大招。

AI寒武纪
算法论文7

大模型自信心崩塌!谷歌DeepMind证实:反对意见让GPT-4o轻易放弃正确答案

谷歌DeepMind携手伦敦大学研究发现,GPT - 4o、Gemma 3等大语言模型有“固执己见”和“被质疑就动摇”并存的冲突行为,原因与训练、决策逻辑、记忆机制有关。研究还通过两轮实验证实。

量子位
算法论文8

下一代AI需要「思想微积分」!华人团队重磅揭秘,AI方法论三连发

来自美国两所大学的华人团队发布「AI方法论三部曲」,提出「能力实现率(CRR)」模型、「认知几何学」框架,指出处于AI的「元语言时刻」,未来迈向「思想微积分」时代,从多维度构建理解AI的世界观。

新智元
算法论文7

原来Scaling Law还能被优化?Meta这招省token又提效

2017年《Attention Is All You Need》提出的Transformer是主流语言模型基础范式。Meta新论文提出旋转不变型三线性注意力机制,证明其表现能改变Scaling Law系数,还证实2 - simplicial Transformer在有限token预算下更优。

机器之心