模型局限性」共找到 8143 篇相关文章

新闻资讯7

忘掉大模型,微软实证:小模型才是Agentic AI的未来!

过去两年大模型在数学竞赛题上靠Test - Time Scaling发展遇天花板。微软rStar2 - Agent让14B小模型学会‘写代码→跑结果→改思路’,表现出色。还介绍了其基础设施、算法、训练配方等方法。

PaperAgent
开源动态8

国产大模型新SOTA:蚂蚁万亿级旗舰模型赶超GPT-5

蚂蚁集团开源万亿参数旗舰大模型Ling-1T,属Ling 2.0家族。它激活比例低降低运算成本,训练有“Ling缩放定律”等方法,多项测试超主流模型,不过处理超长上下文成本较高。

AIGC开放社区
新闻资讯7

刚刚,OpenAI Astra核心架构爆出:大模型第三条Scaling法则诞生

The Information记者爆料OpenAI即将推出的Astra模型采用“recurrent depth”新推理方法,该技术能降本提效,但引发AI安全与可观测担忧。清华与字节论文解决了循环模型“算力不公平”问题,并给出Scaling Law。

AI寒武纪
算法论文7

微软等提出「模型链」新范式,与Transformer能相当,扩展灵活更好

随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其能相当且扩展、灵活更好。

机器之心
算法论文8

字节Seed新作:模型合并如何改变大模型预训练范式

字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。

机器之心
新闻资讯7

“通用大模型微调成为行业模型是伪命题”?医疗AI深度重构,传神语联创始人何恩培:孪生智能体能砍70%线下复诊工作

本文为《2025 年度盘点与趋势洞察》系列访谈,传神语联创始人何恩培分享医疗 AI 发展看法。他认为通用大模型微调成行业模型是伪命题,介绍了传神素问中医大模型应用,还对比中西医 AI 化差异,探讨未来发展场景与挑战。

InfoQ
算法论文8

CVPR 2025 Highlight | 提升自回归模型样例学习能力,Few-shot图像编辑新范式开源

当前图像编辑模型在处理新概念时泛化能力不足,为解决此难题,Meta等研究者提出自回归模型InstaManip,创新提出分组自注意力机制和关系正则化策略,在few - shot图像编辑任务上取得优异效果。

机器之心
算法论文8

逐个token太慢!大模型原生并行出token,CMU、英伟达新作Multiverse

卡耐基梅隆大学(CMU)和英伟达研究者提出Multiverse,这是能实现原生并行生成的新型生成模型。它解决了现有并行生成模型缺乏连贯等问题,通过多方面协同设计构建推理模型,还开源了生态系统。

机器之心
开源动态8

Mamba 架构实现推理能超 Gemma3-27B!推理模型开始迈入「无注意力」时代

PromptCoT - Mamba是首个具解码显存常量等特且推理能力强的模型。当前推理大模型中注意力机制有局限,PromptCoT - Mamba实现无注意力推理,在多评测集超Transformer等模型,为无注意力推理生态奠基。

AI科技评论
产品应用7

卡帕西大模型横评方法太好玩了!四大AI匿名参赛评分,最强出乎意料

卡帕西发布“大模型议会”web app,系统通过OpenRouter调起多模型开会商议,各模型答题、互评、排序,由主席模型给出统一答案。可对比模型差异,模型自评与人类主观或不同,多模型集成或成突破点。

量子位