大模型发布」共找到 10153 篇相关文章

新闻资讯7

忘掉模型,微软实证:小模型才是Agentic AI的未来!

过去两年模型在数学竞赛题上靠Test - Time Scaling发展遇天花板。微软rStar2 - Agent让14B小模型学会‘写代码→跑结果→改思路’,表现出色。还介绍了其基础设施、算法、训练配方等方法。

PaperAgent
开源动态8

国产模型新SOTA:蚂蚁万亿级旗舰模型赶超GPT-5

蚂蚁集团开源万亿参数旗舰模型Ling-1T,属Ling 2.0家族。它激活比例低降低运算成本,训练有“Ling缩放定律”等方法,多项测试超主流模型,不过处理超长上下文成本较高。

AIGC开放社区
新闻资讯7

Ilya新模型要来了?投资人爆料:今年最重要的发布

a16z合伙人Martin Casado预告今年最重要的模型发布,线索指向Ilya Sutskever的新模型。SSI成立两年低调发展,获巨额融资,7月与英伟达合作。持续学习是焦点,但相关能力信息有限。

机器之心
算法论文8

因果发现模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116

、清华与稳准智能联合发布因果发现模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练。

AI科技评论
推荐文章7

智源技术分享:模型行业应用新模式和关键实现路径

在 AICon 会上,智源研究院周华分享模型行业应用。分析落地问题,提出以模型为核心的技术路径,涵盖数据、训练等环节,还给出数据生产流程建议,分享最新开源成果。

InfoQ
算法论文8

75页哈工多模态推理模型最新综述:感知、推理、思考与规划

哈工提出75页多模态推理模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。

PaperAgent
算法论文8

模型装上「思维分段引擎」:浙InftyThink解锁无限深度推理

如今模型长上下文推理面临计算成本高、推理易中断问题。浙联合北团队提出InftyThink新范式,将传统推理拆成短片段并总结,突破推理长度限制,在多基座模型实验中表现优异。

量子位
算法论文7

SOTA模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究

当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA模型,结果显示模型表现不佳,还分析了模型“犯难”原因。

量子位
算法论文7

少说‘Wait’,多做题:NoWait重塑模型推理路径

现代模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在多任务中表现出色,且颠覆对推理的认知。

深度学习自然语言处理
新闻资讯7

马斯克都惊呼太强!阿里Qwen3.5又一波端侧小模型发布

上周阿里发布Qwen3.5中等规模超强模型,现又推出端侧小模型,获马斯克称赞。其智能密度翻倍且原生多模态,各型号有Base版。不同参数模型性能出色,阿里布局完整生态链,开启智能化未来。

AIGC开放社区