模型能力连续体」共找到 8962 篇相关文章

新闻资讯8

「全球大模型第一股」来了!智谱港交所敲钟,市值达528亿港元

2026年1月8日,智谱登陆港交所,成全球首家以AGI基座模型为核心业务的上市公司,市值528.28亿港元。它以‘全球大模型第一股’吸引资本,研发强、MaaS模式优,标志中国AGI企业走向资本市场。

新智元
算法论文8

从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理

复旦大学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让大模型高效沉默推理。

AIGC开放社区
算法论文8

ICLR 2026 | 别再让大模型“想太多”了!最新研究揭示 LLM 推理效率的关键瓶颈

大语言模型推理计算成本失控,存在过度与思考不足问题。研究揭示推理失衡是根源,提出BAM模型及Plan - and - Budget框架,实验显示其能提升准确率与效率,转向‘推理价值’范式。

机器之心
新闻资讯7

逆天改命!OpenAI 开源模型的安全底裤被 Meta 研究员给扒掉了……

Cornell大学兼Meta研究员jack morris成功将OpenAI最新开源的推理专用模型GPT-OSS逆向还原成基础模型,绕过对齐和安全措施,还暴露其训练用大量版权材料问题,此成果引发社区激烈讨论。

AGI Hunt
算法论文7

token危机解决?扩散模型数据潜力3倍于自回归,重训480次性能仍攀升

新加坡国立大学AI研究者Jinjie Ni团队预训练扩散语言模型(DLMs)与自回归(AR)模型,发现DLMs是超强数据学习者,数据潜力超AR 3倍,重训480次性能仍攀升,还剖析同期研究方法论缺陷。

机器之心
算法论文8

KDD 2025 | UoMo来了,首个无线网络流量预测模型,一个框架搞定三类任务

在 ACM KDD 2025 大会上,清华与中国移动联合发布 UoMo,全球首个面向移动网络的通用流量预测模型。它结合扩散模型与 Transformer,能理解地理与人流变化,一个框架搞定三类流量预测任务。

机器之心
新闻资讯7

讲习班日程公布|第四届全国大模型智能生成大会(LMG 2025)

第四届全国大模型智能生成大会(LMG 2025)11月1 - 3日在成都召开,预计超千人参会。11月3日的讲习班邀请四位青年专家,围绕AI基础设施、扩散语言模型等前沿议题,分享技术进展与实战经验。

深度学习自然语言处理
新闻资讯7

世界模型的GPT时刻:距离物理AGI出圈,还有多远?

InfoQ《极客有约》X AICon 直播栏目探讨物理 AI 下一个战场。嘉宾认为世界模型未出圈,生成加重建是折中探索。还讨论了其定义、升温原因、数据结构、技术范式、评测标准等,也提及挑战与未来格局。

AI前线
开源动态8

性能比肩DeepSeek-R1,MiniMax仅花380万训出推理大模型性价比新王|开源

MiniMax开源推理大模型MiniMax - M1,原生支持100万token输入、8万输出,性能比肩DeepSeek - R1,仅花380万训成。采用Lightning Attention机制与CISPO算法,在多领域表现出色,模型权重可在HuggingFace下载。

量子位
开源动态8

社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式

模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。

Hugging Face