大模型记忆」共找到 9398 篇相关文章

开源动态8

QwenLong-L1.5发布:一套配方,三法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
新闻资讯7

Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?

xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距。Grok 4在多基准测试领先,定价便宜。

AGI Hunt
新闻资讯8

英伟达新“桌面超算”800GB内存,满血DeepSeek R1能装1个半

英伟达在Computex会宣布新办公室落户中国台湾省台北市,还推出多款新品。如面向个人的DGX Station有800GB内存,能跑模型;面向企业的RTX PRO Server可加速多种用例。此外,还发布新平台、宣布合作等。

量子位
新闻资讯7

GPT5.5代号“蒜你狠”曝光!OpenAI拉响红色警报加班赶制新模型,最快下周就发

面对谷歌攻势,OpenAI奥特曼拉响“红色警报”,集中资源让ChatGPT赶上Gemini 3 Pro。两款新模型曝光,一款下周发布,代号Garlic的明年初或发。ChatGPT流量降,OpenAI财务压力,Garlic能否助其破局受关注。

量子位
新闻资讯7

中美六顶尖模型第一赛季实盘量化交易结果出炉:Qwen最后反超夺冠,GPT-5垫底「复盘」

Nof1机构发起Alpha Arena项目,让六个顶尖LLM在Hyperliquid交易所实盘量化交易。第一赛季已结束,Qwen夺冠、GPT - 5垫底。复盘比赛过程,发现模型行为差异且操作有脆弱性,第二赛季筹备近尾声。

AI寒武纪
算法论文8

ICML26 | 浙江理工学马啸讲师和南京学李武军教授课题组联合提出EMCES:为强化学习合成更有价值的样本

强化学习获取高质量样本成本高、风险,现有基于扩散模型的样本增强方法有局限。浙江理工学马啸讲师和南京学李武军教授课题组提出 EMCES,将情景记忆机制引入可控扩散模型,提升下游强化学习算法表现,论文已被 ICML2026 录用。

机器之心
产品应用8

Seedance 2.0刷屏后,字节还有个硬核模型——3个复杂任务实测Seed 2.0

作者作为AI编程工具深度用户,没追热门的Seedance 2.0,而是实测同期发布的豆包模型Seed 2.0。设计3个日常复杂任务,在TRAE接入其Pro版测试,展现出强的自主纠错和多任务处理能力,也指出了不足。

花叔
新闻资讯8

全国产算力托底、告别 AI 内卷,科讯飞如何让每个人站在 AI 肩膀上?

本文围绕科讯飞在AI领域的发展展开。董事长刘庆峰表示要让所有人共享AI红利,介绍了公司在多领域的应用成果,还发布全国产算力的讯飞星火X1.5模型,实现多项技术突破,推动AI融入现实生活。

AI前线
新闻资讯7

GPT-5.2破解数论猜想获陶哲轩认证!OpenAI副总裁曝动作:正改模型核心设计,吊打90%研究生但难出颠覆性发现

OpenAI 发布由 GPT - 5.2 加持的科研平台 Prism 并免费开放。副总裁 Kevin Weil 称目前模型难有颠覆性发现,但能加速科研。GPT - 5 能力超 90% 研究生,OpenAI 将优化其设计,让它更谦逊并自我核查。

InfoQ
开源动态7

AI还不会独自问诊,o3准确率仅为51.12%,上交×SII开源高难度复杂疾病诊断测评集

上海交与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。

量子位