中科大」共找到 6820 篇相关文章

推荐文章8

硬核拆解模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

本文详细列举 8 个主流语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。

机器之心
算法论文8

ACL 2026 综述:从事后解释到内生解释,模型内生可解释性的前沿进展

语言模型强但解释性成问题,过去多事后解释,现更多研究者转向内生可解释性。ACL 2026 接收的综述论文梳理相关代表方法,总结为五类核心设计范式,指出该方向面临挑战但趋势清晰。

机器之心
产品应用8

腾讯AngelSlim重磅升级!面向全模态的模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
算法论文8

一个省略号提示+强化学习搞定模型“过度思考”,院自动化所新方法:从强制推理到自主选择

学院自动化研究所联合鹏城实验室提出AutoThink方法,用省略号提示和多阶段强化学习,让推理模型依题目难度自主切换思考模式,解决过度思考问题,在多数据集验证有效。

量子位
算法论文8

首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两技术壁垒

新加坡国立学等联合发布EgoTwin,首次实现第一视角视频与人体动作联合生成,攻克视角 - 动作对齐与因果耦合瓶颈。它基于扩散模型,通过三创新设计解决核心难题,实验性能超基线,为多领域应用提供落地基座。

量子位
新闻资讯7

OpenAI o3封王,4比0横扫马斯克Grok 4!全球模型对抗赛完美收官

Kaggle AI国际象棋锦标赛,OpenAI o3以4-0横扫Grok 4夺冠,这场比赛也被视为OpenAI与xAI的“代理人战争”。季军战里,Gemini 2.5 Pro击败o4 - mini获铜牌。赛旨在检验模型多方面能力。

新智元
新闻资讯8

英伟达新“桌面超算”800GB内存,满血DeepSeek R1能装1个半

英伟达在Computex会宣布新办公室落户国台湾省台北市,还推出多款新品。如面向个人的DGX Station有800GB内存,能跑模型;面向企业的RTX PRO Server可加速多种用例。此外,还发布新平台、宣布合作等。

量子位
算法论文8

模型再爆弱点!旧记忆忘不掉,新记忆分不出,准确率暴降 | ICML'25

弗吉尼亚学和纽约学研究人员用「前摄干扰」概念设计测验PI - LLM,测试语言模型(LLM)上下文检索能力。结果显示,随干扰增加,模型准确率对数下降至零,提示工程效果有限,需调整模型架构或训练范式。

新智元
开源动态8

告别模型“失忆”!人开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

国人民学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试超越现有SOTA方案。

深度学习自然语言处理
算法论文8

NeurIPS 2025|CAKE:模型驱动的贝叶斯优化新配方,让黑箱优化更智能、更高效

香港学(深圳)等高校研究人员提出 CAKE 方法,被 NeurIPS 2025 接收。它利用语言模型动态设计高斯过程核函数,构建自适应贝叶斯优化框架,在多领域实验效果优,还具备可解释性。

机器之心