哥大团队」共找到 7284 篇相关文章

推荐文章8

硬核拆解模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

本文详细列举 8 个主流语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。

机器之心
新闻资讯8

谷歌全线开挂!Gemini 3 Deep Think夺多项推理SOTA,Gemini亚洲新团队也官宣了

谷歌的Gemini 3 Deep Think模式正式上线,推理能力显著加强,在ARC - AGI、HLE等多项权威测评中夺魁,仅向Google AI Ultra订阅用户开放。同时,谷歌DeepMind将在新加坡成立新的Gemini研究团队,由95后华人科学家Yi Tay带队。此外,谷歌还推出了Google Workspace Studio。

AI前线
算法论文8

ACL 2026 综述:从事后解释到内生解释,模型内生可解释性的前沿进展

语言模型强但解释性成问题,过去多事后解释,现更多研究者转向内生可解释性。ACL 2026 接收的综述论文梳理相关代表方法,总结为五类核心设计范式,指出该方向面临挑战但趋势清晰。

机器之心
产品应用8

腾讯AngelSlim重磅升级!面向全模态的模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
产品应用7

10人团队千万融资,这个原生AI产品要做“人人可用的数据Agent”丨对话ChatExcel

ChatExcel是国内首款原生AI DataAgent,专注自然语言对话处理分析数据。其不到10人团队获近千万融资,定位平民化数据产品,核心是多模型结合,已近百万用户,正拓展海外市场。

量子位
算法论文8

一个省略号提示+强化学习搞定模型“过度思考”,中科院自动化所新方法:从强制推理到自主选择

中国科学院自动化研究所联合鹏城实验室提出AutoThink方法,用省略号提示和多阶段强化学习,让推理模型依题目难度自主切换思考模式,解决过度思考问题,在多数据集验证有效。

量子位
算法论文8

NeurIPS 2025|CAKE:模型驱动的贝叶斯优化新配方,让黑箱优化更智能、更高效

香港中文学(深圳)等高校研究人员提出 CAKE 方法,被 NeurIPS 2025 接收。它利用语言模型动态设计高斯过程核函数,构建自适应贝叶斯优化框架,在多领域实验中效果优,还具备可解释性。

机器之心
新闻资讯8

全国产算力托底、告别 AI 内卷,科讯飞如何让每个人站在 AI 肩膀上?

本文围绕科讯飞在AI领域的发展展开。董事长刘庆峰表示要让所有人共享AI红利,介绍了公司在多领域的应用成果,还发布全国产算力的讯飞星火X1.5模型,实现多项技术突破,推动AI融入现实生活。

AI前线
新闻资讯8

英伟达新“桌面超算”800GB内存,满血DeepSeek R1能装1个半

英伟达在Computex会宣布新办公室落户中国台湾省台北市,还推出多款新品。如面向个人的DGX Station有800GB内存,能跑模型;面向企业的RTX PRO Server可加速多种用例。此外,还发布新平台、宣布合作等。

量子位
开源动态8

告别模型“失忆”!人开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

中国人民团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。

深度学习自然语言处理