系统架构能力」共找到 5746 篇相关文章

算法论文8

训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
产品应用8

参数破万亿!阿里Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布总参数超万亿的Qwen3 - Max - Thinking,预训练数据规模达36T Tokens。在多项权威测试中表现优异,能与顶级闭源模型竞争。引入两项核心创新,千问App等已上新,网友认可其能力与更新速度。

AI前线
算法论文8

清华AI数学家系统攻克均匀化理论难题!人机协同完成17页严谨证明

清华大学科研团队用自主研发的AI数学家系统(AIM),以人机交互模式解决均匀化理论研究问题,形成约17页证明。研究系统性总结五大高效人机交互模式,在三方面取得突破,还提出未来研究方向。

量子位
开源动态8

Kimi开源新线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍

月之暗面发布开源Kimi Linear架构,用新注意力机制首次超越全注意力模型。长上下文任务中,它减少75%的KV缓存需求,推理加速达6倍。核心创新Kimi Delta Attention有细粒度遗忘门控等特点。

量子位
算法论文8

检索做大,生成做轻:CMU团队系统评测RAG的语料与模型权衡

CMU团队在最新ECIR接收论文中,系统评估RAG语料规模与生成模型规模替代关系。实验表明,语料扩容可让小模型追上大模型,提升主要来自证据覆盖。研究为RAG系统提供更具性价比提升路径。

机器之心
推荐文章8

她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽

本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。

量子位
新闻资讯7

Kimi总裁张予彤北大实录:我们想要有抽象能力和偏执的人|甲子光年

Kimi总裁张予彤在北大分享,谈AI时代人才标准,偏好有抽象能力和偏执的人。还探讨AI创造新工作、学校课程设计、企业管理等问题,分享Kimi招人标准、组织特点及对行业诸多问题的看法。

甲子光年
推荐文章8

AI 基础知识从 0.5 到 0.6—— Transformer 架构为何能统治AI领域?

文章围绕Transformer架构展开,先介绍其诞生背景,对比CNN、RNN等模型,阐述其在多领域的核心地位。接着剖析工作流程、实现原理,包括QKV机制、多头注意力等。最后列举T5、GPT等常见架构模型,并提及通义千问3与MCP协议。

阿里云开发者
新闻资讯8

股价暴涨32%!GLM-5登顶全球开源第一,25分钟一镜到底搓出完整系统

2026年初,智谱GLM - 5上线,它是全球首个在系统级工程能力上与硅谷巨头正面竞争的开源模型,发布后智谱股价暴涨32%。它能力惊艳,能完成复杂项目,成本可控,还适配国产算力。

新智元
算法论文8

ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准

上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。

OpenMMLab