数学研究目标」共找到 2670 篇相关文章

新闻资讯7

孙凝晖院士:集成芯片带来三大科学问题

随着摩尔定律发展放缓,集成芯片与芯粒技术对高性能芯片设计制造愈发重要。孙凝晖院士在2025年度晶上系统生态大会指出,集成芯片是提升性能新路径,但芯粒集成度提升带来三大科学问题。

芯师爷
算法论文8

大模型到底是怎么「思考」的?第一篇系统性综述SAE的文章来了

在大语言模型时代,人们需要“能解释”的LLM。SAE技术崛起,作者团队发布首篇SAE综述,梳理其技术、演化和挑战。介绍了SAE概念、优势,涵盖其技术框架、可解释性分析等多方面内容。

机器之心
算法论文8

ICML 2025 | 千倍长度泛化!蚂蚁新注意力机制GCA实现16M长上下文精准理解

在大语言模型发展中,长文本建模挑战大。蚂蚁研究团队提出注意力机制GCA,可端到端学习检索相关片段,实现超长序列处理与泛化,其Triton kernel实现已开源,论文被ICML 2025接收。

机器之心
算法论文8

比自回归更灵活、比离散扩散更通用,首个纯Discrete Flow Matching多模态巨兽降临

近年来多模态大模型多采用自回归架构,推理缺乏灵活性。香港大学和华为诺亚方舟实验室研究团队提出FUDOKI,基于全新非掩码离散流匹配架构,能并行去噪、动态修正,为多模态模型开辟新路径。

机器之心
新闻资讯7

AI 能耗救星!这个能倒着走的「可逆计算」芯片,将能耗直降10倍

最新研究提出可逆芯片,通过让计算「倒着走」,有望将AI能耗直降10倍。它基于热力学原理,避免删除数据以减少热量产生。经几十年探索,如今可逆计算或成延续计算进步关键。

AGI Hunt
算法论文7

英伟达发现RL Scaling!创造力暴涨,做基座模型做不了的事!

过去学界争论强化学习(RL)对语言模型的作用,此前研究认为其效果有限。本文发现问题出在训练时间短,提出ProRL,让训练突破2000步以上,结果惊人,小模型也能有出色表现。

深度学习自然语言处理
算法论文7

Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking

文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练。

深度学习自然语言处理
算法论文7

一文解读 LLM Posting-Train技术

文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者
开源动态8

华为| 祭出FlashComm1,FlashComm2、FlashComm3,解决LLM推理通算瓶颈

在大模型推理面临通算难题背景下,华为数学家祭出FlashComm 1、2、3。如FlashComm 1优化AllReduce通信,提升推理性能;FlashComm 2重构计算流程,提升推理速度;FlashComm 3实现多流并行,激增模型吞吐。

AINLPer
产品应用7

CAI+DeepSeek渗透测试情况及扩展分析

文章对CAI+DeepSeek进行渗透测试。介绍CAI安装,在kali按Ubuntu指令装,使用界面友好。测试中CAI执行指令彻底灵活,扫描分析到位。还提及CAI多种能力,称其作为开源框架全面细致,值得研究

AI与安全