流场时空智能推理」共找到 5177 篇相关文章

算法论文8

大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线
算法论文8

ICML 2025 Spotlight|华为诺亚提出端侧大模型新架构MoLE,内存搬运代价降低1000倍

华为诺亚和北大研究人员提出端侧大模型新架构MoLE。它解决传统MoE显存开销大、传输延迟高问题,推理时将专家输入改embedding token,用查找表替代矩阵运算,实验显示性能与MoE相当,大幅降推理延迟。

机器之心
产品应用8

跨本体、长任务、可预测……Motubrain双榜登顶只是一个开始

本文围绕具身机器人展开,指出当前大多具身机器人干活存在局限。Motubrain 双榜登顶,确立通用机器人大脑干活能力参照系,它具备一脑多能、一脑贯通等能力,生数科技已开启产品落地布局。

AI科技评论
开源动态7

类R1训练不再只看结果对错!港中文推出SophiaVL-R1模型

DeepSeek - R1爆火后,类R1结果奖励训练范式引发推理热潮,但仅以结果对错奖励模型有弊端。港中文联合团队发布多模态推理模型SophiaVL - R1,引入‘思考奖励’机制,还用Trust - GRPO算法解决奖励欺骗问题。

机器之心
产品应用7

SQL玩转多模态AI,轻松搞定图片+文本混合搜索

在AI驱动智能商业时代,传统搜索系统难满足需求,AI检索系统又面临数据搬运和工具链割裂难题。本文提出用原生SQL实现多模态智能检索,基于PolarDB融合AI引擎,通过SQL调用服务,无需迁移数据与搭建独立服务。

阿里云开发者
算法论文8

阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%

阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练。

量子位
算法论文8

量化噪声竟是RL秘钥?QeRL:高效强化学习新范式,一场噪声引发的性能革命

近年来,大语言模型在复杂推理任务中面临挑战,强化学习虽更接近人类推理过程,但训练“烧资源”。论文《QeRL》提出量化不仅能压缩模型、节省资源,还能增强模型探索能力,QeRL框架实现训练速度提升、内存占用减半。

深度学习自然语言处理
新闻资讯8

YC AI 创业营第一天,Andrej Karpathy 的演讲刷屏了

Andrej Karpathy在YC AI创业营演讲引发关注,提出软件3.0时代来临,大量软件将被重写。还探讨了LLMs特性、半自主工具优势等。此外,文中整理了Sam Altman、李飞飞等嘉宾的精彩观点。

Founder Park
推荐文章8

卡帕西点赞Transformer内置计算机!每秒3万Token吞吐,拿下世界最难数独

当前大模型推理顶尖但精确计算不足,Percepta团队在Transformer权重里内嵌可执行程序,通过2维注意力头设计提升推理效率,能在普通CPU上实现每秒3万+Token的流式输出,还精确求解了世界最难数独。

量子位
新闻资讯8

刚刚,英伟达祭出下一代GPU!狂飙百万token巨兽,投1亿爆赚50亿

昨天,英伟达发布专为海量上下文AI打造的CUDA GPU——Rubin CPX,将大模型推理带入「百万Token时代」。它性能强大,能带来高回报,可重写推理经济,还将得到英伟达全栈AI生态支持,预计2026年底可用。

新智元