大模型轻量化」共找到 9167 篇相关文章

算法论文8

面对无解问题模型竟会崩溃?港中文&华为联合提出首个模型推理可靠性评估基准

港中文和华为诺亚实验室联合提出ReliableMath基准,探究模型推理可靠性。提出评估准则,构建含可解与不可解问题的ReliableMath数据集,实验揭示模型缺陷,还提出提高可靠性的对齐策略。

机器之心
算法论文8

TRM思考奖励模型上线,模型推理质量终于能量化了 | ICML‘26 Oral

模型推理评测多只看答案,忽略推理过程。上海多校团队提出TRM,用ME² principle刻画推理质量,DAG-based pairwise evaluation还原结构,训练奖励模型,让推理质量可度量、训练和优化。

量子位
开源动态8

提出首个复数模型,2比特量化,推理仅加法,可手机部署!

团队提出iFairy方案,将模型权重量化到复数集合,用2比特表示,压缩至原本1/8。推理仅需加减或交换数据位置,成本更低。Transformer架构“复数化”,iFairy模型PPL降10%,性能反超全精度,相关成果已开源。

量子位
开源动态8

解码加速15倍!EdgeRazor助推模型在PC/移动端“狂飙”

语言模型参数膨胀,端侧部署难,量化成主流轻量化方案。开源工具库EdgeRazor由南京学和微软联合推出,采用MPQAD打破极低比特语言模型“能力塌陷”,在性能、效率、易用性等方面表现出色,打通AI全生态链路。

机器之心
推荐文章7

模型的第一性原理:(二)信号处理篇

本文从信号处理角度解读模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。

机器之心
开源动态7

一文彻底搞懂 MCP:AI 模型的标准化工具箱

MCP(模型上下文协议)是 Anthropic 于 2024 年 11 月开源的新技术,是 AI 模型的标准化工具箱。它能让模型与外界互动、获取信息、完成任务,整合 Function Call 标准,几乎所有模型都可接入。

机器学习AI算法工程
算法论文8

挑战 1 比特!ETH Zürich 秦浩桐:如何把模型「塞进」小设备?| IJCAI 2026

IJCAI 2026会上,秦浩桐给出创新解法,挑战无需重训的“后训练量化”极限,将庞的LLM强行压缩至极端的1比特与2比特。其团队的BiLLM与SqueezeLLM打破了后训练量化魔咒,还指出极低比特量化的三挑战。

AI科技评论
推荐文章8

模型推理加速全链路:内存管理、编译优化、量化与并行策略

本文整理自金煜阳博士在QCon会分享。介绍模型推理挑战,如规模增、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。

InfoQ
算法论文8

模型也需要自我反思,上海AI Lab合成“错题本”让模型数学成绩提升13.3%

上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。

量子位
算法论文8

模型时代,通用视觉模型将何去何从?

过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型一统’。但语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。

机器之心