大模型压缩」共找到 9221 篇相关文章

算法论文7

真钱买假模型?187篇论文被「套壳API」坑惨,准确率暴跌

CISPA论文指出,第三方影子API可能用廉价替代品替换前沿模型。研究追踪17个服务,发现已被187篇论文引用。测试显示,影子API在多领域性能差,安全不可控,供应商有三种欺骗手段。

机器之心
推荐文章7

多智能体自主规划模式性能提升:五精准策略详解

本文基于多智能体React模式实践,剖析自主规划架构挑战,如工具调用延迟等。提出五优化策略,像用流式XML替代FunctionCall、合理压缩上下文等,还介绍创意加速器AI绘画创作功能,为多智能体规划模式提供借鉴。

阿里云开发者
新闻资讯7

“机器人一次性卖完太亏!”真机智能刘智勇:今年中国本体厂商将淘汰,拼的是世界模型

InfoQ采访真机智能刘智勇,探讨具身智能领域进展、技术瓶颈及商业方向。刘智勇指出,VLN技术有进展但导航成功率待提升,世界模型可提升机器人能力,2026年本体厂商将收缩,盈利是核心。

InfoQ
算法论文8

Attention Sink产生的起点?清华&美团首次揭秘MoE LLM中的超级专家机制

清华和美团研究聚焦MoE LLM,首次发现超级专家子集。通过多模型实证分析,揭示其分布规律、重要性及对注意力机制的影响,开发识别工具,为模型压缩提供新方向。

机器之心
新闻资讯8

沈向洋解读AI演进五维度!IDEA研究院发布“万物可抓取”模型,GPU渲染器打破国外垄断

沈向洋分享梳理智能演进的五个维度,包括算法范式、智能载体等,指出机会不仅来自技术本身。此外,IDEA研究院还发布“万物可抓取”DINO - X Grasp模型、MoonBit编程语言、GPU渲染器Smart等创新成果。

量子位
开源动态8

刚刚,面壁小钢炮开源进阶版「Her」,9B模型居然有了「活人感」

2月4日,面壁开源全双工全模态模型MiniCPM - o 4.5,在多方面达SOTA水平。它能边看边听边说,实现自主交互。实测中表现如真人,其架构和机制有创新,还适合端侧部署,或开启人机交互新时代。

机器之心
算法论文8

全新GPU高速互联设计,为模型训练降本增效!北/阶跃/曦智提出新一代高带宽域架构

随着模型参数规模扩,分布式训练成关键路径,高带宽域设计对提升训练效率至关重要。现有HBD架构在可扩展性、成本和容错能力等方面有局限,北、阶跃、曦智团队提出InfiniteHBD架构解决问题。

量子位
新闻资讯7

Mistral的首个强推理模型:拥抱开源,推理速度快10倍

本周二,欧洲人工智能公司 Mistral AI 发布全新语言模型 Magistral 系列,有企业版 Magistral Medium 和 24B 参数开源版 Magistral Small。它推理强、多语言表现好,速度比竞品快 10 倍,应用于主流云平台,成本有竞争力。

机器之心
8

“10周的工作量,AI只用4天!”Anthropic发布会全程实录:你引以为傲的复杂工程,在模型眼里只是个玩具

Anthropic举办‘Code w/ Claude’开发者会,指出AI模型能力呈‘指数级’增长,多数企业开发模式却停留在‘线性’阶段。会祭出三杀手锏,包括更强底层模型、Claude Platform代理编排能力和Claude Code桌面端。

AI科技大本营
产品应用8

告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒

模型参数规模,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。

新智元