推理性能优化」共找到 4163 篇相关文章

算法论文8

东方理工团队提出HiDrop:重构MLLM计算路径,压缩90%视觉Token实现2.2倍加速

东方理工大学沈晓宇团队提出HiDrop,基于MLLM不同层功能差异,设计出延迟注入、凹金字塔式剪枝和提前退出的视觉Token压缩策略。实验显示,它能压缩约90%视觉Token,保持98.3%性能,实现训练和预填充加速。

机器之心
开源动态8

欧洲版DeepSeek发布Mistral 3系列模型,多模态端云生态,无差别商用交付给全球开发者

欧洲最强AI公司Mistral AI发布全系开源模型Mistral 3,从675B到3B参数打通智能链路,采用先进架构,与业界合作优化,以Apache 2.0协议交付全球开发者,推动开源智能发展。

AIGC开放社区
开源动态8

刚刚,字节开源Seed-OSS-36B模型,512k上下文

深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。

机器之心
算法论文8

GraphRAG,这次被G-Reasoner统一了

大语言模型在知识密集型任务中存在局限,GraphRAG 也有迁移难题。G - Reasoner 提出统一框架,含 QuadGraph、GFM、LLM 增强推理模块,在性能、泛化、效率上全面领先现有方法。

PaperAgent
算法论文8

OmniInsert:全新无掩码视频插入技术

基于扩散模型的视频插入技术发展快,但以往方法有局限。字节提出InsertPipe和OmniInsert,解决数据不足等难题。OmniInsert设计巧妙,还建立评测平台InsertBench,虽有小问题,但推理快,可加速优化

带你学AI
产品应用7

从被吐槽“套壳中国大模型”到自研封神!首次揭秘Cursor背后极速代码Agent如何对标GPT5.1 Codex,生成效率提4倍

10月29日,Cursor 2.0发布Composer大模型,效率约为其他模型四倍。开发者分享其成极速代码Agent方法,如强化学习、平衡训练与推理负载等,还提及未来方向及研发反思。

InfoQ
开源动态8

Day0迁移、一键部署,华为开源的昇思MindSpore成为大模型开发的“万能钥匙”

在大模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流大模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。

量子位
算法论文7

Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文

谷歌论文提出 Memory Caching 技术,通过架构机制创新赋予 RNN「可生长的记忆容量」,兼顾 Transformer 与 RNN 优势,能处理更长文本、降低推理资源门槛,实验显示有良好效果。

机器之心
开源动态8

首个开源多模态Deep Research智能体,超越多个闭源方案

首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。

量子位
算法论文8

对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

中科大团队在 ICLR 2026 论文中指出 KV Cache 压缩领域底层假设存在缺陷,主流方法基于的稳定性假设在真实场景中脆弱。团队提出防御性聚合策略,仅两行代码修改,显著提升 KV Cache 压缩性能

机器之心