「大模型自信问题」共找到 9425 篇相关文章
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
在ICLR 2026主会之前,我们和30多位入选者聊了聊最前沿的AI细节
4月14日,智源社区、DeepTech联合举办ICLR 2026预讲会。会议聚焦顶会核心精华,三十余位论文作者分享AI Agent、大语言模型等热门领域成果,展示解决大模型痛点的研究。
数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真
数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。
18个月,中国Token消化狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本
中国大模型API服务碎片化、“黑盒”问题严重,成本高。清程极智1月29日发布AI Ping,类似“中国版OpenRouter + Artificial Analysis”,可评测、路由大模型,帮开发者降低成本、提升效率,还能重塑服务市场秩序。
从实践到原则:为 AI Agent 构建的 Harness Engineering 落地与探索
生成式 AI 进入软件开发核心流程,但 AI 写代码速度超团队控复杂度能力。问题不在模型,而在软件工程系统。Harness Engineering 试图解决此问题,从三层面重新设计工程系统,已有公司实践。
做过十遍还要从头摸索?Agent 的记忆终于开始长成技能
MemTensor 等机构提出无需训练基础模型的 MSCE 框架,为 Agent 外部经验建‘晋升制度’,让经验成技能。该论文在 EvoAgentBench 与 LoCoMo 测试中结果更好,但在因果证明、模型依赖等方面有不足。
AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板
耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。
上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026
上交大与 vivo 团队提出 C²FG 方法,针对当前 diffusion 模型缺稳定可控生成机制问题,通过 score 差异实现动态引导控制。实验显示,该方法能提升多维度指标,改进生成分布,揭示生成机制新方向。
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒
大模型参数规模大,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。