推理性能」共找到 3456 篇相关文章

新闻资讯8

工业异常检测新突破,复旦等多模态融合监测入选CVPR 2025

复旦大学等机构联合发布高精度多模态数据集Real - IAD D³,提出多模态融合检测方法D³M,成果被CVPR 2025收录。该数据集含多类数据,提升检测性能,此前相关工作也被CVPR 2024收录。

量子位
算法论文8

大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制

大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。

深度学习自然语言处理
开源动态8

开启端侧长文本时代!面壁全新架构,让小钢炮最快提升220倍

2025智源大会上,面壁智能发布MiniCPM 4.0模型,实现行业首个系统级上下文稀疏语言模型创新。它在端侧推理任务上表现出色,降低缓存需求,提高运行效能,还进行多维度架构创新,是AI领域探索高效率语言模型的里程碑。

机器之心
产品应用8

刚刚,Claude 5.1 发布!全球最强模型来了

Anthropic推出Claude Fable 5.1和Claude Mythos 5.1。Fable 5.1面向普通用户等,Mythos 5.1面向高风险领域伙伴。Fable 5.1性能优、价格低,在多测试中表现提升,还能用于科研,且安全防护机制升级。

机器之心
产品应用7

DeepSeek识图模式全量上线,却认不出自家老板梁文锋

端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别人物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。

机器之心
开源动态7

小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek

小米开源 MiMo-V2.5 和 MiMo-V2.5-Pro 两款模型,采用 MIT 协议,适合商业应用。在基准测试中表现出色,有竞争力价格和限时优惠。但与 DeepSeek 比,架构创新偏工程化,也有推理表现不足等问题。

AI前线
算法论文8

腾讯混元团队最新研究:让 AI 从「固定模型」走向「实时适配系统」

腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实时动态生成适合任务的参数,而非依赖固定参数。通过多类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。

AI科技评论
产品应用7

英伟达DLSS 4.5来了:Transformer再进化消除鬼影,“拼好帧”最高提至6倍还能动态调节

CES 2026英伟达在中国媒体见面会介绍了DLSS 4.5,它采用“双核心”策略,画质核心用第二代Transformer模型解决鬼影和闪烁,性能核心支持6倍插帧并能动态调节,还推出G - SYNC Pulsar降低动态模糊。

量子位
产品应用7

半年研发、1周上线,1秒200行代码爆发?美团研发负责人:靠小团队奇袭,模型和工程能力突破是核心

6月10日美团推出首款AI Coding Agent产品NoCode。美团基础研发平台工程效率负责人程大同在访谈中解答诸多问题,如模型性能优化、产品竞争力、用户使用难点等,还提及产品未来规划和对行业发展的看法。

AI前线
算法论文7

OpenAI久违发了篇「正经」论文:线性布局实现高效张量计算

OpenAI 近日发布研究论文,提出用于高效张量映射的统一代数框架 Linear Layouts,解决了 Triton 等深度学习编译器中长期存在的难题。该框架是使用二元线性代数的张量布局通用代数形式,评估显示其优化版 Triton 性能有提升。

机器之心