小语言模型」共找到 8278 篇相关文章

开源动态8

模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
产品应用8

刚刚,蝉联Future X全球榜首的MiroMind发布全球最强搜索智能体模型

由陈天桥和代季峰联合发起的 MiroMind 团队,于 1 月 5 日发布自研旗舰搜索智能体模型 MiroThinker 1.5。该模型参数规模但性能强,其核心是「发现式智能」理念,还采用了新训练技术,有 A 股涨停板预测等应用。

机器之心
算法论文8

ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测

北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。

机器之心
产品应用7

昇腾910B大模型实测:开源框架能不能打?真相全放这了

文章对昇腾 910B 大模型进行实测,对比 vLLM Ascend 与 MindIE 在实际推理场景中的性能差异。通过 GPUStack 平台测试多种模型,结果显示两者在不同部署场景各有优势,vLLM 适合单卡模型,MindIE 适合大模型多卡部署。

探索AGI
算法论文8

真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
算法论文8

模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制

大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。

深度学习自然语言处理
算法论文8

北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统

现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。

AI科技评论
开源动态7

智谱新模型也用DeepSeek的MLA,苹果M5就能跑

智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。

量子位
算法论文8

NeurIPS 2025 | 北大联合红书提出Uni-Instruct:ImageNet单步生图FID进入1.0时代!

北大联合红书提出的 Uni - Instruct 框架被 NeurIPS 2025 接收,它统一超 10 种单步扩散模型蒸馏方法,在多项任务达最佳性能,还能用于文本到 3D 生成。

机器之心
新闻资讯8

刚刚,阿里发布最强推理模型Qwen3-2507,用疯狂一周暴击美国AI行动计划!

美国发布AI行动计划,欲成“世界AI冠军”,但阿里在7月22 - 25日三连发,推出Qwen3 - 235B非思考版本、Qwen3 - Coder、Qwen3 - 235B - A22B - Thinking - 2507推理模型,冲击美国计划。千问3在多领域表现出色,不过也有使用费用等问题。

AGI Hunt