低秩表示」共找到 1277 篇相关文章

产品应用8

医疗幻觉率比DeepSeek3倍,百川循证增强大模型横扫全球医学考试!

百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率,多国医考成绩优异,已上线百小应APP并开放API。

新智元
算法论文7

中移动九天团队MultiPL-MoE:全新Hybrid-MoE架构用于增强通用大模型资源代码能力

大语言模型在有限计算资源下提升多语言代码能力面临挑战。中国移动九天团队提出 Hybrid MoE 架构 MultiPL - MoE,耦合两层专家选择机制优化,实验证明其在增强资源代码能力、缓解高资源语言遗忘上有效。

机器之心
开源动态7

刚刚,马斯克开源基于 Grok 的 X 推荐算法!专家:ROI 过,其它平台不一定跟

马斯克时隔近三年再次开源X推荐算法,该算法基于Grok,采用端到端学习预测用户兴趣。不过有争议认为这或是因现实压力。专家称其ROI,其他平台不一定跟进,且此次开源对学术研究价值不大。

AI前线
算法论文8

0.01%参数就能接近全量微调!数据微调极致省参方案来了 | ACL'26

瑞典隆德大学与Google DeepMind团队研究大模型微调省参方案。发现数据场景下,微调Value投影中的b(v)比b(q)或b(k)性能更好。该研究已被ACL 2026接收,集成进Hugging Face - PEFT库。

量子位
新闻资讯8

马斯克Grok 4.6重回一梯队!更价格反超Fable 5,这Cursor是真没白收购

马斯克携Grok 4.6让SpaceXAI重回大模型牌桌。它跑分超GPT - 5.6 Sol和Fable 5 Max,价格更。此次升级聚焦长程agent任务,还发布了Grok Bot智能体,后续Grok 4.7也将登场。

量子位
算法论文8

北大 & 作业帮团队提出 Text-to-SQL 新框架 Interactive-T2S,攻克宽表处理与资源对齐难题

北大与作业帮联合研发的论文提出 Interactive-T2S 框架,将 LLM 塑造成智能代理,通过多轮交互解决传统 Text-to-SQL 方法在宽表处理、资源对齐等方面的难题,已入选国际顶会 CIKM2025。

AI前线
产品应用7

突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更,网友好评:响应快、不废话

当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1。此系列含三款模型,性能比肩Claude 3.5且成本更。开发者试用评价不错,但也指出存在幻觉问题。Windsurf旨在提升软件开发速度,后续将持续投入。

InfoQ
开源动态8

延迟的端到端语音模型!首次生成音频仅需53ms,比同级别模型快3-5倍!

随着语音应用场景普及,语音大模型响应慢成瓶颈。VITA团队开源端到端语音模型VITA - Audio,7B参数模型首次生成音频仅53毫秒,比同级别快3 - 5倍,完全开源,有超延迟等优势。

开源星探
算法论文8

大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制

大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层权重更新,解释了ICL原理,为构建AI系统开辟新路径。

深度学习自然语言处理
算法论文8

VLM 实现 10%的精度提高,13.1倍加速!纽约大学新算法让视觉语言模型更小、更快、更准确

纽约大学研究团队用QSVD新方法让视觉语言模型(VLM)效率飞跃,在普通GPU上实现13.1倍加速。它将Q、K、V矩阵捆绑处理,设计分配策略,引入量化方案,经多模型评估,展现出硬件成本、高精度优势。

AIGC开放社区