参数压缩 - 覆盖假说」共找到 1208 篇相关文章

开源动态8

史上最大高质量科学推理后训练数据集开源,快速让Qwen3等变“科学家”

上海创智学院、上海交通大学发布开源科学推理后训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。

量子位
新闻资讯7

在WAIC,比起看机器人打拳,人们更想知道怎么用AI赚钱

7月27日普通观众参观日,WAIC现场火爆。本届大会规模为历届之最,机器人与模型厂商纷纷展示落地应用。机器人从“能动”走向“会干”,模型厂商聚焦场景,投融资锚点转向商业指标。

芯师爷
算法论文8

MSSP | 西北工业大学马启悦,高传强等:融合激波位置的跨声速抖振气动载荷辨识

本文提出融合激波位置的跨声速抖振气动载荷辨识方法,从时序流场提取激波特征,用稀疏辨识构建参数化代数方程,增强预测精度与泛化能力,为准确预测跨声速气动载荷提供新思路。

力学与人工智能
8

Transformer终结者!谷歌DeepMind全新MoR架构问世,新一代魔王来了

KAIST、谷歌DeepMind等机构发布的MoR架构,推理速度翻倍、内存减半,重塑LLM性能边界,碾压传统Transformer。它融合参数共享与按需计算,有路由和KV缓存策略,实验显示其性能优越、可扩展性好。

新智元
新闻资讯7

等了十年,特斯拉Robotaxi终于上线!马斯克:仅需4.2美元一口价

上周日,特斯拉在德克萨斯州奥斯汀启动Robotaxi服务,首批乘客4.2美元一口价。服务限定试运营,覆盖区域受限,车内有安全监控员。目前体验平稳但不成熟,未来能否后发先至待验证。

机器之心
算法论文7

ICML'25 | 告别手动SFT!一句话得到你的专属大模型LoRA

传统微调方法开销大、部署难,Text-to-LoRA (T2L) 框架应运而生。它基于自然语言指令对 Transformer 模型即时适配,有三种架构变体,采用两种训练方法,实验显示其在多维度表现有效。

PaperAgent
算法论文8

MIT工科生跨界AI,独作论文登Nature:只需3.5小时修复600年前名画

MIT理工男Alex Kachkine跨界艺术,独作论文登Nature。他设计的AI算法将名画修复时间从数月/数年压缩至几小时,提出“以数字方式修复一幅画,并在物理上实现效果”的新方法。

量子位
算法论文8

揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路

上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。

量子位
开源动态8

刷新世界记录!40B模型+20万亿token,散户组团挑战算力霸权

Nous Research推出Psyche网络,用区块链汇聚全球计算资源,启动40B参数大语言模型Consilience预训练,达20万亿token创纪录。还解决带宽瓶颈等问题,让AI训练去中心化,推动创新与民主化。

新智元
算法论文8

全新GPU高速互联设计,为大模型训练降本增效!北大/阶跃/曦智提出新一代高带宽域架构

随着大模型参数规模扩大,分布式训练成关键路径,高带宽域设计对提升训练效率至关重要。现有HBD架构在可扩展性、成本和容错能力等方面有局限,北大、阶跃、曦智团队提出InfiniteHBD架构解决问题。

量子位