权重约束」共找到 300 篇相关文章

开源动态8

文心大模型 4.5 系列正式开源,涵盖 10 余款模型

6月30日,百度正式开源文心大模型4.5系列,含10款模型,实现预训练权重和推理代码全开源。可在飞桨星河社区等平台下载,百度实现框架与模型“双层开源”,技术创新多,性能表现优。

AI前线
新闻资讯7

535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

当多数模型公司还在争论是否开放权重时,斯坦福大学的Marin项目启动535B-A23B模型训练,并公开训练过程。该项目旨在探索基础模型能否像开源软件一样被公开研究和建设,引发关注。

InfoQ
算法论文7

大模型也需要睡觉!让AI打个盹,醒来更聪明

卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。

量子位
算法论文8

CVPR 2026 Oral|告别模型合并冲突!南大等提出OrthoReg:极简正交正则化,揭开任务算术的底层机制

南京大学等团队为任务算术建立底层理论框架,提出「任务特征特化」属性,推导出几何约束方法OrthoReg。该方法引入极简正交正则化项,提升模型合并性能,论文被CVPR 2026接收并评为Oral,代码等已开源。

机器之心
算法论文8

ACL 2026|答得更准还写得更短?华为泰勒实验室提出SHAPE,给LLM推理装了个「推理税」

华为泰勒实验室等团队提出 SHAPE,给推理链装「里程碑 + 推理税」机制。它分三步,能统一势能增益度量、阶段难度感知和 token 效率约束。实验显示,它提升准确率、降低 token 消耗,还解决了推理坍缩等问题。

机器之心
算法论文8

一张图生成「能动」的3D资产:VAST+香港大学AniGen把AIGC推向动画、游戏、仿真与具身智能 (SIGGRAPH 2026 TOG)

SIGGRAPH 2026论文AniGen,由VAST和香港大学研究,能从单张图片直接生成带骨架与蒙皮权重的可动画3D资产。它解决了现有方法的不足,在多方面表现出色,对多个领域意义重大。

机器之心
开源动态7

一个CLAUDE.md霸榜GitHub第一!蒸馏自Karpathy,6万码农抄作业

一个名为CLAUDE.md的Markdown配置文件冲爆GitHub,本周新增44,465颗星,总星数61.6k,连续三天Trending日榜第一。它源自Karpathy对LLM编程陷阱的观察,含四条规矩,能约束AI编程Agent。

新智元
新闻资讯8

Anthropic 训出史上最强模型,当场决定不发布

Anthropic推出Claude Mythos Preview模型却不对外开放。该模型在多维度基准测试中领先,还能发现大量网络安全漏洞。系统卡记录其不良行为,Anthropic推出Project Glasswing应对,认为现有对齐方法或难约束下一代系统。

AGI Hunt
新闻资讯7

The Batch: 930 | DeepSeek 放弃 Nvidia 转向华为

中国开源权重模型开发者 DeepSeek 在 DeepSeek-V4 最新更新中未给美国芯片厂商适配机会,却向华为提供预发布版。美国限制出口芯片反促中国发展本土芯片,该决定加深中美 AI 生态分裂。

DeeplearningAI
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?

本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型。

AI大模型应用实践