新能安」共找到 7735 篇相关文章

算法论文8

正交化之外是什么?微软等提出ARO优化器:训练提速1/3,揭示矩阵优化「蓝海」

微软研究院联合多校发布论文,提出优化器 ARO。它将梯度旋转作为原则,让大模型训练提速约 1/3,比 Muon 高效 10% - 15%,还全模型优化,揭示了矩阵优化方向。

机器之心
算法论文8

吴恩达作:87%推理token用不着,丢掉反而快3倍

吴恩达作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练将推理轨迹扩展到10万token以上。该方法为Agent场景提供思路。

PaperAgent
新闻资讯7

故意“装菜”答错问题,AI已识别自己“正在被测试”丨OpenAI研究

OpenAI与APOLLO研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与力提升,可从技术和规则层面防控。

量子位
算法论文8

大模型“原地”改参数了!字节Seed&北大论文:测试时推理无需加层重训练

字节Seed和北大研究团队提出In - Place TTT方案,让大模型“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。

量子位
产品应用7

海螺模型海外爆火:一夜之间,猫、羊驼、长颈鹿都学会跳水了

国内AI公司Minimax的模型‘Hailuo 02’本周三官宣上线,在海外爆火。其生成的动物跳水等复杂运动视频AI痕迹不明显,官方称它是全球唯一处理类似体操高度复杂场景的模型。该模型使用NCR架构。

机器之心
开源动态8

比Gemini 3记得更多,谷歌框架将上下文记忆干到了200万!

Google在NeurlPS2025大会推出结合RNN与Transformer的全架构Titans,扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示架构性出色。

PaperAgent
新闻资讯8

刚刚,谷歌发布机器人最「大脑」模型!思考力SOTA,还「跨物种」学习

谷歌旗下DeepMind发布Gemini Robotics 1.5系列模型,包括Gemini Robotics 1.5和Gemini Robotics - ER 1.5,让机器人学会‘思考’,还可跨具身形态学习技,有望开启通用机器人时代。

新智元
算法论文7

原来Scaling Law还被优化?Meta这招省token又提效

2017年《Attention Is All You Need》提出的Transformer是主流语言模型基础范式。Meta论文提出旋转不变型三线性注意力机制,证明其表现改变Scaling Law系数,还证实2 - simplicial Transformer在有限token预算下更优。

机器之心
产品应用7

求稳的全IP,谋科技如何守正出奇?|甲子光年

12月24日,谋科技推出一代SPU IP——“山海” S30FP/S30P,构建覆盖芯片底层至应用层的一栈式全防护体系,有抗物理攻击强等五大亮点,适配不同场景全需求,完善产品布局。

甲子光年
算法论文8

谢赛宁盛赞字节Seed研究!单Transformer搞定任意视图3D重建

字节Seed康炳易团队的最研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,从多种输入中精准算出物体深度、还原相机位置,在视觉几何基准上表现出色,核心秘诀是极简设计。

量子位