内部验证器」共找到 1343 篇相关文章

算法论文8

将注意力旋转 90 度!今天,Kimi 的「注意力残差」火了

Kimi团队发布技术报告Attention Residuals,用依赖输入的注意力机制取代标准深度递归,解决传统残差连接的信息稀释和隐藏状态爆炸问题。实验显示其有计算优势,下游任务表现佳。

机器之心
算法论文8

显存暴降92%!哈工大为线性注意力开辟了新道路

哈尔滨工业大学等团队发现线性注意力性能不足根源是查询范数丢失等。基于此提出NaLaFormer,在ImageNet - 1K准确率最高提7.5%,超分任务峰值内存降92.3%,为线性注意力发展开辟新道路。

AIGC开放社区
开源动态8

EmbodiChain开源,用100%生成式数据自动训练具身智能模型

跨维智能开源EmbodiChain,它是通往GS - World的基石,重构具身智能学习范式。其以100%生成式仿真数据训练机人,突破数据瓶颈,还对比了不同路线,测试显示其模型效果佳。

机器之心
算法论文8

DeepMind 颠覆机人学习范式:让机像人一样 “自由成长”

谷歌DeepMind受大模型微调中强化学习阶段启发,提出面向机人学的两阶段后训练方法,含监督微调与自我提升。实验显示该方法让机人自主习得新技能、广泛泛化,但研究也存在标注成本高等局限。

AI科技评论
算法论文8

英伟达发布 Jet-Nemotron 系列小模型,理论最大加速比 56 倍

英伟达发布 Jet - Nemotron 系列小模型,在多项基准测试中表现出色,实现高吞吐量加速和高准确率。其训练采用 PostNAS 方案,对既有模型针对性优化,展示了在小模型优化上的可行技术路径。

AI科技评论
7

28岁华人执掌1.85万亿科技巨头AI大权!一觉醒来,图灵奖得主也要向他汇报

Meta超级智能实验室一拆四,28岁华人Alexandr Wang出任负责人获扎克伯格力挺。内部信强调‘超级智能即将到来’,宣布实验室拆分,AGI Foundations团队解散成员分流,Yann LeCun地位降级。

新智元
算法论文8

ACL 2025|自我怀疑还是自我纠正?清华团队揭示LLMs反思技术的暗面

本文指出反思技术虽简单有效,但在多种LLMs和任务中会失败。清华团队剖析其在开源和闭源LLMs、四种任务上失败原因,提出轻量级缓解方案,为反思技术可解释性研究奠基。

机器之心
新闻资讯7

刚刚,北大校友Lilian Weng自曝公司首个产品?一篇论文未发,估值却已90亿

OpenAI前安全副总裁Lilian Weng疑似曝光90亿估值新公司Thinking Machines首个产品——手动调参仪表盘,训练中可手动调超参数。OpenAI也有AI硬件野心,设想让ChatGPT成全能硬件助手。

新智元
产品应用7

AIGCode宿文:我就是要自训练大模型,直接做「L5」| AI产品十人谈

AIGCode宿文坚信Coding是培育大模型的最佳场景,公司自训练66B基础模型,发布锡月大模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。

AI科技评论
产品应用7

Claude 5.1来了,但最强能力只向少数机构开放

9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,二者用相同底层模型,区别在安全限制和开放范围。Fable面向订阅用户和企业,Mythos仅向少数审核机构开放,此次还尝试新的开放方式。

AIGC开放社区