「训练成本」共找到 3393 篇相关文章
马斯克盛赞朱雀三号:能够击败SpaceX猎鹰9号
马斯克在中国民营可回收火箭朱雀三号首飞之际,盛赞其有超越猎鹰9号的潜力,还称中国航天若顺利5年能追上。朱雀三号即将首飞,有望成我国首款可回收运载火箭,采用不锈钢+液氧甲烷配方。
数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真
数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。
不改模型也能提升推理性能?ICLR投稿提出测试时扩展新范式OTV
ICLR 2026投稿论文提出单token验证(OTV),是测试时扩展新机制,让模型能边推理边判断正误。它基于并行思考思路,借助轻量内部验证器分析推理过程,实验显示其性能优于主流方法。
o1 核心作者 Jason Wei:理解 2025 年 AI 进展的三种关键思路
前OpenAI核心研究员Jason Wei跳槽Meta后,在斯坦福大学AI Club演讲,提出理解2025年AI发展的三个核心思想:验证者定律、智能的锯齿状边缘和智能商品化。他认为AI将解决可验证任务,智能成本会趋近零,且各任务发展不均衡。
AI时代,为什么你又焦虑又学不进去?这个人破解了专注力的秘密
文章指出AI时代人们学不进去,原因在于信息爆炸、AI工具易致分心,本质是没学会处理学习不适。介绍了Time Boxing、“10分钟法则”等应对方法,强调专注力是新学习力,要预先规划建立学习系统。
谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束
谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。
8000行Python+Rust手搓ChatGPT,日收14.5k星!Karpathy:Agent只会帮倒忙
特斯拉前AI总监Andrej Karpathy发布开源项目nanochat,可搭建简易版ChatGPT复现模型。约8000行代码,成本低,功能多。卡帕西称手写代码,用Agent效果差,项目受网友热赞。
一个模型装下整个物种树!伯克利GPN-Star斩获基因预测双料冠军
加州大学伯克利分校等机构推出基因组语言模型GPN - Star,可将全基因组比对和物种树信息装进大模型。它克服传统GLMs短板,实现三点升级,在多基准测试表现出色,是强大的全基因组变异解读框架。
Andrej Karpathy回应强化学习之父Sutton最新观点「LLM是“死路一条”」
图灵奖获得者、强化学习之父Richard Sutton认为当前热门的大语言模型是“死路一条”,因其缺乏从实际互动中学习的能力。AI大神Andrej Karpathy认同其批评,认为当前LLM是向现实妥协的产物,还提出了“幽灵”比喻。
更先进的AI,就应该发生在“今天” | 甲子光年
AI应用离消费者体验还有距离,行业分歧加剧。9月22日,联发科发布天玑9500芯片,把AI嵌入端侧设备,在高频场景优化体验,还在芯片设计、硬件创新上突破瓶颈,带动伙伴发展,推动AI普及。