「不对称训练」共找到 3307 篇相关文章
省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式
大模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。
贴脸对打Opus 4.5!最新Codex自己写自己,网友实测“放手”8小时不崩
Claude Opus 4.6发布不到半小时,OpenAI就上线GPT - 5.3 - Codex,这是其最强的Agent化编程模型。它多项跑分超Claude Opus 4.6,网友实测长链路稳定性好,虽慢但稳。OpenAI总裁称Agent正重构软件开发。
“光顾赚钱不搞研究”,OpenAI元老级高管出现离职潮,Mark Chen紧急回应
OpenAI现元老级高管离职潮,如研究副总裁Jerry Tworek等。《金融时报》称与战略转向有关,Mark Chen反驳。内部因专注LLM撕裂,缺算力致资源集中ChatGPT,OpenAI危机四伏。
Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型
Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。
全球唯二、国内首个,阿里万相2.6杀疯!Sora 2瞬间不香了
阿里万相2.6系列模型上线,成为业界功能最丰富的视频模型,是全球唯二、国内首个具备角色扮演功能的模型。其音画一体,能生成15s长视频,指令遵循能力强。还可将提示词转换为多分镜脚本,团队公开了提示词公式。
奥特曼恩师力挺19岁少年!比AlphaFold快4倍,只杀害虫不伤人
2024年,18岁的Tyler Rose和19岁的Navvye Anand创办Bindwell,将AI药物研发技术用于农业,构建基础模型,研发出比AlphaFold快4倍的模型。奥特曼恩师Paul Graham建议卖知识产权授权,公司获600万美金融资。
图片生成仿真!这个AI让3D资产「开箱即用」,直接赋能机器人训练
南洋理工大学与上海人工智能实验室团队提出PhysX - Anything,首个面向仿真、具物理属性的3D生成框架。它仅需单张图像就能生成可用于仿真的3D资产,在多项测试中表现优异,有望推动3D重建范式转变。
数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真
数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。
不改模型也能提升推理性能?ICLR投稿提出测试时扩展新范式OTV
ICLR 2026投稿论文提出单token验证(OTV),是测试时扩展新机制,让模型能边推理边判断正误。它基于并行思考思路,借助轻量内部验证器分析推理过程,实验显示其性能优于主流方法。
1.58bit不输FP16!微软推出全新模型蒸馏框架,作者全是华人
微软推出蒸馏框架BitNet Distillation,实现几乎无性能损失的模型量化。它含三阶段,经实验在多下游任务表现近全精度模型,降内存开销、提推理速度,作者全是微软研究院华人。