「Skill训练框架」共找到 3720 篇相关文章
蚂蚁出手VLA,就是开源超越Pi0.5的基座模型
当前具身智能落地面临泛化能力不足的挑战,蚂蚁灵波开源发布的基座模型 LingBot-VLA 带来突破。它基于大量真实世界数据预训练,在多项真机任务测试中超越 Pi0.5,且在架构、效率等方面有创新。
字节开源图像生成“六边形战士”,一个模型搞定人物/主体/风格保持
字节UXO团队设计并开源统一框架USO,解决图像生成多指标一致性问题。它能统一看似孤立任务,实现单任务和组合任务的SOTA,弥补了主体保持和风格迁移短板,性能领先,还采用新范式及算法。
追剧不断网,可能背后有个AI在加班,故障诊断准度破91.79%
中兴通讯和中国移动团队针对电信网络故障诊断难题,提出 TN - RCA530 基准和 Auto - RCA 框架。测试多个大模型,初始准确率低,经框架优化后,Gemini - 2.5 - Pro 准确率从 58.99% 升至 91.79%,超人工水平。
别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案
团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。
jina-reranker-v3刷新全球重排榜,效率狂飙4.79%
jina-reranker-v3作为LLM时代向量模型,提出“最后但不晚”交互机制,解决文档检索效率与效果权衡、多语言文档重排性能与效率平衡、模型泛化能力和适应性等问题,架构与训练方案有创新。
攻克大模型训推差异难题,蚂蚁开源新一代推理模型Ring-flash-2.0
9月19日,蚂蚁百灵大模型团队开源新一代推理模型Ring-flash-2.0,独创棒冰算法解决训推差异难题,实现稳定训练。该模型仅激活6.1B参数就能打平40B Dense模型性能,降低推理成本。
OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课
全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模对手。
我们开源了一个可以降低 AIGC 率的模型
毕业季学校查 AI 率,作者为降 AIGC 率,经尝试不同路径后训练出模型。介绍训练数据和过程,包括 SFT、DPO 各阶段,展示改写效果,还开源模型和数据,最后引发对教育检测的思考。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
AST | 西工大马龙、邬晓敬等:几何特征知识驱动的代理优化方法
机器学习为气动外形设计提供新方法,但高效挖掘利用几何与气动数据知识是难题。本文提出气动监督自编码器架构,利用小样本气动数据监督学习几何特征,嵌入优化框架提升样本质量及优化效率,经翼型和机翼验证有效。