训练成本」共找到 3366 篇相关文章

开源动态8

中科院类脑大模型SpikingBrain,2%数据,百倍速度

中国科学院自动化研究所李国齐、徐波团队发布全球首款大规模类脑脉冲大模型SpikingBrain 1.0。它处理长文本比主流Transformer模型快超百倍,训练数据仅为2%。该模型采用新架构,降低计算复杂度,还可转换现有模型,且在国产GPU完成训练

AIGC开放社区
开源动态8

月之亮剑:万亿参数,造就国内首个 Agentic Model?

月之暗面发布全球首个万亿参数且直接开源的 Agentic Model Kimi - K2,它将 AI 下半场与经验时代理论融合。在测评中表现出色,Kimi 还通过创新方法完成预训练和后训练,并将成果开源,给中国开发者更多自主权。

特工宇宙
新闻资讯8

推理成本太高、算力不够用?单纯堆卡没用,得靠极致的“压缩”与“调度” | AICon

大模型落地面临推理成本高、算力需求大的问题。AICon大会上,阿里云刘峥、ModelTC龚睿昊、阿里巴巴马腾、OPPO宋晓辉、清程极智汤雄超等专家将分享从压缩到调度的推理优化方案,覆盖云到边缘、多算力平台。

InfoQ
开源动态8

3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学

上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。

量子位
产品应用8

腾讯混元A13B用130亿参数达到千亿级效果,Flash Attention作者点赞

腾讯混元A13B模型仅130亿激活参数,却能和千亿级大模型竞争,获Flash Attention作者赞叹。它精准卡位性能与效率‘甜蜜点’,依托高质量预训练和结构化后训练,多方面表现突出且已全面开源。

量子位
产品应用8

地瓜机器人携手虚时科技,补上具身智能的仿真数据“黑洞”|甲子光年

5月12日,虚时科技与地瓜机器人联合开发的AnySceneGen平台发布,这是面向具身智能训练的仿真空间生成平台。具身智能训练需海量数据,传统仿真数据生产依赖人工,效率低。该平台以模型替代人工,重构生产方式,优势显著。

甲子光年
算法论文8

GUI智能体训练迎来新范式!半在线强化学习让7B模型媲美GPT-4o

浙江大学与通义实验室团队推出UI - S1,提出半在线强化学习训练范式。它融合离线与在线学习优势,用三项关键技术构建核心架构,新评测指标SOP更贴近真实表现,实验显示UI - S1 - 7B性能卓越,逼近GPT - 4o。

量子位
算法论文8

SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃

文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。

机器之心
推荐文章8

构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践

在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。

InfoQ
推荐文章7

AI泡沫原罪:英伟达是AI戒不掉的“毒丸”?

海豚君通过产业链核心公司报表研究AI投资是否到泡沫阶段及原罪。指出AI产业初期利润分配不均,上游获利多。还分析各环节风险,如英伟达怕需求下滑,云服务商有成本和产能风险,OpenAI成本高、亏损大。产业链巨头开始博弈定价权。

芯师爷