「成本效益训练」共找到 3377 篇相关文章
啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1
近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。
挑战ReAct!MetaGPT团队提出ReCode智能体新范式
DeepWisdom研究员指出当前主流智能体框架受固定决策粒度束缚,提出ReCode新范式。它统一规划与执行,能在不同粒度间自由切换,实验显示其性能、成本和训练效率均有提升,引发广泛关注。
创业三年半,23人的AI公司卖了30亿
投资界消息,英伟达超4亿美元收购加拿大AI初创公司CentML,将其19人团队收入囊中。CentML由95后华人博士王尚及导师创立,以‘张量编译器Hidet’为核心技术,降低AI训练成本。
OpenAI不Open!7年功勋老将投奔宿敌,实验室沦为API代工厂
2026开年,OpenAI的「推理之父」Jerry Tworek离职,他入职近七年,是推理技术核心人物。Scaling Laws失效,后训练成主要出路,但深度推理成本高,在强调盈利环境下,Tworek不满研究受限而离开,OpenAI或失去通往AGI的机会。
杨植麟亲自发布,月之暗面最强模型Kimi K2.5开源
杨植麟发布月之暗面最强模型Kimi K2.5,经约15万亿视觉与文本混合数据预训练,有顶尖编程与视觉能力及智能体蜂群范式。在多基准测试表现优,成本低于对手,还能提升办公生产力。
大模型是不是到顶了?瓶颈到底在哪
文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。
一副手套,干翻硅谷炫技派!中国队杀入战场,狂卷100万小时数据
硅谷具身智能玩家为数据发愁,中国灵初智能另辟蹊径,用数据手套采集工人操作数据,成本低且数据泛化性强。其专注物流细分场景,2026年收敛资源做深现有场景,目标推100万小时数据训练模型。
DeepSeek V4即将发布?先读懂梁文峰这份86页的技术底牌
据报道,DeepSeek计划2月中旬发布V4,此前将R1论文从22页扩充到86页。新增内容涵盖训练细节、成本、数据配方等,还公开失败案例、基础设施和安全报告,或为V4铺路并回应质疑。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。
Clawdbot 之后,我们离能规模化落地的 Agent 还差什么?
OpenClaw爆火,但在企业和商业环境中存在昂贵、不可控等问题。Monolith砺思资本技术沙龙探讨Agent规模化落地难题,指出需关注稳定性等指标,还分析了数据成本、训练速度、基础设施、状态管理等方面的困境与解决思路。