「训练评估体系」共找到 3204 篇相关文章
Agentic Coding表现创新高,全新KAT系列模型强势霸榜SWE-Bench
快手 Kwaipilot 团队推出 KAT 系列两款 Agentic Coding 大模型,KAT - Dev - 32B 开源,KAT - Coder 闭源。两模型在 SWE - Bench Verified 表现出色,且在多训练阶段创新优化,有强大代码生成能力和涌现现象。
苹果分享 iOS 26 即将推出的 AI 基础模型的细节
苹果在技术报告中公布 iOS 26 新 AI 基础模型细节。该模型有 3B 参数和更大版本,前者在设备运行,后者用于私有云平台。介绍了架构、评估结果,还强调实现可信赖 AI 的方法。
重新思考 AI TCO:为何每 Token 成本才是唯一重要的指标
在生成式与代理式AI时代,传统数据中心转变为AI Token工厂,企业评估AI基础设施时不应只关注算力成本、每美元FLOPS,而应重视每Token成本,它决定AI规模化盈利,NVIDIA在该指标上表现出色。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。
全球首家具身数据独角兽诞生:光轮智能完成10亿元融资,开启具身数据规模化元年|甲子光年
具身智能进入数据Scaling Law时代,光轮智能完成10亿融资成全球首家具身数据独角兽。它构建了World-Behavior-Eval数据引擎体系,在多领域获国际交付冠军,客户涵盖顶尖企业,正构建物理AI时代基础设施。
刚刚,智谱敲钟上市了,市值达528亿港元
2026年1月8日,智谱在港交所挂牌上市,首日市值528.28亿港元。它是中国最早投身大模型研发的厂商之一,提出GLM范式,模型体系全面。此次募资将用于研发和优化平台,以MaaS模式发展,开启全球竞技新阶段。
英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万
英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。
Qwen拿半成品刷下AIME'25满分,给别人留点面子吧……
开源之王Qwen的Qwen3“超大杯”推理版虽为早期预览版,仍在训练中,但已在AIME 25和HMMT25达100%准确率,超GPT - 5系列。该预览版可在Qwen Chat免费试用,API已上线阿里云。
Rex-Omni:用 3B 模型颠覆目标检测
长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。
这次,LLM黑盒被LLM打开了~
随着大语言模型(LLM)能力提升,其内部机制更不透明。概念描述新范式用另一个 LLM 自动生成自然语言解释。介绍了描述对象、生成方法、评估指标,还提及社区关注方向,指出结合多种手段才能把解释变知识。