「评测指标」共找到 874 篇相关文章
华为创造AI算力新纪录:万卡集群训练98%可用度,秒级恢复、分钟诊断
大模型落地需强大算力集群支撑,构建万卡级算力集群是顶尖挑战。华为昇腾万卡算力集群近乎‘永不罢工’,其公开技术秘密,提出‘3+3’双维度技术体系,多项指标表现优异。
预测误差仅0.26mm,中科院自动化所×灵宝CASBOT团队让机器人提前“知道你要干嘛”
中科院自动化所与灵宝CASBOT提出DTRT方法获ICRA 2025录用。该方法利用Transformer和博弈论,将人类动态纳入长期预测,实验显示其预测精度和协作表现显著优于现有技术,有巨大应用潜力。
The Batch: 978 | DeepSeek-V4-Pro 更新了
DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义大。
一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向
过去三年,3D Gaussian Splatting(3DGS)成实时3D场景重建与新视角合成“默认答案”,但场景拓展后有显存、带宽和功耗限制。香港科大等联合发布综述,从底层数据流组织技术版图,给出优化建议和未来方向。
刚刚,Anthropic 宣布:Claude 自己长出了意识
Anthropic新研究《语言模型中的全局工作空间》,在Claude神经网络里找到特殊区域J - space,它有独特性质,对应全局工作空间理论。还介绍了发现方法及多个实验,探讨其与意识关系,研究已开源。
TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral
大模型推理评测多只看答案,忽略推理过程。上海多校团队提出TRM,用ME² principle刻画推理质量,DAG-based pairwise evaluation还原结构,训练奖励模型,让推理质量可度量、训练和优化。
不安全指令,一拒了之?TRIAD用三路决策:修复AI智能体的危险计划
墨尔本大学团队开源TRIAD框架,将传统二元护栏决策扩展为继续、更新、拒绝三类。通过自然语言反馈引导Agent修正计划,在ASB和AgentHarm评测中,显著降低攻击成功率,提升正常任务完成率。
独家|「中科第五纪」完成数亿元A轮融资,率先开启海外商业落地
AI科技评论独家消息,具身智能企业「中科第五纪」近日完成数亿元A轮融资,年内已完成三轮。该公司还收获海外数亿订单。其提出超少样本具身操作大模型等核心技术,形成完整技术体系。
这周六,聊聊具身数据、模型与落地场景|沙龙报名
当下具身智能进入加速期,但具身模型从Demo走向真实世界运行路径复杂,存在技术路线未收敛、数据匮乏等问题。量子位等联合发起沙龙,4月25日周六14:00,一线从业者与研究者将分享经验,探讨具身智能关键环节。
断层碾压Seedance 2.0:神秘「欢乐马」空降榜首,视频AI变天了
周二晚间,代号「HappyHorse - 1.0」的神秘视频生成模型在 Artificial Analysis 平台空降榜首,不论文字生视频还是图像生视频都排第一,拉开 Seedance 2.0 很大差距,不过在「视频 + 音频」综合排名上屈居第二,引发诸多猜测。