基准构建」共找到 2650 篇相关文章

产品应用8

训练MoE足足提速70%!华为只用了3招

Scaling Law下,MoE成扩展模型能力法宝,但训练难题凸显。华为构建Adaptive Pipe & EDPB优化方案,还打造DeployMind仿真平台,解决了MoE训练中通信等待、负载不均等问题,使训练吞吐提升72.6%。

量子位
新闻资讯7

DeepMind华人研究员Lun Wang离职,「评估」成制约模型能力飞跃的瓶颈

谷歌DeepMind研究员Lun Wang离职后发文指出,当下评估体系难以应对新模型,制约模型能力飞跃。现有评估多针对当前模型,新能力出现时往往无法预测,需构建能自我进化的评估系统。

机器之心
算法论文8

LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?

经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。

机器之心
开源动态8

教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题

上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。

量子位
算法论文8

ICCV 2025 | 机器人自主探索未知复杂空间?GLEAM破解主动探索建图的泛化难题

文章聚焦机器人在未知复杂空间的自主探索建图难题。香港中文大学与上海人工智能实验室联合提出GLEAM,搭建GLEAM - Bench基准,设计通用策略,实现零样本适配未知空间,在多指标上超越先前方法。

机器之心
算法论文8

打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐

本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。

AI前线
开源动态8

13K star!这个项目太顶了,自动化 API,后台作业,工作流,UI开发,低代码一网打尽!

日常开发构建和管理内部工具费时费力,第三方方案费用高。开源项目Windmill是开发者福音,能将脚本自动转换成工作流程和UI,适用多场景,有自动UI生成等特色,安装使用简单。

开源先锋
新闻资讯8

商业航天开始交卷

今年工信部批复卫星物联网商用试验许可,商业航天迈进商业化。时空道宇作为获批民企成观察样本,它解决卫星量产等难题,实现车载前装量产,构建全栈闭环能力,为行业提供思路。

远川科技评论
算法论文8

牛津、NUS提出下一代世界模型方向:心智世界模型来了

牛津大学和新加坡国立大学研究团队提出心智世界建模(MWM)通用框架,将心智变量纳入世界状态。还实现基准系统 MENTIS 验证其有效性,实验表明 MWM 对预测人类决策必要,瓶颈是状态转移模拟能力不足。

机器之心
开源动态8

字节开源版Seedance发布,超越Sora 2!

字节Alive团队发布开源版Seedance 2.0,在人类评估中超越Sora 2等。它通过统一架构、时空对齐技术和非对称训练策略,解决声画不同步和画质音质难两全问题,还建立数据流水线和测试基准

AIGC开放社区