MMEB训练榜」共找到 2424 篇相关文章

算法论文8

开启 AI 自主进化时代,普林斯顿Alita颠覆传统通用智能体,GAIA单引来终章

普林斯顿大学AI Lab推出通用智能体Alita,秉持「极简即是极致复杂」哲学,采用「最小化预定义」与「最大化自我进化」设计范式,可自主创造MCP工具,在GAIA基准测试中表现卓越,还能实现MCP复用。

机器之心
6

AI圈惊天丑闻,Meta作弊刷分实锤?顶级单曝黑幕,斯坦福MIT痛斥

新智元
算法论文8

蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分背后的三大幻觉,现已接入MTEB

蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。

AINLPer
新闻资讯8

深度机智和他们的另一条路:用人类第一视角数据训练基座模型|甲子光年

3月27日,深度机智联合推出具身通用智能基座模型系统PhysBrain 1.0,引入人类第一视角数据,解决传统模型问题。其创始人陈凯等坚持用此数据构建模型,突破传统,引领行业新方向,且中国在具身智能领域或借此建立自主技术体系。

甲子光年
算法论文8

拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式

使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。

机器之心
算法论文8

推荐大模型来了?OneRec论文解读:端到端训练如何同时吃掉效果与成本

随着AI发展,推荐系统面临诸多问题,快手技术团队提出OneRec,以端到端生成式架构重构推荐系统全链路,在效果与成本上实现突破,已在快手双端服务用户,也有需完善之处。

机器之心
算法论文7

一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等

上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。

量子位
新闻资讯7

Meta“Token”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱

据报道,Meta 公司内网出现 AI token 消费排行,追踪超 8.5 万员工 token 使用情况,过去 30 天消耗超 60 万亿 token。这反映“Token 最大化”文化,引发 token 消耗是否等同于生产力的争议。当前 Agent 系统高 token 消耗是补偿机制,应提升使用效率。

AI前线
开源动态8

让AI自动构建AI模型:UCSD 推出 AIBuildAI 智能体,斩获OpenAI MLE-Bench单第一

近日,加州大学圣地亚哥分校研究团队开发 AIBuildAI 智能体,可全自动构建 AI 模型。它在 OpenAI MLE - Bench 基准测试 75 个任务上以 63.1% 获奖率居首,实现端到端自动化。

机器之心
新闻资讯8

更全面的具身智能真机评测来了!CVPR 2026 ManipArena挑战赛邀你打

具身智能产业发展迅速,但缺统一、高标准真机评测体系,成发展痛点。中山大学等机构推出 ManipArena 挑战赛,提供科学评测框架,已测部分模型,揭示不同技术路线能力边界,为产业发展提供基础。

机器之心