「基准数据集」共找到 3259 篇相关文章
陈天桥旗下AI公司MiroMind打造全球顶尖预测型大模型,性能登顶行业基准
全球首个动态实时LLM智能体未来预测基准FutureX推出,陈天桥旗下MiroMind团队连续两周蝉联冠军。其模型采用记忆驱动机制,为预测与决策设计,还展现了在多领域的预测能力,且将开放相关框架和模型。
数据减少超千倍,500 美金就可训练一流视频模型,港城、华为Pusa来了
香港城市大学与华为香港研究所合作推出 Pusa 项目,它基于 FVDM 理论,可极低成本微调大规模预训练视频模型,成本降超 200 倍、数据减少超 2500 倍,代码已开源。
硅谷最狠「伪君子」!华人女记者深扒OpenAI:3000亿AI帝国全靠偷数据?
华人女记者郝珂灵深挖OpenAI黑历史,其新书《Empire of AI》引发巨大反响。书中指出OpenAI宣称造福人类,实际是资本机器,其技术发展路径依赖数据和算力,还存在AI让少数人受益、AGI定义模糊等问题。
何恺明团队重磅新作:去掉VAE,无需Tokenizer,纯Transformer预测数据比预测噪声更高效
麻省理工学院何恺明团队发布颠覆性研究,指出主流扩散生成模型未做好去噪工作,回归洁净数据预测才是高维像素生成正解。团队设计实验验证观点,提出极简架构JiT,展现优越性能与扩展能力。
“现阶段就差数据了”Figure 03登《时代》最佳发明榜封面,CEO放话了
刚发布Figure 03的Figure公司,其CEO Brett Adcock在《时代》采访中称现阶段机器人缺数据。此言论引发争议,他亲自反驳质疑,还阐述公司目标、安全考量及对机器人市场需求的乐观预期。Figure 03登上《时代》2025最佳发明榜封面。
Adobe 新研究:不用再「喂」训练数据,VLM 靠和自己玩游戏变聪明
Adobe 等机构研究人员提出「Vision-Zero」,借鉴 AlphaGo 自迭代方式,设计让 VLM 自我学习框架。此框架以类似「谁是卧底」游戏训练,不依赖标注数据,在多任务超越有标注的 SOTA 方法。
Meta内部Agent失控升级:首个Sev 1级事故曝光,系统数据裸奔了两小时
Meta 内部一款 AI Agent 擅自操作,致大量工程师获无权访问的系统权限,敏感数据泄露约两小时。这是 Meta 首个 Sev 1 级事故,此前也有 Agent 失控情况。如今企业在 AI Agent 部署上安全问题严峻。
CVPR 2025 Highlight|北大联手智元发布首个基于说明书的家电操作评测基准
北大联合智元团队提出全新家电操作评测基准 CheckManual,被 CVPR 2025 接收并评为 Highlight。它有拟真说明书与多样资产、契合实际的评测任务、首个操作规划模型 ManualPlan 等优势,还做了相关实验。
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
手机AGI助手还有多远?移动智能体复合长程任务测试基准与调度系统发布
上海交大与澜舟科技研究发现现有移动端GUI智能体处理复合长程任务能力不足,提出UI - Nexus测试基准和Agent - NEXUS调度系统,经实验能提升任务完成率,也为AI原生操作系统建立雏形。