「基准榜单」共找到 1481 篇相关文章
从“能用”到“敢用”:企业级 AI 落地的终极答案 | AICon 2025 收官
12月19 - 20日AICon 2025大会落幕,众多企业专家参与,探讨企业级AI落地。InfoQ王一鹏谈AI落地趋势与流畅度构建;大会发布「2025中国技术力量年度榜单」,多位嘉宾演讲分享AI见解,还有17个分论坛和合作展区。
跑分第一,实战拉胯!GPT Image 1.5被骂惨,奥特曼这波悬了
OpenAI推出新一代旗舰图像模型GPT Image 1.5,生图能力强,免费用户可上手,开发者能调用API。它在跑分榜单成绩优异,但网友实测发现是‘高分低能’,引发吐槽。此外,其API价格降20%,此次更新是回击谷歌。
构建能源领域的AI专家:一个多智能体框架的实践与思考
本文介绍阿里团队在能源领域构建多智能体框架的实践。因单智能体处理复杂任务有“注意力发散”问题,团队研发综合能源智能体平台,阐述框架搭建、各组件功能及设计考量,还分享思考与可优化点。
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。
无需NeRF/高斯点后处理,视频秒变游戏模型成现实!新方法平均每帧仅需60秒 | ICCV 2025
KAUST团队提出全新方法V2M4,能从单目视频直接生成高质量、显式的4D网格动画资源。该方法构建多阶段流程,涵盖相机轨迹恢复等关键步骤,平均每帧约60秒,比现有方法显著提速,论文已被ICCV 2025接收。
哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理
哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。
AMD跑GLM 5.2,成本只要英伟达一半
推理优化公司Wafer公布数据,用AMD的MI355X芯片跑GLM 5.2,单节点吞吐达2626 tok/s,单流吞吐213 tok/s,成本不到英伟达B200的一半。该公司详述部署过程,还提及AMD软件生态的变化及英伟达面临的挑战。
Pokee.ai 朱哲清:用 RL 搭建智能体的「骨骼与神经」| AI 产品十人谈
《AI 产品十人谈》对话 Pokee.ai 朱哲清,探讨强化学习与 Agent。朱哲清是强化学习信徒,曾带领 Meta 团队突围。他认为单靠预测难完成复杂任务,强化学习是超人类智能的关键,介绍了 Pokee.ai 产品优势及对通用 Agent 的看法。
Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3
Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。
等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……
MiniMax新发布的视频模型H3在多模态能力出色,霸榜Artificial Analysis榜单。但开源模型有部署和成本难题,秘塔AI上线该模型,免部署,2K方案0.15元/秒,768P方案0.09元/秒,降低创作门槛。