感知级评估」共找到 1875 篇相关文章

开源动态8

北大开源统一世界模型框架:多类合成推理任务一套搞定

世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合多方推出OpenWorldLib推理框架,整合多模态能力,构建标准化接口体系,在多任务上评估效果良好,降低研发门槛。

量子位
开源动态8

MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩

2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。

MacTalk
新闻资讯8

刚刚,Figure 03惊天登场!四年狂造10万台,人类保姆集体失业

通用机器人曙光来临,Figure 03正式亮相,专为Helix「大脑」打造,手掌心有摄像头,指尖能感知3克力。其进化亮点多,未来四年将量产十万台,适用于家庭和商用场景。

新智元
算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。

量子位
新闻资讯7

0人类数据,让机器臂自学拧灯泡:MIT初创要打造机器人界的AlphaZero

Eka Robotics 发布机械臂视频,其能自主拧灯泡、抓取物品。该公司提出 VFA 模型,不依赖人类数据,让机器人在仿真环境自主探索。创始人期望实现超人灵巧操作,算法还展现泛化和自主发明策略能力。

DeepTech深科技
新闻资讯7

为什么HBM能摆脱传统周期?

当前市场对HBM和DRAM能否摆脱传统半导体周期性存争议。过去半导体周期由消费电子换机节奏驱动,而AI推理不同,大模型推理对内存依赖是硬约束,GPU更新对HBM需求几乎注定指数增长。

newtype AI
产品应用7

既要安全⼜要弹性,理想汽车如何解开企业 OpenClaw 落地死结|甲子光年

2025年以来,大模型应用飞速发展,以OpenClaw为代表的开源框架是变革催化剂,但其在企业生产环境有缺陷。理想汽车以阿里云ACS Agent Sandbox及ACK为核心,为Agent构建专属‘沙箱’,解决落地难题。

甲子光年
新闻资讯7

Cloudflare 推出 Agent Tracing:支持截断限制,不同框架的 Payload 默认记录策略存在差异

Cloudflare推出Agent Tracing,可提供统一Dashboard查看已部署Agent会话。该功能在现有Workers Tracing基础上增加Agent别的Span,有收费时间表。不同框架Payload默认记录策略有差异,Trace有截断限制。

InfoQ
新闻资讯7

小扎开建「人类第一算力帝国」!26年榨干当地水电,27年超越星际之门

Meta进军AI超算领域,扎克伯格宣布2026年启用1GW「Prometheus」集群,2027年建成占地如曼哈顿的「Hyperion」计划部署超5GW算力,Meta还将自建天然气电厂,力抗OpenAI与马斯克。

新智元
开源动态8

Google这个1.5w star 项目牛皮,99%准确率!

Google安全团队开源AI文件类型检测工具Magika,抛弃固定规则匹配,用深度学习精准识别文件真实类型。它内置轻量模型,单CPU毫秒推理,支持200+格式,准确率约99%,已大规模落地。

开源先锋