「基准构建」共找到 2659 篇相关文章
编程新王Composer 2.5来了,逼近Opus 4.7!成本仅为1/10
Cursor推出全新AI编程模型Composer 2.5,在部分编程基准测试上接近Claude 4.7 Opus和GPT - 5.5,运行效率最高提升10倍,成本仅为竞品一小部分。其采用定向文本反馈RL等机制,还与SpaceXAI合作冲击百万H100集群算力。
独家|拿下5亿元海外订单,无界动力完成天使++轮融资,天使轮累计融资超2亿美元
AI科技评论独家获悉,通用具身智能机器人公司无界动力完成天使++轮融资,累计超2亿美元,天使+++轮也接近完成。其以隐空间世界模型构建具身大脑,区别于主流架构。还获远景超5亿订单,商业化落地成果多。
Google 悄悄升级了 Deep Think,ARC-AGI-2 直接干到 84.6%
Google DeepMind 升级了 Gemini 3 的专用推理模式 Deep Think,跑分屠榜。ARC - AGI - 2 拿下 84.6%,在多个基准测试中表现优异。它不仅是解题机器,还能解决真实科学工程问题,已向部分用户推送,科研人员和开发者可通过 API 使用。
为什么AI总是"记错"你?我们造了一个"合成人生"来测试
现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。
大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制
大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。
3D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32%
中科院自动化所提出BridgeVLA模型,将3D输入投影为2D图像并利用2D热图进行动作预测。它训练分两阶段,在多仿真基准和真机实验表现卓越,仅3条轨迹基础任务成功率达96.8%,真机性能提升32%。
长文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级
近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学化建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。
Agent 重构互联网,谁将受益于线上内容的“帕累托效应”?|AGIX PM Notes
文章围绕AI时代展开。在搜索领域,谷歌垄断案法庭主张其向竞争者开放搜索索引数据,这能助对手构建强大索引、补短板。商品服务层面也有80 - 20重构。还提及本周市场动态、AI企业相关消息,如谷歌案裁决、OpenAI成本预期等。
为什么GPT-5算得出微积分,却数不清积木?
文章对GPT - 5展开系统化空间能力测评,涵盖8个基准、超10亿token成本。提出“空间智能六维图谱”,发现GPT - 5在MM和SR达人类水平,但MR、PT等方面有短板,还揭示闭源与开源模型在复杂任务上差距小等情况。
昨天夸国产大模型争气,今天Vidu Q3就霸榜了
国产视频大模型Vidu Q3在国际权威AI基准测试机构Artificial Analysis的最新榜单里,于Video Arena冲到全球第二、国产第一。它是全球首个支持16秒音视频直出模型,声画同出、高清直出,还有镜头控制、多语言文字渲染等优势。