基准构建」共找到 2658 篇相关文章

算法论文8

都说记忆是Agent标配,但MemSyco发现漏算了一件事

厦门大学与吉林大学的最新研究指出,随着大模型Agent具备长期记忆,虽成为“长期协作者”,但也出现Memory-Induced Sycophancy问题。为此提出MemSyco - Bench评测基准,经实验得出多项发现,指出Agent Memory关键瓶颈转变。

PaperAgent
开源动态8

Agent之间,有互联网了!

明略科技开源发布Octo,旨在构建开源可信的Agent协作网络,让人、Agent和外部工具进入同一协作系统。它有三个核心概念、六种协作模式、四个端,推动AI应用从个人工具向组织协作网络迁移。

量子位
开源动态8

单目3DGS迎来突破:影石开源UniSHARP实现全相机适配

影石研究院发布单目新视角合成模型UniSHARP,可通过单次推理秒级获场景高斯点云,支持混合相机训练与免标定推理,适配所有相机。团队还构建数据集、设benchmark,代码等均已开源。

机器之心
新闻资讯7

星海图创始人高继扬:具身智能三层技术路线,没有捷径可走

星海图在第一届全球开发者大会上,展示了其在具身智能领域的战略布局。提出100万小时超高质量真实数据计划,发布新一代VLA基础模型G0.5并开源,还联合发布创业孵化项目「星途计划」,探索三段式商业模式。

量子位
新闻资讯7

汉字防AI作弊!甩英文、拉丁文十几条街

中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉大语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。

CourseAI
新闻资讯7

华为具身大脑一号位创业,用认知科学造世界模型,获亿元级融资

2026年世界模型成AI热门,资本人才汇聚让AI理解物理世界。具脑磐石获亿元融资,由曾任华为云AI算法创新Lab主任的朱森华创立,用认知神经科学重做机器人脑模型,构建认知世界模型。

量子位
新闻资讯7

Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了

近日,Anthropic发布研究,描绘AI正替代哪些工作。其构建“实际暴露度”指标,基于Claude对话数据测得。研究列出10大“高危”职业,也指出部分工作不受影响,还揭示高暴露群体特征及青年招聘情况。

AI前线
新闻资讯8

从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓

4月16 - 18日QCon全球软件开发大会·北京站(2026)圆满举办,超2000人参与。多位技术领袖围绕AI与工程实践分享见解,大会还设25大专题。最后揭晓17位优秀出品人和29位明星讲师。

AI前线
算法论文8

3D生成告别「穿模」噩梦!VASTx清华将蒙皮权重Token化,统一生成骨骼与权重,GRPO微调形变平滑

3D模型生成容易,让它“动起来”难,传统AI蒙皮算法有局限。SkinTokens研究将蒙皮权重离散化,构建TokenRig框架,引入GRPO算法,提升了AI自动绑定精度和泛化能力,助力3D动画自动生产。

量子位
算法论文8

你写的Skill,正在拖慢模型?策略式Gene才是正确答案

EvoMap团队与清华围绕‘Skill拖慢模型’问题研究,提出‘Gene’概念。经实验,Gene在控制模型表现上优于Skill,还定义了GEP协议。其成果在CritPt基准测试表现出色,为Agent经验复用提供新方向。

机器之心