智能体评估」共找到 4035 篇相关文章

开源动态8

一个框架,重塑具身研发流程:Dexbotic走向具身PyTorch

开源具身智能原生框架 Dexbotic 宣布支持 RLinf 作分布式强化学习后端,打通 VLA 模型研发中「SFT 与 RL 割裂」问题。其 2.0 版实现模块化解耦与多源混训,构建开发闭环,孵化出 DM0 大模型。

机器之心
算法论文8

告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍

视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。

机器之心
开源动态7

Meta-Harness:让AI 改进自己的Harness

斯坦福IRIS实验室Yoonho Lee团队推出开源框架Meta - Harness,让AI自我优化流程。它像给AI用的‘时间机器’,记录源代码、执行轨迹和评估分数。在任务上表现出色,但也面临耗时、数据爆炸等挑战。

AI工程化
新闻资讯8

硅谷前沿访谈:CUDA之父复盘英伟达20年护城河,揭开万亿算力帝国的底牌

奇点智能研究院院长李建忠采访了“CUDA 之父”Ian Buck,探讨 CUDA 20 年演进、英伟达技术产品及生态。Ian Buck 介绍了 AI 基础设施新阶段,阐述 CUDA 成功原因,还谈及英伟达软硬件协同、应对竞争等问题。

AI科技大本营
产品应用7

GEAClaw 来了:企业级“OpenClaw”,一只有商业头脑的龙虾

文章指出当前大语言模型解决问题多为收敛式,与商业问题需先发散再收敛的方式相悖。特赞发布企业级智能系统GEA,其架构四层分工明确,能在市场洞察、社媒增长等场景发挥作用。

AI寒武纪
算法论文8

人大高瓴孙浩团队发表Nature子刊封面文章:基于并行符号枚举的物理定律发现

中国人民大学高瓴人工智能学院孙浩教授团队在《自然 - 计算科学》发表封面论文。提出PSE框架解决符号回归瓶颈,通过公共子树复用和GPU并行提升评估效率,实验表现优于现有方法,也指出了局限性与未来方向。

力学与人工智能
算法论文8

ICLR-26腾讯混元:Agent是强大的,但用户是狂野的

现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。

PaperAgent
新闻资讯8

种子轮10.3亿美元!谢赛宁加入,LeCun的世界模型公司太吸金了

图灵奖得主 Yann LeCun 创办的先进机器智能实验室(AMI)官宣起航,完成 10.3 亿美元种子轮融资,估值 35 亿美元,谢赛宁加盟。AMI 目标是做理解现实世界的 AI,想走世界模型路线。

机器之心
开源动态8

字节开源版Seedance发布,超越Sora 2!

字节Alive团队发布开源版Seedance 2.0,在人类评估中超越Sora 2等。它通过统一架构、时空对齐技术和非对称训练策略,解决声画不同步和画质音质难两全问题,还建立数据流水线和测试基准。

AIGC开放社区
新闻资讯8

演讲 | 强化学习之父 Sutton 隔空回应 Hinton:目前的 AI “理解不足,调参有余”

强化学习之父 Rich Sutton 在 UCLA 演讲《AI 的未来》,指出当下 AI“理解不足,调参有余”,是“脆弱的心智”。他定义智能,倡导建立统一心智科学,认为应从“人类数据时代”进入“经验时代”,还谈及 AI 政治与哲学。

AI科技大本营