智能体基准」共找到 4093 篇相关文章

新闻资讯8

陈天桥旗下AI公司MiroMind打造全球顶尖预测型大模型,性能登顶行业基准

全球首个动态实时LLM智能未来预测基准FutureX推出,陈天桥旗下MiroMind团队连续两周蝉联冠军。其模型采用记忆驱动机制,为预测与决策设计,还展现了在多领域的预测能力,且将开放相关框架和模型。

机器之心
算法论文8

1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿

上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能的三步。

PaperAgent
开源动态8

【GitHub 10.9k star】DeepCode:把论文和需求文档“一键变代码”的多智能开发神器,真能干掉手写样板?

DeepCode 是香港大学开源的多智能开发平台,支持将论文、需求文档等转化为生产级代码。它能解决论文复现、原型开发等痛点,有多项特色功能,在性能对比中领先,适用于多类场景。

小华同学ai
新闻资讯8

中国AI创业者重登GTC舞台:杨植麟用技术语言讲了一个智能上限突破的浪漫故事|甲子光年

美国当地时间3月17日,月之暗面(Kimi)创始人杨植麟在英伟达GTC演讲,介绍Kimi技术路线图。他提出开源模型要出色,给出Token效率、长上下文、智能集群三个概念,还探索了未来架构,且将创新开源。

甲子光年
开源动态8

智源RoboBrain 2.0+RoboOS 2.0双发:问鼎评测基准最强具身大脑,刷新跨本多机协作技术范式

近日,智源研究院发布具身大脑 RoboBrain 2.0 32B 版与跨本大小脑协同框架 RoboOS 2.0 单机版。前者突破能力瓶颈,在多项基准测试表现优异;后者性能提升,实现轻量化部署。二者双擎联动推动机器人迈向群智能,且已全面开源。

机器之心
新闻资讯7

Token售卖已无溢价、大模型公司转型“系统商”?记忆张量 CTO 李志宇:智能能力会拉开差距,长期记忆与状态管理成竞争核心

InfoQ 采访记忆张量 CTO 李志宇,他指出 Scaling up 经济效益下降,大模型公司正变系统公司,核心是长期记忆与状态管理能力。2026 年若模型无代际差,价格战或加剧。智能是主赛道,但现有模型推理能力不足。

InfoQ
算法论文8

大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位
算法论文8

DeepMind再登Nature:AI Agent造出了最强RL算法!

Google DeepMind团队提出DiscoRL,让智能在多环境交互中自主发现强化学习规则,无需人类设计。它在Atari基准中击败MuZero,在未见过的游戏中也稳定高效,相关研究登《Nature》。

新智元
开源动态7

月之暗面硬刚Anthropic!开源万亿参数Kimi K2,Agent编码性能直逼闭源最强!

上周五月之暗面发布并开源万亿参数Kimi K2,外网评价高。它或开启开源AI的“Agentic时代”,在智能和编码基准上表现出色,成本远低于竞品,但推理速度较慢,已可平替Claude。

探索AGI
算法论文7

谷歌研究院探索多智能协调的扩展原则

谷歌研究院对180种智能配置对照评估,得出‘AI智能系统首批定量扩展原则’。发现多智能协同效果因任务而异,还指出工具使用瓶颈等问题,且开发预测模型辅助架构选择。

InfoQ