评测维度」共找到 797 篇相关文章

算法论文8

给你一群顶尖AI,如何组队才能发挥最大战力?UIUC用一个新的多智能体协作基准寻找答案

现有的评测基准无法衡量多智能体系统内部的协作效率、沟通质量和竞争策略。为此,伊利诺伊大学厄巴纳 - 香槟分校的研究者推出 MultiAgentBench,能全面评估 LLM 多智能体系统协作与竞争能力。

机器之心
开源动态8

开源Agent新标杆:通义WebSailor多榜夺魁,挑战OpenAI高难度Agent基准BrowseComp

信息爆炸时代,传统搜索引擎难满足需求,开源Web Agent在极端复杂任务表现不佳。阿里巴巴通义实验室推出WebSailor,通过创新数据构造和训练方法,在BrowseComp等挑战上取得突破,缩小与顶级封闭系统差距。

机器之心
产品应用8

kimi 的RL end2end ON LLM

文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。

Agent的潜意识
算法论文8

一文读懂深度表格数据表示学习 | 南京大学

南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。

量子位
算法论文8

T-RO综述重构Foundation Model时代机器人操作知识版图

近日,论文《Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives》被IEEE Transactions on Robotics接收,它以High - Level Planning和Low - Level Action Modeling为主线,梳理Foundation Model时代机器人操作发展,分析了现存问题及关键缺口。

机器之心
新闻资讯8

OpenAI Astra发布在即,全自动网络攻防能力已突破天际!

OpenAI即将发布的模型Astra,在内部评测中获ExploitBench满分,还发现两个零日漏洞。它能力远超上一代GPT - 5.6 Sol且更听话。不过为安全考虑,OpenAI部署监控,还放慢其研究速度。

新智元
开源动态8

阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航

阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。

阿里云开发者
8

AI Infra入门干货总结:大模型是如何高效推理的

作者深入研读vLLM源码,以Llama 3为例,聚焦Decoder-Only架构LLM,介绍推理各环节及张量维度变化,讲解连续批处理和Paged Attention概念,还阐述推理流程、采样策略等,最后总结相关拓展内容。

腾讯技术工程
新闻资讯8

深度|Karpathy为何突然加入Anthropic,只能当Dario的「-2」?

5月19日,OpenAI联合创始人Andrej Karpathy宣布加入Anthropic预训练团队。他将组建新团队,用Claude加速预训练研究。文章分析了他加入的原因,以及Anthropic招聘他的动机,还指出这一变动标记着技术拐点。

新智元
开源动态7

这张信息图,居然是8B开源模型做的??

商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。

花叔