自演进评测」共找到 1873 篇相关文章

开源动态8

开源不到一天1.9k星星!NVIDIA新突破,机器人ChatGPT时刻!

NVIDIA开源ProtoMotions3框架,用经典回归预测和物理仿真,让高级行为涌现。它能助力机器人多方面学习,有望降低人形机器人开发门槛,虽处研究阶段,但提出新思路。

GitHubStore
开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
算法论文8

Self-evolving Agents过程并非总是良性的,要警惕这些“错误进化”风险

近年来,基于大语言模型的智能代理成为热点,进化代理可我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径的风险,还提出缓解策略,呼吁重视其安全性。

深度学习自然语言处理
开源动态7

OpenClaw长期记忆:优秀管线与玄学效果

文章拆解 OpenClaw 记忆系统全链路,指出其虽设计理念好,但记忆效果不稳定。介绍 RDSClaw 记忆插件如何补强,该插件与原生系统协作,提升记忆稳定性,在 LoCoMo10 评测中成绩显著。

阿里云开发者
新闻资讯8

字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军

字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。

AGI Hunt
开源动态8

代码暴减99%!港大开源“纳米级OpenClaw”,仅4000行代码复刻OpenClaw核心战力!

香港大学数据智能实验室开源“纳米级 Clawdbot”Nanobot,代码仅 4000 行,复刻 OpenClaw 核心功能,瘦身 99%。它具备成熟智能体能力闭环,学习成本低,带四个实用模板,支持一键安装。

开源星探
产品应用8

大涨240%,Doc-Researcher确立多模态文档深度研究新范式

在ChatGPT引领的AI革命中,大语言模型面对专业复杂文档常“束手无策”。Doc-Researcher提出三位一体解决方案,构建M4DocBench评测,性能远超现有方案,还适用于多产业场景。

PaperAgent
算法论文8

你的 AI 助理一闭嘴就在「发呆」?上交大 ProAct:把 Agent 的空闲时间变成生产力

上海交通大学 APEX 实验室提出 ProAct 架构,能把对话空闲时间转化为主动准备机会。它有预测、筛选、交付三级流水线,经 ProActEval 评测效果佳,证明算力用对地方更重要,让 Agent 能提前为用户准备。

AI科技评论
算法论文8

杜克大学、Zoom推出LiveMCP‑101:GPT‑5表现最佳但未破60%,闭源模型Token效率对数规律引关注

杜克大学与Zoom研究者推出LiveMCP - 101,这是针对真实动态环境的MCP - enabled Agent评测基准。含101个任务,实验显示先进模型成功率低于60%,研究为提升Agent能力提供改进方向。

机器之心