「Agent评估」共找到 3330 篇相关文章

推荐文章7

所有Harness终将长成“龙虾”,但最后活下来的只有几只

在用户需求驱动下,工具从 LLM 向 Agent、Harness 再到 Claw 自然进化,但用户能容纳的 Claw 有限。Sam Bhagwat 拆解进化路径,指出各阶段核心竞争力,开发者应抢占用户心智空间。

InfoQ
产品应用7

吴恩达手搓新项目:AI审稿人上线!只为终结学生“3年被拒稿6次”的痛苦

吴恩达开发新项目 Agentic Reviewer 代理审稿人,灵感源于学生3年论文被拒6次。此工具能加快研究人员迭代速度,在 ICLR 2025 评审数据测试中接近人类水平,适用于 arXiv 公开研究领域。

AI寒武纪
新闻资讯7

谷歌发76页智能体白皮书!你的「AI替身」已上线

谷歌发布76页AI智能体白皮书,剖析其应用前景。涵盖智能体运维、评估方法,探讨多智能体架构,还介绍智能体增强检索生成及企业应用,如NotebookLM企业版、Agentspace空间企业版等。

新智元
新闻资讯7

刚刚,Cursor 版 Github 上线

昨天 GitHub 宕机,Cursor 团队趁势宣布代码托管平台 Origin 面向付费用户推 Beta 版。Origin 为 Agent 规模工作流设计,有代码仓库管理等功能,性能数据挑衅,此前曾提前曝光又撤回。

AGI Hunt
算法论文8

让沉默三千年的甲骨开口:首个模仿人类专家工作流的辅助释读系统

近日,华中科技大学等联合团队推出首个模拟专家释读流程的人工智能系统AlphaOracle,辅助甲骨文破译。它整合多类资料,形成证据链,经专家评估,有较高评价且能节省分析时间。

新智元
新闻资讯7

The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出

OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。

DeeplearningAI
开源动态8

北大开源统一世界模型框架:多类合成推理任务一套搞定

世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合多方推出OpenWorldLib推理框架,整合多模态能力,构建标准化接口体系,在多任务上评估效果良好,降低研发门槛。

量子位
开源动态7

分享一个 OpenClaw 装机必备 Skills 库

腾讯推出代装龙虾公益活动引关注,OpenClaw创始人也转发。GitHub上的awesome - openclaw - skills项目爆火,收录超五千个OpenClaw装机必备Skill,覆盖多场景,还呈现AI Agent发展趋势。

特工宇宙
新闻资讯7

2026年,AI初创全球化的「变与不变」|沙龙招募

当OpenClaw掀起开源浪潮、Agent应用频现,AI团队面临全球化命题。量子位将发起出海沙龙,聚焦出海早中期决策与路径,招募全球化实践者、参与者和投资机构,设置多环节交流。

量子位
产品应用7

别再让语音机器人“答非所问”:AI Force任务型语音对话技术总结

本文围绕企业级任务型语音Agent核心挑战,提出解决“拟人化”与“专业化”问题。介绍三段式语音对话解法、架构演进,还提及‘衍算’推理框架等技术及未来方向,团队来自蚂蚁集团AI force。

阿里云开发者