结构化评估」共找到 1779 篇相关文章

算法论文8

颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5

十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。

新智元
开源动态8

我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准

在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。

机器之心
开源动态8

Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%

为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。

AINLPer
开源动态7

开源半自动交互工具

Automat 目标是半自主玩各种游戏,是构建通用计算机交互环境首步。目前功能限于键盘宏录制和回放,不稳定。它是进行中的项目,路线图有激进新功能。文中介绍下载、运行方法及项目地址。

GitHubStore
产品应用7

突发!Claude Code 要彻底龙虾

Claude官方宣布支持Telegram或Discord消息渠道,后续可能接入更多。Claude Code新增Channels功能,Cowork新增Dispatch功能。不过Anthropic要构建类似OpenClaw版本,还有差距。

AI寒武纪
新闻资讯7

公众号正在头条

2025年超60%公众号运营者发现,粉丝被算法收归平台。从2020年起,订阅号改成信息流展示,推荐流量占比最高达90%。这对小号是机遇,但也带来内容陷阱等问题,还重塑用户认知,平台也面临商业和生态的博弈。

白杨SEO优化教程
新闻资讯7

思维外包!AI正在“废掉”我们的大脑

当下“AI是否会抢走工作”讨论火热,亚马逊CEO称重复性岗位将被取代。但更危险的是,对AI过度依赖或“废掉”大脑,催生“思想懒汉”,在教育领域体现尤令人担忧。

AI工程化
推荐文章7

上下文工程又进了:Harness实现AI完全自主

近期Harness Engineering讨论火热,Harness是围绕AI模型的支撑架构,Anthropic用其突破AI局限,解决AI完成复杂任务时的偷懒问题,还通过多智能体架构用于前端设计、软件开发,经实战检验效果良好,后续还对其进行简

AIGC开放社区
算法论文8

从Demo到行业落地的Agents:技术、应用与评估

通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量‘爬级’路线。

PaperAgent
推荐文章8

从Vibe Coding到Harness—— 一套大仓AI工程实战

这是腾讯后端微服务与前端微应用大仓的 Harness 实战分享。介绍了 TAB 工程背景、Harness 组成部分,阐述阶段划分、Agent 演进等,还提及人工关卡、门禁脚本等要点,总结了经验与限制。

腾讯技术工程