「评测体系」共找到 1162 篇相关文章
卧底房产AI三天后,我发现地产圈的「信息差」,正被这样一铲到底!
文章测评房产AI工具CRIC深度智联,让其与OpenAI、Google、Anthropic旗下通用AI比拼写地产研报。结果显示,CRIC以独家行业数据库实现降维打击。此外,它还有普通和专业两版,适用不同人群,也指出AI有边界。
轻量级开源AI多智能体框架!智能路由+上下文管理,前后端接口支持!
随着多智能体系统成对话式AI新趋势,GitHub现轻量级高灵活性多AI智能体协调框架Agent - Squad,它能实现多智能体协作、路由和上下文共享,支持双语言,部署灵活,功能强大且安装友好。
RSI离我们有多远?这家中国团队给出了第一梯队的工程解
目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。
VC开始靠AI预测未来了
七月,DigClaw的预测框架Rhizome v1在FutureX评测平台取得优异成绩,支持了预测能力可沉淀在基座模型之外的判断。大语言模型不擅长预测,而DigClaw构建了以因果结构为骨架的预测基础设施。
UCSD谢澎涛创业:用AI搞科研,4小时交付顶刊水平成果,已获数百万美金融资
谢澎涛团队推出面向AI for Science的AIBuildAI Science Agent,在NatureBench评测中排名第一,超多数通用编程智能体。该智能体可独立完成模型研发,效率大幅提升,还探讨了其能力边界、应用及对行业的影响。
相比层出不穷的 Agent 框架,不变的 Agent Protocol 是什么
文章围绕 Agent Protocol 展开,指出框架更迭但生产级 Agent 系统问题不变。以 Agent Protocol 为主线拆分 Agent Runtime,探讨其核心、稳定对象、执行模型等,还对比各框架在多维度的表现并给出设计建议。
Coding Agent 在百度的落地实践:从反馈闭环到工程范式重构
本文整理自百度文心快码研发经理牛万鹏演讲,介绍了Coding Agent在百度的落地实践。包括落地成效、Agent Loop框架问题、Feedback Loop构建、Benchmark评测及Agent Engineers理念,还提及企业级Agent落地的工程问题。
AI公司烧不起Token了!国产Agent杀出,逼近Opus 4.6还免费
Token成AI时代“电力消耗”,企业成本压力大。昆仑万维推出高性能Agent模型SkyClaw - v1.0及轻量版,性能逼近顶流,价格低且限时免费。经实测能力强,其训练体系独特,未来还将开源。
监管正式落地严查,全国首部AI产品合规标准来了
自2023年相关办法发布,国家监管网越织越密,AI产品合规成企业必答题。《生成式人工智能产品安全与合规指南》团体标准应运而生,构建全生命周期合规体系,有全链路、全场景、全配套亮点,还公开征集起草单位与专家。
CVPR 2026|用互联网视频替代3D标注:通研院团队打造SceneVerse++「最大规模」真实3D场景数据
北京通用人工智能研究院团队在CVPR 2026接收论文中,提出自动化数据引擎,用互联网视频构建SceneVerse++数据集,规模超现有同类,在3D检测、VQA、VLN任务提升性能,还指明3D空间智能发展方向。