自动评测体系」共找到 1696 篇相关文章

开源动态8

猛涨25k star!一键检测你的电脑能跑哪些大模型!

最近 Github 出现工具 `LLMFit`,用 Rust 编写,能自动检测硬件配置,判断大模型能否流畅运行,推荐最优量化版本和运行模式。有一键硬件检测等特性,安装使用方便,降低本地部署门槛。

开源先锋
开源动态8

RF-DETR-首个突破60 AP的实时检测器(附实战教程)

RF-DETR在COCO数据集上,实时检测精度首破60 mAP,兼顾实时性与高精度。它通过NAS找到Transformer实时运行的‘最优解’,迭代快,适用于多场景,还给出完整实战教程。

机器学习AI算法工程
算法论文8

分享2篇最新Harness论文,一篇谷歌,一篇微软

在LLM Agent迅速发展的当下,如何为其设计合适的Harness成关键问题。本文分享微软M⋆和谷歌AutoHarness两篇论文,分别从记忆系统和动作约束维度提出自动化的Harness进化方法,并介绍了实验结果。

PaperAgent
新闻资讯8

斯坦福2026 AI指数报告!中美差距已实质性抹平

斯坦福HAI发布2026年度人工智能指数报告,显示中美在顶级大模型性能上差距已实质性抹平。报告还呈现了AI能力进化、算力格局、智能边界、安全监管、人才流动等多方面情况。

AIGC开放社区
推荐文章7

用好Agent最重要的技巧不是Skills,是这四个字。

作者分享使用Agent心得,强调“约束先行”,以Claude Code工作文件夹混乱为例,阐述顶层约束的重要性,介绍其规则体系,还展示全局CLAUDE.md文档,指出约束能让Agent工作更有序。

数字生命卡兹克
新闻资讯7

断层碾压Seedance 2.0:神秘「欢乐马」空降榜首,视频AI变天了

周二晚间,代号「HappyHorse - 1.0」的神秘视频生成模型在 Artificial Analysis 平台空降榜首,不论文字生视频还是图像生视频都排第一,拉开 Seedance 2.0 很大差距,不过在「视频 + 音频」综合排名上屈居第二,引发诸多猜测。

机器之心
推荐文章7

企业AI智能体大排雷:138场顶级分享抖出的落地实情

AI智能体重塑软件工程,研究团队分析138场演讲发现搭建时精力多花在工程集成和接口对接。文章结合推理模型与人工校验,介绍企业引入智能体的架构策略、演进历程、应用差异及技术底座等内容。

AIGC开放社区
开源动态8

字节版龙虾架构火爆GitHub!开源获35k+ Star,内置Skill全家桶,原生适配飞书

字节开源Deer - Flow2超级智能体管理框架,登上GitHub Trending榜首,获35.3k Star。它采用模块化多智能体架构,主打开箱即用,扩展性强,适配多种IM渠道,还介绍了核心能力、部署方式等。

量子位
产品应用8

龙虾也能当导演了!LibTV解锁全自动拍片,一句话从剧本干到成片

LiblibAI推出AI视频产品LibTV,是一站式AI内容创作社区。它把人和Agent当平等用户设计,人类可自由操控画布创作,也能让Agent一句话全自动出片,还集成多种模型,定价有竞争力。

量子位
推荐文章8

被美国遣返、禁止入境 5 年,他在温哥华的卧室里做出了日处理 400 万工作流的 AI 平台

Gumloop联合创始人兼CEO Max Brodeur - Urbas,曾被美国遣返并禁入5年,他批判AI营销泡沫,认为应‘AI加持而非替代’,强调21 - 23岁创业窗口期,还分享了创业历程与AI使用见解。

宝玉AI