「Agent评测」共找到 3194 篇相关文章
Claude Skills彻底火了,真的比 MCP 简单太多了。
Claude Skills在中文社区火了,它解决重复写提示词、token贵及定制难的痛点,可分层加载给上下文窗口减负。它能与MCP组合,官方开源20多个Skill源码,还代表了Agent能力模块化趋势。
搜索智能体RAG落地不佳?UIUC开源s3,仅需2.4k样本,训练快效果好
当前 Agentic RAG 落地有挑战,UIUC 和 Amazon 提出 s3 训练范式。它仅需 2.4k 样本,训练快且效果好,解决了优化目标偏离、检索与生成耦合等问题,在通用和医学 QA 任务中表现出色。
Chimer AI 黄祯:自然而然地干了离经叛道的事 | 00 后创业者系列
本文是对 00 后创业者黄祯的访谈。他大学休学创业,先尝试珠宝等行业,后聚焦服装产业。起初做 SaaS 工具,因国内市场不佳转向 Agent 与 SaaS 结合,还获吴世春融资,分享了创业经历、思路及产品特点。
终于用上啦,3.9 万 Star archify,程序员福音!!!!
架构图常与代码脱节,约3.9万Star的archify让Agent先把代码库或系统描述写成带类型的JSON,经布局、检查后交付可交互系统地图,它先结构化、验证再交付,适用于特定场景。
2亿枚AI芯片大爆发,人类最大基建集体开工!
全球投入使用的AI芯片总算力相当于约2000万枚英伟达H100芯片,预计到2028年底达2亿枚。数据中心进入百万级算力时代,投入资金巨大。算力提升使模型和Agent能力增强,AI还参与自身研发优化。
世界模型的新用途:不做选手,去当裁判
眼下具身赛道都在抢着做机器人的“大脑”,而地瓜机器人发布的世界模型Uranus却剑走偏锋,做机器人开发的基础设施。它能更客观地评测VLA和世界模型,还能做机器人训练的“场地”。
盘点16个把自己蒸馏成Skills的国民级App。
作者盘点16个将自身能力封装成Skill或MCP的国民级App,涉及餐饮、出行、办公等领域,如瑞幸咖啡、飞猪、飞书等,还提到部分AI产品集成第三方服务情况,指出向全面Agent化过渡的趋势。
给 OpenClaw 装上“全网眼睛”:我把这个 3K+ Star 项目果断集成到了个人skills里。
作者用OpenClaw /Claude Code读推特遇难题,各平台上网关卡多。后发现开源2天获1.1K Star的Agent - Reach项目,将上网工具统一打包,技术选型实用,强调AI时代想法和判断力比技术重要。
AI“租人”平台一夜爆火:时薪3500、2.4万用户抢着“卖身”,专家:警惕劣币驱逐良币
RentAHuman.ai网站上线,让AI可通过接口雇佣人类执行线下任务,上线一天访问量破50万,超2.4万用户“挂牌待租”。该模式引发热议,专家认为其凸显Agent“存在感”,但只是阶段性方案。
NIPS2025|小红书智创AIGC团队提出布局控制生成新算法InstanceAssemble
当下文本生成图像扩散模型有进展,但现有布局到图像生成方法在复杂场景表现不佳。小红书智创AIGC团队提出InstanceAssemble框架,从架构和评测应对难题,实现复杂布局下精确图像生成,有广阔应用潜力。