「自动化评估」共找到 1147 篇相关文章
通义实验室正式开源 Mobile-Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI-Owl-1.5
通义实验室正式开源 Mobile - Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI - Owl - 1.5。该模型有多档参数可选,分 Instruct 和 Thinking 版,支持多平台。它解决了高质量数据难搞定等痛点,评测表现良好。
Claude深夜彻底「虾化」!一句话接管电脑打工,手机指挥7×24小时不停
Claude获批全自主接管全球打工人的电脑,能自主访问并操作各类软件。只需手机发指令,它就能干活。Anthropic还在研发手机使用功能,敲/schedule命令能让Claude定时工作,成全天候员工。
居然 11.5K star 了,这个一人公司的秘密项目有啥魔力!
做自媒体和内容运营重复工作多、效率低。开源项目`AiToEarn`用AI+自动化整合内容创作、发布等环节,支持多平台,有11.5k+ star,还介绍了安装使用方法。
刚刚,MiniMax直接让龙虾学会自我进化,也认识「马嘉祺」了
在 GTC 2026 大会上,英伟达推出 NemoClaw。国内 MiniMax 加快‘AI 养虾’布局,推出 MaxClaw 模式。新发布的 M2.7 能力升级,在多方面表现出色,还在科研评测中获佳绩,实测效果良好,开启自我进化。
规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注
为提升 Dropbox Dash 生成回复的相关性,工程师采用大语言模型辅助人工标注。该方案解决了纯人工标注的局限,通过人工校准大语言模型标注的方法,为 RAG 系统提供了有价值参考。
Anthropic 估值 3800 亿,增长营销只有 1 个人,还不会写代码
Anthropic估值3800亿美元,增长营销团队仅一人。该负责人用Claude Code搭建自动化工作流,完成传统团队多人的活。不止营销部门,其他部门也用它提效,反映OPC趋势。
OpenClaw 走红背后:Agent、AI Coding 与团队协作的新问题
InfoQ《极客有约》X QCon 直播栏目邀请专家探讨 OpenClaw 爆火背后的问题,如 Agent 能否进入研发流程、AI 写代码边界等。专家认为 OpenClaw 并非低门槛产品,AI Coding 需解决可控问题,团队落地要平衡 SPEC 和 Vibe 模式。
2026 AI Memory最新综述:从理论到实战,一文读懂AI记忆的进化全景
2026年北邮百家AI MemoryOS团队联合华为发表《Survey on AI Memory》,涵盖AI记忆理论基础、分类体系、架构、评估方法与前沿趋势,还提出4W分类法,剖析了发展挑战与未来方向。
刚刚,Anthropic分享了构建Skills的最佳实践
Anthropic获300亿美元融资,估值达3800亿美元,发布《The Complete Guide to Building Skills for Claude》指南。介绍Claude Skills本质、与MCP关系、应用场景、技术实现、设计模式及测试迭代方法。
速度提升,能力却暴跌?扩散模型做智能体的残酷真相
南洋理工大学陶大程教授团队联合发布评测报告,揭示扩散语言模型在智能体能力上有系统性缺陷,落后自回归模型。还分析其失败原因,提出评测框架,明确能力边界并给出研究建议。