自动化评估工具」共找到 2864 篇相关文章

开源动态8

19K star 霸榜,下一代的浏览器自动化神器!

做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。

开源先锋
推荐文章7

大模型评估排障指南 | 关于 LaTeX 公式解析

这是大模型评估排障指南系列第二篇,聚焦 LaTeX 公式解析。评估难点是解析和比较模型输出与标准答案,无标准方法。lm - evaluation 框架用 sympy 解析准确率约 0.94,还给出缓解问题办法。

Hugging Face
新闻资讯7

安全噩梦:Docker 警告 MCP 工具链中存在的风险

Docker 发文警告,基于 MCP 构建的 AI 开发工具存在安全漏洞,如凭证泄露、代码执行等。MCP 协议发展快但部分实现有隐患,Docker 分析发现诸多漏洞,还提出强化方法应对。

InfoQ
产品应用7

临时文件自动归档工具|解放双手,杂乱文件自动整理归档!

乡长分享基于AutoHotkey V2等4种AI工具开发的临时文件自动归档工具,可解决文件混乱问题。它能监控指定文件夹,自动搬运归档符合条件的文件,新版本功能强大,操作简单。

AI Build Lab
开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。

InfoQ
新闻资讯7

安全噩梦:Docker 警告 MCP 工具链中存在的风险

Docker 博文警告,基于 MCP 构建的 AI 开发工具引入安全漏洞,如凭证泄露等。MCP 发展迅猛但部分实现有隐患,Docker 分析发现广泛漏洞,还提出强化方法应对风险,其他厂商也有类似担忧。

AI前线
新闻资讯7

工作场景AI化,一个月花100美元订阅AI工具值吗?

AICon 全球人工智能开发与应用大会 2025 北京站即将召开,InfoQ 直播栏目邀请来也科技胡一川、阿里汤威、美团邹明远、快手王东旭探讨 AI 时代「10x 个体」与「10x 组织」,分享落地路径、效率提升及工具使用经验。

AI前线
推荐文章7

告别工具焦虑:2026年真正值得用的8款AI效率外挂

文章指出2026年是‘AI深度融合’元年,工具使用进入‘重塑工作流’阶段。作者筛选出Gemini全家桶、OpenCode等8款‘硬核’AI工具,介绍其特点和优势,如多模态、不设限、易用等。

鲸选AI
开源动态7

画个图就能管理知识?这个开源工具把笔记和画板合二为一了

作者发现开源工具Revezone,它将白板和笔记合二为一,解决图文割裂问题。有Excalidraw、Tldraw白板及类Notion笔记功能,还支持拖拽分屏。提供线上和桌面版,适合多类人群,优势明显且免费。

小华同学ai
算法论文8

InfoDeepSeek:首个开放网络环境下的智能体信息搜寻质量评估基准

上海交通大学与华为诺亚方舟实验室联合推出InfoDeepSeek,它是首个评估真实动态网络环境下智能体信息搜寻质量的基准。该基准有挑战性问题、真实动态环境等亮点,还开展实验揭示智能体行为特性。

AI科技评论