UI自动化测试框架」共找到 2235 篇相关文章

算法论文7

AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?

研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。

新智元
开源动态8

Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍

Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为大模型部署提供实用方案。

AIGC开放社区
算法论文8

Multi-Agent记忆系统MIRIX:比RAG性能飙升35%,存储减少99.9%

现有AI Agent记忆方案有局限,MIRIX作为模块化多智能体记忆系统应运而生。它由六种记忆类型和多智能体框架组成,支持多种检索功能。在多模态和单模态测试中表现优异,为记忆增强型LLM智能体设新标准。

PaperAgent
算法论文8

ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境

北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。

机器之心
产品应用8

别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程

作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。

AI产品黄叔
开源动态8

刚刚,美团开源全模态龙猫模型,和 ChatGPT 大战 100 回合打得难解难分

美团发布开源全模态 MoE 模型 LongCat-Flash-Omni,参数 560B 激活 27B。它有真正全模态能力,采用创新架构和训练范式,基准测试表现亮眼,部分指标超 Gemini-2.5-Flash,引发网友热议。

AGI Hunt
开源动态8

3.6K Star 开箱即用!开源Agentic浏览器,Perplexity Comet最强平替!

传统浏览器缺乏AI自动化能力,新兴的Perplexity Comet又有云端依赖和费用高的问题。开源的Agentic浏览器BrowserOS可作其平替,有AI聊天扩展等组件,功能强大且跨平台,能带来安全智能的浏览体验。

开源星探
产品应用8

北大出品:全球首个支持生成华为鸿蒙应用的AI Agent来了

华为2025开发者大会上,华为终端CEO何刚点名「码上飞」AI Agent。它利用多智能体系统技术,实现开发全流程自动化,用户用自然语言提需求就能生成应用,实测5分钟可开发出睡眠助手app。

AI寒武纪
产品应用8

搜攻略到凌晨3点?飞猪AI“问一问”用1张表谋杀废话

作者用旅游方案提示词测试各类Agent产品,多输出废话。飞猪“问一问”旅行Agent却很厉害,能生成实用旅行规划,还给出汇总表格、地图、行程卡片等,考虑全面且细节丰富,还能找特价机票。

歸藏的AI工具箱
开源动态8

阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜

阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。

量子位