「高层测试闭环」共找到 2069 篇相关文章
无需多视角,单图重建可交互3D模型!南洋理工开源结构推理框架
南洋理工大学团队提出MonoArt,将单目可动物体重建建模为渐进式结构推理过程,通过四个关键模块逐步推理,无需外部先验,在PartNet - Mobility基准测试中表现领先,兼顾推理效率,还可用于下游任务。
月耗3000美金的Skills重度用户,实测MiniMax M2.7:国产Agent模型的天花板?
AI产品黄叔作为月耗3000美金的Skills重度用户,实测MiniMax M2.7,从多Agent协作、Coding能力、办公自动化等多方面测试,发现其表现出色,虽有不足,但在多维度已是国产模型天花板。
评估工程正成为下一轮 Agent 演进的重点
文章指出传统软件工程测试方法难用于 AI 系统,促使评估工程成 Agent 演进重点。它贯穿 AI 生命周期,正走向体系化。介绍评估工程发展阶段,还提及阿里云 RM - Gallery 和云监控 2.0 实践。
首个多轮LLM Router问世, Router-R1可让大模型学会「思考–路由–聚合」
在大语言模型种类爆炸的时代,如何智能分配任务成新挑战。伊利诺伊大学香槟分校团队发布 Router - R1,让 LLM 学会‘思考–路由–聚合’,用强化学习平衡性能与成本,在七大基准测试表现出色。
95% 企业 AI 投资无回报?华为云 × 合力亿捷:客服 Agent 给出解题思路
麻省理工报告显示 95% 企业生成式 AI 投资无回报,但指出办公自动化等领域回报率高。客服 AI Agent 是热门方向,华为云与合力亿捷合作的方案解决行业痛点,打通数据闭环,有示范意义。
16K星 Zep凭一张“动态记忆图”吊打一众Graph RAG
现有的RAG框架多依赖静态文档检索,无法满足企业对动态知识整合的需求。本次分享的Zep提供新型智能体记忆层服务,通过核心组件Graphiti动态整合数据,在LongMemEval基准测试中表现出色。
腾讯混元CL-bench续作发布,让大模型读懂你的日常生活
腾讯混元团队推出CL - Bench Life,用于精准衡量AI在现实生活中的“上下文学习”能力。测试12个语言模型,结果显示模型处理高噪声零碎context能力不足,揭示当前顶尖AI模型还远未读懂日常。
真钱买假模型?187篇论文被「套壳API」坑惨,准确率暴跌
CISPA论文指出,第三方影子API可能用廉价替代品替换前沿大模型。研究追踪17个服务,发现已被187篇论文引用。测试显示,影子API在多领域性能差,安全不可控,供应商有三种欺骗手段。
重复一下提示词,Gemini准确率竟从21%飙升至97%!
Google Research团队研究发现,重复提示词可让Gemini准确率从21.33%升至97.33%。该策略能提升主流大模型非推理任务表现,在多模型多基准测试中优势明显,且不增加延迟。
Claude Chrome 插件使用体验:强大,但有点慢
作者分享Claude for Chrome插件使用体验,介绍使用流程,测试让其查看马斯克推文,结果准确。该插件能力强且通用,但存在慢、焦点抢占问题,还提到与deepresearch及云厂商设备的差异。