「评测环境」共找到 1065 篇相关文章
突破泛化瓶颈:阿里云智能运维 Agent 评测体系实践
大模型 Agent 在智能运维场景落地常遇泛化难题。阿里云李也博士介绍利用评测集验证和提升智能运维算法泛化性的实践,阐述评测集重要性、构建方法,还展示其在提升智能运维 Agent 能力上的成效。
彻底说清 Human-in-the-Loop【下】:分布式环境下的挑战与应对
本文继续探讨如何将HITL Agent扩展到分布式环境,介绍分布式环境下的挑战与应对、实现分布式的HITL Agent、实现客户端的故障恢复及服务端的故障恢复建议,还给出演示代码参考。
让AI评测AI:构建智能客服的自动化运营Agent体系
文章介绍智能客服发展,从传统机器人客服到基于AI原生的智能客服。重点探讨对话效果评测,搭建运营Agent平台,实现服务闭环。还提及评测落地方法、难题及解决措施,最后阐述AI在服务链路提效和分析转人工原因的作用。
从3632个漏洞看AI时代的评测基准重构!VulnGym基准发布
随着新一代漏洞检测工具出现,漏洞检测走向理解业务风险。腾讯悟空安全团队联合多机构发布 VulnGym 评测基准,基于真实漏洞构建,覆盖 400+ 漏洞路径,71.2% 为业务逻辑漏洞,支持确定性评测。
二元成功率已经过时!PRM-as-a-Judge才是你需要的具身操作评测框架
传统二元成功率评测具身操作任务有局限,难回答策略推进、执行效率等问题。中科院自动化所等机构研究人员提出PRM - as - Judge框架,含进度势能、OPD指标体系和RoboPulse基准,能细粒度审计执行过程。
吴恩达来信:数据中心对环境的影响,可能比你想象的要小得多
吴恩达认为,很多人反对数据中心扩张,担忧其增加碳排放、推高电价、加剧用水压力,但这些担忧被夸大,阻止建设对环境伤害或大于帮助,数据中心实际更环保。
首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测
现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。
MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告
司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。
九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了
OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。
更全面的具身智能真机评测来了!CVPR 2026 ManipArena挑战赛邀你打榜
具身智能产业发展迅速,但缺统一、高标准真机评测体系,成发展痛点。中山大学等机构推出 ManipArena 挑战赛,提供科学评测框架,已测部分模型,揭示不同技术路线能力边界,为产业发展提供基础。