「评估指标」共找到 945 篇相关文章
Anthropic 发布 AI Native 全流程实践指南
Anthropic应用AI团队发布实践指南,阐述如何将AI融入软件开发生命周期各环节。指出代码不再是瓶颈,构建快但周边流程慢。指南围绕六阶段展开,给出实施步骤、治理框架和度量指标。
本地部署Qwen 3.8 27B,要用什么配置
Qwen 3.8 27B是性能好、体积小的开源模型,个人也能本地部署。本地跑开源大模型,重点看容量和带宽两个指标,还介绍了Mac、RTX 5090、RTX PRO 6000三种部署方案及优缺点。
基于阿里云 AgentLoop 的 DeepSeek Harness 评测实践
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
一篇Self-Evolving Coding Agents最新综述
当今编码智能体部署后大多静止,自进化编码智能体应运而生,可让Agent通过交互更新自身。文章介绍了其概念、分类,探讨组件进化机制、时机及评估方法,也提及带来的新挑战。
从「时域建模」到「频域融合」:中山大学团队为传感器人体活动识别提供新思路 | TPAMI 2026
中山大学团队在IEEE TPAMI发表研究,用“三重频域融合”(TSF)框架突破传感器人体活动识别(HAR)领域核心瓶颈。该框架从三个全新“视角”审视问题,经多数据集评估表现出色。
DeepMind 创始人 Hassabis 语出惊人:百万 token 只是在贴胶带,AGI 在 2030 年
DeepMind创始人Hassabis在访谈中评估AGI进展,认为当前范式是最终架构一部分,但持续学习等问题待解决,预计2030年左右实现AGI,还探讨了Agent、蒸馏等多方面内容,并给创业者建议。
GEO最新风向:Google官方GEO分享与Bing站长工具GEO新功能,附白杨SEO看法
本文整理谷歌和必应官方GEO分享。Google的Danny Sullivan谈AI搜索,强调好SEO即好GEO,内容要非同质化;Bing预告站长工具GEO新功能,如优化建议、引用份额指标等。
你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench
剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。
VoxCPM2:无tokenizer语音合成,高保真声音克隆
VoxCPM2突破传统TTS系统局限,直接操作连续声学特征,保留音色纹理更完整。基于扩散自回归架构,有硬核技术指标,提供三种克隆模式,性能佳,生态完善,微调便捷,但也存在安全风险。
传统PM假设已死!Anthropic的产品经理是怎么工作的?
文章指出在AI指数级增长时代,传统产品管理假设已不适用。以Anthropic的Claude Code为例,展示模型能力大幅提升,介绍了新的产品管理工作流程、四个根本性转变及新节奏,强调判断力的重要性。