「可靠性指标」共找到 366 篇相关文章
一文读懂深度表格数据表示学习 | 南京大学
南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。
谷歌将 A2A 捐赠给 Linux 基金会,但代码实现还得靠开发者自己?!
当地时间6月23日,Linux基金会宣布与多公司成立A2A项目,由谷歌捐赠协议规范等。A2A是谷歌4月推出的开放标准,支持智能体通信协作。有开发者认为它或削弱MCP地位,但谷歌称是其“补充”。实际应用有诸多问题待解。
传言称:Llama 4 团队80%成员集体辞职!
有爆料称Meta的Llama 4团队约80%成员集体辞职,引发AI圈关注。但Meta员工澄清该消息不准确,且无权威媒体证实。不过Meta和Llama 4项目确实面临高层动荡、模型延期等问题,还分析了可能的深层原因。
Anthropic 发布 AI Native 全流程实践指南
Anthropic应用AI团队发布实践指南,阐述如何将AI融入软件开发生命周期各环节。指出代码不再是瓶颈,构建快但周边流程慢。指南围绕六阶段展开,给出实施步骤、治理框架和度量指标。
本地部署Qwen 3.8 27B,要用什么配置
Qwen 3.8 27B是性能好、体积小的开源模型,个人也能本地部署。本地跑开源大模型,重点看容量和带宽两个指标,还介绍了Mac、RTX 5090、RTX PRO 6000三种部署方案及优缺点。
都说记忆是Agent标配,但MemSyco发现漏算了一件事
厦门大学与吉林大学的最新研究指出,随着大模型Agent具备长期记忆,虽成为“长期协作者”,但也出现Memory-Induced Sycophancy问题。为此提出MemSyco - Bench评测基准,经实验得出多项发现,指出Agent Memory关键瓶颈转变。
GEO最新风向:Google官方GEO分享与Bing站长工具GEO新功能,附白杨SEO看法
本文整理谷歌和必应官方GEO分享。Google的Danny Sullivan谈AI搜索,强调好SEO即好GEO,内容要非同质化;Bing预告站长工具GEO新功能,如优化建议、引用份额指标等。
VoxCPM2:无tokenizer语音合成,高保真声音克隆
VoxCPM2突破传统TTS系统局限,直接操作连续声学特征,保留音色纹理更完整。基于扩散自回归架构,有硬核技术指标,提供三种克隆模式,性能佳,生态完善,微调便捷,但也存在安全风险。
AI 智能体实践评估:基准、框架与经验总结
文章为将 AI 智能体从原型落地到生产环境的团队提供实用评估框架。指出传统评估不适用于智能体,介绍评估工具,阐述五大评估支柱,还给出基于 Claude 和 LangChain 的评估示例及实践经验。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。