「智能体评估」共找到 3992 篇相关文章
小白也能看懂,一文彻底说清 MCP、A2A与AG-UI,大模型应用集成协议三件套。
文章面向有一定技术基础但不熟悉大模型应用开发的读者,通俗介绍MCP、A2A和AG - UI三大主流集成协议,分别解决不同的集成难题,三者构成大模型应用集成完整生态。
姚顺雨提到的「AI下半场」,产品评估仍被误解
OpenAI研究员姚顺雨提出「AI下半场」重点转向定义问题,评估重要性超训练。亚马逊Eugene Yan发文补充,指出产品评估常被误解,应运用科学方法,践行评估驱动开发,自动化工具也需人工监督。
蚂蚁投了一家上海具身智能公司
马年新春,蚂蚁集团领投上海具身智能创业公司大晓机器人,这是蚂蚁2026年首笔具身智能投资。大晓机器人刚完成天使轮融资,资金用于技术迭代与产品落地,其核心团队实力强劲。
这篇超有用!手把手教你搭建 AI 产品 Evals
文章指出AI下半场模型评估比训练更重要,做好Evals是当下AI产品开发刚需。介绍了Evals重要性、三种方法、通用评估标准等,还教你从零构建Evals及设计注意事项,助你快速上手评估。
真正的Jarvis要来了?涂鸦智能押注Physical AI
智能家居爆发期,诸多硬件品牌借涂鸦能力发展。如今涂鸦发布AI生活助手“Hey Tuya”,它依托自研架构补齐Agent进入物理世界的关键能力,让涂鸦从幕后走向台前,有望构建家庭生活新基础。
为什么大模型会产生幻觉?OpenAI最新研究终于搞清楚了
OpenAI发布研究论文剖析LLM幻觉根源,指出当前主流训练与评估体系是核心驱动因素之一。现行评估奖励猜测行为,幻觉起源于预训练的‘下一词预测’,论文还澄清五大误区,建议改革评估体系。
超越 VTM-RA!快手双向智能视频编码器BRHVC亮相NeurIPS2025
视频编码中双向编码潜力待挖掘,快手音视频技术团队提出BRHVC方法,解决长跨度帧运动处理和参考贡献不平衡问题,其成果被NeurIPS 2025录用,在压缩性能上超越VTM - RA编码。
VLA不够了?触觉,将改写具身智能新格局
2026 年数据成具身智能竞赛焦点,IEEE 专访机器人学家王煜。他认为 VLA 架构难支撑机器人落地,触觉数据是关键。他与团队提出 VTLA 框架,创立戴盟机器人,发布数据集并开源部分数据,还阐释对具身智能多方面的思考。
o1 核心作者 Jason Wei:理解 2025 年 AI 进展的三种关键思路
前OpenAI核心研究员Jason Wei跳槽Meta后,在斯坦福大学AI Club演讲,提出理解2025年AI发展的三个核心思想:验证者定律、智能的锯齿状边缘和智能商品化。他认为AI将解决可验证任务,智能成本会趋近零,且各任务发展不均衡。
Hinton上海演讲:大模型跟人类智能很像,警惕养虎为患
深度学习之父Hinton在上海演讲《数字智能是否会取代生物智能》,指出人类可能是大语言模型,也会有幻觉,但大语言模型优于人类大脑,知识传递高效。他呼吁建立国际社群,培养不夺权的好AI。