「智能体基准」共找到 4093 篇相关文章
字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军
字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。
从模型到真实世界:具身智能落地面临哪些关键问题?
近年来具身智能成重要方向,但在真实物理世界应用有诸多技术挑战。9月11日‘基座之上’论坛将亮相外滩大会,聚焦前沿技术与场景落地,同期启动挑战赛,现专业观众报名通道已开。
世界模型再迎新突破,兔展智能UniWorld-View登顶WorldScore榜单
近年来,世界模型成视觉 AI 重要研究方向。兔展智能联合研发的 UniWorld - View 登顶 WorldScore 榜单,完成昇腾算力适配与开源。它聚焦让 AI 理解未拍摄世界,解决了诸多技术难题。
GPT4核心成员、清华校友赵晟佳任Meta超级智能实验室首席科学家
Meta约一个月前宣布建立「Meta超级智能实验室」,为重振Llama雄风招揽人才。扎克伯格任命GPT4核心成员、清华校友赵晟佳为该实验室首席科学家,其履历亮眼,新研究范式或指明Meta科研方向。
Langchain 、 Manus 组了一个研讨会:Agent越智能,死得越快!
Langchain工程师Lance Martin和Manus创始人Peak季逸超研讨Agent,指出Agent越智能死得越快,原因是疯狂调用工具致上下文过大。还介绍解决方案,如压缩与总结不同,Manus做减法架构更优。
刚刚,Meta挖走OpenAI清华校友宋飏,任超级智能实验室研究负责人
本周四消息,原OpenAI战略探索团队负责人宋飏加入Meta,任新成立的Meta超级智能实验室研究负责人。今年6月起Meta开启AI人才争夺,已挖来至少11位顶尖人员,宋飏加入为其AI部门添活力。
OpenClaw爆火,暴露12类致命隐患!MCP协议安全基准发布 | ICLR
OpenClaw等开源AI Agent项目爆火,MCP协议拓宽其能力也增大攻击面。北京邮电大学团队推出MSB安全基准,揭示MCP各阶段攻击有效,性能强的模型更易受攻击,还提出NRP指标平衡安全与实用性。
当代码江湖遇上智能副驾:一场开发效能的「御剑飞行」
文章以代码江湖为喻,介绍开发者困境,引出智能GitHub Copilot副驾驶。它能提升开发者工作满意度和代码编写效率,全球2000万开发者在用,微软还持续创新。11月14日将举办分享会探讨其应用。
世界首个!李飞飞团队推出物理推理基准,大模型统统不及格?
斯坦福联合中科大团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。
集GraphRAG 和 DeepSearch于一体的智能问答系统graph-rag-agent
本项目结合GraphRAG与私域Deep Search,实现可解释、可推理的智能问答系统。亮点有从零复现GraphRAG、创新融合DeepSearch等,具备多模块功能,还有简单演示,地址https://github.com/1517005260/graph-rag-agent/blob/master/readme.md。