「智能体评测」共找到 3944 篇相关文章
对谈 DeepSeek-Prover 核心作者辛华剑:Multi Agent 天然适合形式化数学 |Best Minds
文章是对 DeepSeek-Prover 核心作者辛华剑的访谈。他认为强化学习是 AGI 关键解法,Multi Agent 适合形式化数学。还探讨了 DeepSeek Prover 进展、数学与 AGI 关系、评测基准等,指出未来有全才模型和自主 Agent 出现。
火山引擎发布豆包大模型1.6,加速Agent大规模应用
6月11日,火山引擎举办Force原动力大会,发布豆包大模型1.6、视频生成模型Seedance 1.0 pro等,升级Agent开发平台。豆包1.6表现优异,应用广泛;Seedance 1.0 pro评测领先。还通过创新定价等推动Agent规模化应用。
谷歌突袭发布AI应用,无需Wi-Fi、手机就能跑大模型!网友实测两极分化
谷歌推出 Google AI Edge Gallery 应用,可在 Android 设备离线运行 AI 模型。它有本地运行、智能选模等特点,响应快且隐私性好。不过网友实测评价不一,有人认为它是旧技术包装,还被指比 Core ML 落后。
全球唯一非侵入穿颅读脑突破!这家中国公司想成为脑科学的“英伟达”
当前脑机接口领域,侵入式危险、非侵入式分辨率低,深圳鲲为公司另辟蹊径,基于声学空间智能理论,用低频超声+算力算法实现全球首个非侵入高分辨率穿颅读脑,已商业化落地,目标成为脑科学领域的"英伟达"。
2026年了,我们还在用爱迪生试灯丝的方式评估World Model
文章围绕World model展开深度讨论,界定其概念,分析生成派、JEPA派、空间智能派三条技术路线,指出评估比LLM难,提及游戏化benchmark可能是破局点,还强调具身进展由数据驱动,Ego - View或为泛化关键。
jina-embeddings-v5-omni 发布!全模态向量小模型
Jina AI发布`jina-embeddings-v5-omni`,将`v5-text`能力拓展到多模态。`v5-omni-small`参数量小却追平LCO - 7B,在多模态评测中表现优异,但视频是短板。其采用‘冻结 + 投影’架构,训练快、省显存。
你不知道的 Agent:原理、架构与工程实践
文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。
马斯克“开大”,600亿重金收购Cursor
SpaceX 宣布将以 600 亿美元收购代码生成初创公司 Cursor,或支付 100 亿美元合作。此前 xAI 编程项目落后,3 月挖角 Cursor 核心人员。Cursor 受竞争压力且缺算力,合作有望提升模型智能水平。交易或影响 SpaceX IPO 估值。
实战案例|当本体遇上 Agent:让 AI 真正“听懂业务”并“按规矩办事”【上】
本文是“企业级本体应用”系列第三篇,探讨本体如何融入企业智能体系统。指出本体非数据库或图谱,是语义层。介绍本体在Agent系统的架构与职责,通过案例展示用本体做规则判断和多维归类,凸显其优势。
科研的回归:AutoSOTA如何终结“增量式优化”的重复劳动
当前AI科研中,为提升性能指标,研究者投入大量精力做“增量式优化”,限制原创探索。AutoSOTA项目由清华与中关村学院联合发布,它基于智能体系统构建自动化方案,接管实验迭代,一周发现105个SOTA模型,推动科研回归原创。