「指标治理」共找到 414 篇相关文章
让大模型“跑”在手机里:vivo蓝心端侧部署创新揭秘,性能功耗双优!
在AICon2025上海站,vivo AI研究院工程师章苏迟分享蓝心大模型端侧部署方案。介绍端侧大模型优势及应用场景,阐述内存、性能、功耗等指标优化方法,还提及多业务场景应对策略与安全合规措施。
马斯克终于成『AI No.1』,6大案例看实力与水分
马斯克发布Grok 4,宣称其超越OpenAI等LLM。它屠了各种榜单,但Grok系列口碑欠佳。文中通过多案例测试,展现其在各方面的表现,如编码、数学、图像等,还提到了API速度和价格。
AI 时代最大的“幻觉”:我们有了最强工具,却正在失去定义真问题的能力
BAT增长顾问、前快手产品总监杨一溪在全球产品经理大会指出,AI时代人们易迷失在‘可能性’中,失去定义‘真问题’的耐心。他结合案例,从多方面分享增长方法论,强调用户需求洞察的重要性。
进攻是最好的防守:超级平台为何「不得不」对AI智能体出手?
上海交通大学团队提出,超级平台“必须”攻击AI智能体,以守住其作为数字流量守门人的地位。研究从守门人理论分析反击原因,还阐述平台应对策略、攻击策略特点约束,最后强调要推动建设性技术治理生态。
从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench
港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。
智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法
AI 工具已嵌入 Uber 软件开发各阶段,智能体请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能体会话层级、成本公式、指标测算及优化手段,还提及未来举措。
从“会用”到“驾驭”:AI Coding 进入生产环境的真实碰撞
InfoQ《极客有约》X AICon 直播栏目,邀网易游戏林香鑫等探讨 Coding Agent 重构软件工程环节。嘉宾分享了 AI Coding 在生产环境的变化、MCP 等概念作用、代码质量保障、Agent 权限及 AI 原生研发体系建设等观点。
CVPR'26 | 以机器人为中心的ToM推理框架,从心智推理到决策行动
吉林大学、台湾大学和微软亚洲研究院联合提出MindPower Benchmark,构建以机器人为中心的ToM推理框架,统一建模环境感知、心智推理等,还构建数据集和评估指标。引入Mind - Reward强化优化,提升ToM决策与动作生成性能。
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
Agent 真正的护城河,正在从工具转向记忆资产
2026年初,Anthropic用Claude Cowork引发AI创业热点,其计划引入知识库获“永久记忆”能力,将Agent Memory探索推到前沿。文章探讨独立Memory层成必需品的原因、工程化记忆系统的能力,还对比模型厂商和第三方中立派路线。