评估指标」共找到 944 篇相关文章

开源动态8

ICCV 2025 | UniOcc: 自动驾驶占用预测与推理统一数据集及基准平台

来自多所高校团队在ICCV 2025发表统一基准框架UniOcc,融合多源数据,有体素级运动流标注等创新,提出免真值评估指标,支持协同预测,已开源,能推动自动驾驶迈向新阶段。

机器之心
算法论文8

拒绝不必要Think:微软&北大提出第一种自适应大型混合推理模型

大型推理模型冗长思考开销大,微软研究院和北大提出大型混合推理模型(LHRMs),它能依查询上下文决定是否思考。介绍了两阶段训练流程、评估指标,实验显示其超越现有模型且效率高。

PaperAgent
算法论文8

半在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远

现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用化AI智能体的重要一步。

深度学习自然语言处理
算法论文8

谷歌助力神经科学飞跃,破解斑马鱼全脑活动密码

谷歌等机构科学家联合发布开创性研究成果ZAPBench,这是预测斑马鱼全脑活动的基准测试平台。它含超70000个神经元4D光片显微镜记录,设计多种刺激条件采集数据,有特定基准测试任务和评估指标

AIGC开放社区
新闻资讯7

DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手

DoorDash 分享对话式 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。

InfoQ
开源动态8

文档秒变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平

澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。

量子位
新闻资讯8

奥特曼爆料:GPT-5重构彻底一切!一人顶五个团队

GPT-5的发布或是一场技术变革。奥特曼在对谈中给出未来清单,谈到年轻人学习方向、创业思路等。他认为GPT-5是大飞跃,年轻人要掌握AI工具,还提出评估大模型智力新指标等。

新智元
算法论文8

谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度

Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。

深度学习自然语言处理
8

硅谷顶尖产品教练万字干货,一针见血揭示产品失败真相

文章回顾 Jim Morris 演讲,指出多数团队混淆“产出”与“成果”,迷恋“虚荣指标”。以 Power Reviews 为例,强调做对事才驱动客户价值。还介绍衡量成功的指标及应用案例,说明指标关联与先行指标作用。

AI科技大本营
新闻资讯7

姚顺雨提到的「AI下半场」,产品评估仍被误解

OpenAI研究员姚顺雨提出「AI下半场」重点转向定义问题,评估重要性超训练。亚马逊Eugene Yan发文补充,指出产品评估常被误解,应运用科学方法,践行评估驱动开发,自动化工具也需人工监督。

机器之心