推理质量评估」共找到 3121 篇相关文章

算法论文8

搜索Agent最新高效推理框架:吞吐量翻3倍、延迟降至1/5,还不牺牲答案质量丨南开& UIUC研究

大语言模型驱动的搜索智能体有能力但效率低。南开和UIUC研究人员剖析效率瓶颈,提出SearchAgent-X框架,实现吞吐量提升、延迟降低,且不牺牲答案质量,还揭示AI智能体平衡和等待问题。

量子位
新闻资讯7

The Batch:836 | 基准测试成本攀升

独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。

DeeplearningAI
新闻资讯8

刚刚,Anthropic分享了他们在AI Agents评估的最佳实践

Anthropic发布blog《揭秘AI Agents评估》,指出良好评估能助团队信心发布AI智能体,介绍评估结构、构建原因、评估方法、从零到一的路线图,还提到评估需与其他方法配合,全面了解智能体性能。

PaperAgent
新闻资讯7

先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?

多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。

机器之心
产品应用7

说实话提前拿到Qwen3.7-Max内测,最让我意外的不是它推理变强了!

作者提前2天拿到Qwen3.7-Max内测,经测试,该版本补齐短板,综合能力强。审美提升明显,代码质量不错,长程思考推理迭代能力佳,适合替换到部分工具里。

探索AGI
算法论文8

5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文

当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。

量子位
推荐文章8

Anthropic 再发长文:首次详细揭秘Agent的评估全过程「Claude code开发过程的经验总结」

Anthropic在Claude Code等开发及与客户合作中总结出AI Agent评估方法。文章介绍评估基本结构、构建原因、评分器类型、不同Agent评估法、应对不确定性指标、构建路线图及与其他方法协同方式。

AI寒武纪
新闻资讯8

深度访谈:阿里云X平头哥,模型推理提升13倍背后的秘密

这篇深度访谈聚焦阿里云与平头哥,探讨模型推理提升13倍背后的秘密。随着AI焦点转向推理,行业面临算力、成本、监管等矛盾。嘉宾分析推理范式现状与变化,探讨推理加速技术及优化策略,还谈及瓶颈、未来发展及竞争方向。

InfoQ
算法论文8

Evaluation is All You Need:评估设计的微小差异如何扭曲结果

论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。

深度学习自然语言处理
算法论文8

从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁

多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力。

机器之心