评估范式」共找到 1649 篇相关文章

产品应用7

基于OpenAPI和AI coding的上云智能体构建实践

文章介绍基于OpenAPI和AI coding构建上云智能体的实践。分析不同编程范式,结合AI coding发展与Multi - Agent问题,阐述构建方案,包括业务场景、构建方法、技术实现、当前效果及后续展望,还提及文档智能与RAG构建LLM知识库。

阿里云开发者
算法论文8

谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分

纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。

机器之心
算法论文8

蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三大幻觉,现已接入MTEB

蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。

AINLPer
新闻资讯8

人类最后考试登上Nature:全球50个国家近千名顶尖学者打造的AI测试集

人类最后的考试(HLE)登上Nature,这一测试集由全球50个国家近千名顶尖学者打造,含2500道高难度试题。现有的人工智能评估工具已跟不上技术演进,HLE能测出AI极限,让顶尖机器暴露短板。

AIGC开放社区
8

挺意外的,Agent长期记忆潜力被AMemGym挖出来了

论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。

PaperAgent
新闻资讯7

先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?

多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。

机器之心
算法论文8

ICLR 2026 | 这道题是否需要用图思考?模型来告诉你!自适应思考模式切换助力通用视觉推理提升

本文来自复旦大学和阿里巴巴未来生活实验室,已中稿 ICLR 2026。目前视觉推理方法有纯文本和用图思考两种模式,各有优劣。研究者提出 Mixture-of-Visual-Thoughts 范式及 AdaVaR 框架、AdaGRPO 算法,让模型自适应选模式,实验显示其在多任务有提升。

机器之心
推荐文章7

AI圈刚开始谈Loop Engineering,两位95后博士已经盯上了人类闭环数据

AI圈热词Loop Engineering强调AI工程应从单次prompt转向设计持续运行的闭环系统。具身智能争抢人类第一视角数据,脸谱心智由95后博士创立,发布Looped World Models,还提出Ego - NeuroLoop数据范式及相关采集和增强工具。

机器之心
新闻资讯7

网民票选AI王者,LMArena一夜变17亿美元独角兽!

LMArena原是校园开源小项目,从2023年起步,如今估值达17亿美元。其Arena模式让网友盲投选AI,Elo评分系统算排名。虽有众包投票易操纵等争议,但已成行业标杆,还将为大厂提供付费评估服务。

新智元
新闻资讯8

深度访谈:阿里云X平头哥,模型推理提升13倍背后的秘密

这篇深度访谈聚焦阿里云与平头哥,探讨模型推理提升13倍背后的秘密。随着AI焦点转向推理,行业面临算力、成本、监管等矛盾。嘉宾分析推理范式现状与变化,探讨推理加速技术及优化策略,还谈及瓶颈、未来发展及竞争方向。

InfoQ