多视角评估」共找到 4761 篇相关文章

算法论文7

剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了

剑桥大学等机构研究指出,大模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。

新智元
7

别让故障复盘流于形式:用AI挖掘每一次“跌倒”的价值

文章指出传统故障复盘存在诸问题,借助AI能力可解决专业性和深度问题。介绍了智能复盘Agent,包括其核心使命、目标用户、核心价值和解决方案,还阐述了核心技术架构、实现方式及评测机制等,最后给出实战案例。

阿里云开发者
新闻资讯7

先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?

数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。

机器之心
算法论文8

扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%

论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在领域研究任务超现有方案,为AI研究助手落地提供新范式。

深度学习自然语言处理
新闻资讯7

老黄唱衰编程,GitHub CEO硬刚:放弃写代码等于放弃智能体未来话语权

GitHub CEO托马斯·姆克在采访中反驳“编程无用论”,认为2025年是编程智能体之年,但未来仍属人类程序员。公司推出个SWE智能体产品,Copilot用户增长显著,还将评估商业模式,专注打造最佳产品。

量子位
产品应用8

具身数据才是最大「金矿」,数据云商城来了:全球首个、百亿级、全模态、高自由度

帕西尼联合京东云等打造的全球首个百亿级全模态具身智能数据云商城开放。该平台解决具身智能泛化瓶颈,提供全模态数据,有端到端服务,数据质量高、体量大,还能加速具身智能进化,赋能行业。

机器之心
算法论文8

ICLR 2026 | 这道题是否需要用图思考?模型来告诉你!自适应思考模式切换助力通用视觉推理提升

本文来自复旦大学和阿里巴巴未来生活实验室,已中稿 ICLR 2026。目前视觉推理方法有纯文本和用图思考两种模式,各有优劣。研究者提出 Mixture-of-Visual-Thoughts 范式及 AdaVaR 框架、AdaGRPO 算法,让模型自适应选模式,实验显示其在任务有提升。

机器之心
新闻资讯8

“大鱼吃小鱼”:一文看懂2025年度国内半导体收购

2025年国内半导体领域并购交易超50起创新高,但成功率降至近三年最低。本文盘点起并购案例,如中芯国际收购中芯北方、华虹半导体收购华力微等,涉及晶圆制造、IP/EDA、设备材料、芯片设计等领域,展现产业整合趋势。

芯师爷
推荐文章7

精打细算虾养成指南: 省 Token 和把 AI 用好,从来就是一件事

文章指出用AI时Token成本高、模型变笨,原因是上下文管理不善。介绍了省Token和用好AI的方法,如按需取上下文、明确约束、智能体协作、按阶段切换模型等,核心是在合适时间将合适上下文装入合适模型。

腾讯技术工程
产品应用9

支付宝“阿宝”背后的 Agentic 终端:从对话到办事,xUI 如何重构 AI 交互

本文整理自蚂蚁集团支付宝AI端云交互负责人魏凤笛的大会分享,系统介绍支付宝AI入口产品“阿宝”背后的xUI技术体系,涵盖通信、交互、执行、Agent协同四大核心方向,分享了大厂移动端Agent落地的工程实践与未来规划。

InfoQ