高级推理测试」共找到 3447 篇相关文章

算法论文8

DeepAgent:能够自主找工具的深度思考智能体,工具&任务随心配

现有智能体框架自主性差、工具使用受限。中国人民大学等机构研究者提出DeepAgent,能自主思考、发现工具并执行动作。它在多基准测试中表现出色,为构建更强真实世界智能体迈进重要一步。

PaperAgent
算法论文8

突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题

AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。

机器之心
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
开源动态8

Meta刚刚开源DINOv3,横扫60+任务,无标注封神!

今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。

AIGC开放社区
产品应用7

AI驱动前端重构:10天完成3000+行复杂组件的跨端复用实践

本文分享阿里团队实践,用AI开发工具Cursor结合Claude模型,10天重构超3000行前端组件实现跨端复用。介绍代码辅助、测试用例生产、代码智能生产经验,提出新开发范式,强调规范和人工校验重要性。

阿里云开发者
新闻资讯7

The Batch: 844 | AI 天气预测加速推进

美国国家飓风中心与 Google 的 Weather Lab 合作,利用新模型预测风暴。该模型能比传统方法更准确预测风暴形成、路径和强度,最长提前 15 天,测试表现优于 Google 之前的 GenCast 模型和 ENS 模型。

DeeplearningAI
算法论文8

让机器人学会系统2慢思考,叠衣服倒咖啡等不在话下 | 上海交大&智元机器人

上海交通大学与智元机器人等团队推出Hume——融合系统2慢思考的双系统VLA模型。它结合深度推理与实时控制,在多种机器人平台实验中表现出色,平均成功率达91%,显著超越现有模型。

量子位
推荐文章8

0day漏洞量产?AI Agent“生产线”曝光

本文探讨AI Agent如何通过多智能体协作系统打造0day漏洞“生产线”,实现自动化漏洞检测。经测试和实战验证,Agent在复杂代码和大型项目中表现超传统工具,提升了漏洞识别效率与准确性。

腾讯技术工程
产品应用8

首个实时端侧部署世界模型,20万小时人类视频,BeingBeyond实现「两级跃迁」

4月14日,BeingBeyond发布具身世界模型Being - H0.7,将人类视频规模扩至20万小时,采用隐式推理范式,6项权威评测综合第一。还率先实现端侧实时部署,打通数据闭环,推动模型通用与专家能力跃迁。

AI科技评论
开源动态7

我用GLM-5肝出一个Rust版Agent系统,Opus 4.6迎来了最强开源对手。

作者实测智谱发布的GLM - 5后,用其开发出Rust版Agent系统并开源。还对比GLM - 5与Kimi 2.5、Opus 4.6,认为GLM - 5写后端能力强,让普通开发者也能用高级架构能力。

开源AI项目落地