推理任务」共找到 3627 篇相关文章

开源动态8

阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%

阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。

开源星探
产品应用7

Web 开发 AI 就选它?V0复合架构无错误率 93.87% 远超 Claude 4 Opus 单体!

Vercel推出新AI模型v0系列,采用复合模型架构,将RAG专业知识、SOTA大模型推理能力和定制流式后处理模型结合,能提升代码生成质量,且基础模型升级时可快速替换,还训练了定制AutoFix模型。

AI进修生
8

专业医生远不如AI模型?OpenAI推出医疗开源测试基准HealthBench,o3表现最强

OpenAI推出医疗开源测试基准HealthBench,由262位多国医生合作打造,含5000段真实健康对话。评估显示o3综合表现最佳,顶尖AI处理任务能力超无辅助医生,HealthBench更真实专业有区分度,但也有局限。

AI寒武纪
推荐文章9

一万字Jev 工程实践长文:把 Agent 的“判断题”从大模型里拆出来

本文是一万字Jev工程实践长文,作者结合自研落地Demo,拆解Jev核心设计逻辑,讲解如何将Agent中高频封闭的判断任务从大模型生成链路拆分,解决Agent上下文膨胀痛点,分享工程实现与选型思路。

腾讯技术工程
新闻资讯7

打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?

OpenAI的GPT-6 Astra亮相,在ARC - AGI - 3测试成绩逼近100%,远超GPT - 5.6 Sol。它生成的符号世界模型被认为是AI迈向高级推理必经之路。不过出题人指出其靠Harness加持,离AGI还远。

AI科技评论
算法论文7

代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相

新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。

新智元
算法论文7

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。

机器之心
推荐文章7

烧了1万块横测,你用的模型可能掉队了

作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。

探索AGI
算法论文8

李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

李飞飞等全明星阵容关注灵巧手研究,提出T-Rex模型。其通过给触觉单独开通路等方式解决触觉加入难题,在真实任务中表现出色,还为灵巧手领域带来从机身分化、启发专用场景应用等变化。

量子位
产品应用7

不换 Kimi 底座,1/10 成本追平 Opus 4.7?Cursor 用 Composer 2.5 反击 Claude Code

Cursor 发布 Composer 2.5 应对竞争,虽沿用 Kimi K2.5 底座,但通过后训练提升性能。它跑分接近 Opus 4.7,价格更低,在长任务处理上表现更好,还公布多项技术进展,正推进大模型训练。

InfoQ