「多领域推理」共找到 6377 篇相关文章
ICLR 2026 | 这道题是否需要用图思考?模型来告诉你!自适应思考模式切换助力通用视觉推理提升
本文来自复旦大学和阿里巴巴未来生活实验室,已中稿 ICLR 2026。目前视觉推理方法有纯文本和用图思考两种模式,各有优劣。研究者提出 Mixture-of-Visual-Thoughts 范式及 AdaVaR 框架、AdaGRPO 算法,让模型自适应选模式,实验显示其在多任务有提升。
GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了
GPT - 5.2 登场,有 Instant、Thinking、Pro 三个版本,在多方面大幅升级,能覆盖 44 类专业工作。它经济性强、编程能力佳、推理出色,但存在速度慢的问题,其价格 API 端有调整,未来还将推 Codex 优化版。
港科联合港中文提出AdaCtrl,自适应可控Reasoning,可降10~90%
港科联合港中文提出AdaCtrl,解决LLM推理的过度思考、算力浪费和响应延迟问题。它有自适应和用户控制两种模式,通过两阶段训练法实现目标,实验效果好,未来或拓展到多领域。
LLM-in-Sandbox:给大模型一台电脑,激发通用智能体能力
来自中国人民大学、微软研究院和清华的研究者提出LLM - in - Sandbox范式,让大模型在代码沙盒完成任务,实验显示其能提升多领域表现,无需额外训练,还能减少token消耗,研究者认为应取代纯LLM推理。
只用国产GPU训练的大模型性能飙升100%!国内唯一,更懂你
科大讯飞发布全国产算力训练的讯飞星火X1.5,推理效率暴涨100%,综合性能跻身全球顶级。还首发非自回归语音大模型架构,效果提升、成本降低。此外,展示多领域应用成果,发布相关产品,开源智能体平台。
阿联酋K2横空出世,数学、代码样样行,速度全球最快,GPT-4看了都得抖三抖
阿联酋穆罕默德·本·扎耶德人工智能大学与G42公司联合推出开源AI推理系统K2 Think,基于Qwen 2.5 - 32B模型。它靠六项技术性能出众,在多领域测试成绩好,还以小参数量媲美大模型,且全面开源。
视频模型也能推理,Sora2推理能力超过GPT-5
DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分体系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。
直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?
为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。
生成式推理再排序,可能会是LLM4RecSys的新突破口吗?
Meta AI研究者尝试把推理模型引入推荐系统再排序阶段。论文通过监督微调等赋予模型推理能力,超LLM4Recsys标杆。中期内化物品语意ID,生成推理路径,推理赋能再排序,披露重排序提升空间。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。