可验证推理」共找到 6064 篇相关文章

开源动态8

从第一性原理出发的RAG推理新范式来了,蚂蚁DIVER登顶权威基准

当前RAG系统处理多步逻辑推理任务有局限,蚂蚁集团团队提出DIVER框架解决推理密集型检索难题。它将检索任务分四阶段,在BRIGHT榜单领先,行业对比优势明显,医疗应用效果好。

机器之心
算法论文8

NTU S-Lab 团队探索动 3D 新方向:结构、关节、纹理一次到位

南洋理工大学 S-Lab 团队发布研究,提出统一建模框架,能从单张图像生成动三维对象,在几何精度、外观一致性与运动合理性上显著提升,解决了现有方法的难题,为相关领域发展奠定基础。

AI科技评论
新闻资讯8

OpenAI总裁透露GPT-5改了推理范式,AGI实现要靠现实反馈

OpenAI总裁Greg Brockman在访谈中透露AGI之路,包括技术上转向强化学习推理范式,资源上持续投入计算资源,落地时封装成Agent。还提到GPT - 5改变推理范式,强调计算对AGI的重要性及模型落地等内容。

量子位
新闻资讯7

成立7个月首发声!百亿美金独角兽万字雄文:攻克LLM推理非确定性难题

估值120亿美元的Thinking Machines Lab成立7个月首次公开研究成果,揭示LLM推理非确定性的真凶是kernel缺乏批处理不变性。介绍了实现批处理不变性的方法,还通过实验展示其效果及对同策略强化学习的意义。

新智元
算法论文8

长思维链里的推理步骤,哪些最关键?三招锁定LLM的「命门句子」

杜克大学和 Alphabet 研究者提出在句子层面分析推理痕迹,找出长思维链中关键步骤,提高 LLM 解释性等。提出三种互补方法,还提供开源工具,研究为调试推理失败等提供能。

机器之心
开源动态8

推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源

DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。

量子位
开源动态7

vLLM Ascend超越MindIE? 昇腾推理Qwen3与DeepSeek R1 Distill性能实测

国内开发者在昇腾NPU上进行大模型推理面临挑战,华为MindIE推理引擎使用门槛高。昇腾联合vLLM社区推出vLLM Ascend插件。本文用GPUStack平台实测其与MindIE性能差异,得出两者在不同场景各有优势的结论。

AI工程化
开源动态8

打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner

人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。

机器之心
产品应用8

在AI工具间来回切换了1年后,灵用一张画布终结了它。

作者参加WAIC印象最深的是灵更新,其首发灵动画布并升级多图参考功能。灵动画布一站式完成图文视频创作,多图参考精准度提升,解决了AI工具孤岛化问题,让创作更自由。

数字生命卡兹克
开源动态7

DeepSeek R1/V3作者开源轻量级vLLM,1200行代码读懂大模型推理技术!

DeepSeek R1/V3作者俞星凯开源轻量级vLLM——Nano - vLLM。它有快速离线推理、代码读、含优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B模型的基准测试配置。

PaperAgent