多步推理」共找到 5594 篇相关文章

算法论文8

为什么 LLM 搞不定复杂任务?ReAct 与 Reflexion 技术综述

文章指出大语言模型处理复杂任务存在事实幻觉、缺乏实时信息等问题。介绍ReAct将推理和行动结合,及Reflexion在其基础上添加评估反思机制,探讨两者结合优势,还提及未来发展方向。

阿里云开发者
开源动态8

突发!字节开源 36B 模型Seed-OSS

字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在方面表现强劲,性能碾压OpenAI开源模型。

AGI Hunt
算法论文8

UIUC提出隐式监督新范式:无需标注/RM即可全面提升模态Reasoning的感知能力

大型模态模型在复杂模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在模态基准上表现优异,还解决了KL黑客问题。

深度学习自然语言处理
算法论文7

GraphRAG还在持续进化,FlowRAG让证据链自己流起来

上海AI Lab和华东师大论文提出FlowRAG,它是GraphRAG变体,把RAG检索从按相似度排文本块推向沿证据流找推理路径。在数据集上表现不错,虽平均Relevance低于LinearRAG,但更能保证证据链完整。

PaperAgent
算法论文8

让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026

复旦、创智联合推出RSAgent,让模态大模型通过轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。

量子位
开源动态7

一周1.2k星!兼具质量与效率的OCR模型MonkeyOCR,支持样化的中英文PDF

MonkeyOCR采用SRR三元组范式,简化工具流程、避免整页文档处理低效问题。与MinerU、端到端模型相比性能更优,处理速度也更快。暂不支持拍摄文档解析,文章还给出安装、推理等操作骤。

GitHubStore
算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。

深度学习自然语言处理
产品应用8

月耗3000美金的Skills重度用户,实测MiniMax M2.7:国产Agent模型的天花板?

AI产品黄叔作为月耗3000美金的Skills重度用户,实测MiniMax M2.7,从Agent协作、Coding能力、办公自动化等方面测试,发现其表现出色,虽有不足,但在维度已是国产模型天花板。

AI产品黄叔
开源动态8

基于闪电注意力机制,创新高效开源大模型

传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等方面优化,表现突出。

AIGC开放社区
开源动态8

清华推出AI数学家!独立完成数学理论难题,自动调用基本定理、构建证明思路

清华团队推出AI Mathematician(AIM)框架,可将LRMs推理能力延伸至前沿数学研究。它由三大模块驱动,有两大核心策略。实验显示其能解决个挑战性问题,虽有不足,但未来有望成数学研究核心驱动力。

量子位