推理执行」共找到 2540 篇相关文章

算法论文7

告别RAG相似匹配!百度Agentic-R为多轮搜索重塑检索器

传统检索增强生成(RAG)有“单跳”局限,多跳推理易出错。人大高瓴与百度提出面向智能搜索的检索器训练框架 Agentic - R,采用双视角打分和双向飞轮模式,在多数据集上表现出色。

PaperAgent
算法论文7

首篇具身智能机器人「安全」综述:LLM如何跨越物理鸿沟?

最新综述首次系统探讨LLM控制机器人的安全威胁、防御机制与未来挑战,指出LLM的具身鸿沟导致其在物理空间可能执行危险动作,而现有防御体系存在逻辑与物理脱节等问题。

新智元
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
新闻资讯8

DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危

据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。

新智元
推荐文章7

万字实录:AI究竟是普通人的“印钞机”,还是更狠的「收割机」?| GAIR Live 021

雷峰网&AI科技评论邀三位老师探讨“AI大模型金融应用的机遇与挑战”。以Trading Arena大赛为例,分析大模型在金融投资应用,指出打造强逻辑推理“大脑”是金融应用关键,也提及Agent局限与“黑天鹅”预判路径等。

AI科技评论
推荐文章7

a16z:2026 年的 AI 应用生态,关键问题是这几个

a16z投资人Anish Acharya探讨2026年AI应用生态关键问题。他指出应用和模型分化将更明显,未来AI应用是组合体。还提到工具本质会变,企业部门要软件优先,应用层创业公司有多种优势。

Founder Park
算法论文8

拥抱大模型:深入剖析ReAct的核心原理、技术架构及其对AI领域的深远影响

文章深入剖析ReAct,它是普林斯顿大学和谷歌团队提出的智能体架构范式,将推理与行动协同,构建TAO闭环。介绍其原理、架构,指出解决传统AI难题,也存在局限,未来可与强化学习等融合。

腾讯技术工程
开源动态8

AI医生终于有了硬标尺!全球首个专病循证评测框架GAPS发布,蚂蚁联合北大王俊院士团队出品

蚂蚁健康与北大王俊院士团队发布全球首个大模型专病循证能力评测框架GAPS及评测集GAPS - NSCLC - preview,解决现有医疗AI评测局限,成果已应用于“蚂蚁阿福”,并客观评价了大模型临床能力。

量子位
算法论文8

AI4S回归白盒符号主义,清华等联合发布SR-LLM:自主发现科学知识

清华大学等多所高校联合发布SR - LLM,这是融合大语言模型与深度强化学习的符号回归框架。它从数据生成可解释数学模型,在跟车行为建模等任务表现优,为机器自主科学发现开辟新路径。

新智元
开源动态7

测试的同学要起飞啦, Cursor / Claude 党福音:一个 MCP 服务器把 Android 真机接进你的对话框

DroidMind是开源MCP服务器,将Android的ADB能力结构化暴露给支持MCP的AI客户端。适合调试、测试等场景,能让AI执行设备操作,有设备管理、调试信息获取等功能,使用体验友好且安全。

小华同学ai