推理训练数据」共找到 5141 篇相关文章

算法论文8

「有望成为Transformer杀手」,谷歌DeepMind新架构MoR实现两倍推理速度

谷歌DeepMind发布新架构MoR,有望成Transformer杀手。它统一实现参数共享、自适应计算,兼顾性能与效率。实验显示其推理吞吐量提升,降低计算需求,但能否取代Transformer存疑。

机器之心
算法论文8

AI读不懂文档结构?计算所重构Agentic RAG文档推理能力

大语言模型工具使用能力推动RAG进化,现有Agentic Search框架有“结构盲”问题。中科院计算所团队提出DeepRead,将文档结构转化为坐标系统,用两大工具协同实现类人推理,在多数据集验证效果显著。

新智元
新闻资讯8

DeepMind一篇论文终结十年之争!GPT-5推理靠世界模型

GPT-5上线后推理能力惊人。最新研究揭示通用智能体聪明的原因是长出“世界模型”,终结了学界十年关于AI靠模仿还是思考的争论,实验也验证了世界模型对智能体的必要性。

新智元
算法论文8

斯坦福×英伟达发布AI推理新范式,刷新了多领域SOTA

斯坦福与英伟达联合发布论文 TTT - Discover,提出新范式,不追求通用,在推理阶段针对特定难题修改模型参数。它战绩辉煌,但成本高、是偏科生且需打分器,其出现是技术与哲学的突破。

新智元
新闻资讯7

号称1200万token上下文的模型来了,数据亮眼但疑点重重

当地时间5月5日,Subquadratic公司推出模型SubQ,称是LLM智能重大突破,有1200万token上下文。数据亮眼,如在1M token场景比FlashAttention快52倍等,但也引发质疑,有人推测是对开源模型微调,官方未公布详细模型卡。

DeepTech深科技
开源动态8

SGLang 推理引擎的技术要点与部署实践|AICon 北京站前瞻

SGLang 是开源推理引擎,截至 2025 年 6 月,在 GitHub 获近 15K Stars,月均下载超 10 万次,被多家行业巨头采纳。InfoQ 专访其核心开发者尹良升,他分享技术、挑战等,6 月 27 - 28 日他将在 AICon 演讲。

AI前线
算法论文8

大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练

字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。

量子位
新闻资讯7

这周六,聊聊具身数据、模型与落地场景|沙龙报名

当下具身智能进入加速期,但具身模型从Demo走向真实世界运行路径复杂,存在技术路线未收敛、数据匮乏等问题。量子位等联合发起沙龙,4月25日周六14:00,一线从业者与研究者将分享经验,探讨具身智能关键环节。

量子位
新闻资讯7

EchoLeak-首个导致 M365 Copilot 数据泄露的零点击 AI 漏洞

Aim Security发现“EchoLeak”漏洞,利用RAG Copilot设计缺陷,攻击者无需特定用户行为就能窃取M365 Copilot上下文数据。文章详述攻击流程、利用方法,此研究在AI安全领域有多项突破。

AI与安全
新闻资讯7

独家|前DeepMap 创始人吴夏青离职英伟达创业,瞄准机器人数据方向

AI科技评论独家消息,前DeepMap创始人、英伟达业务副总裁吴夏青2025年12月离开英伟达,正考察机器人数据领域创业。他是资深地图人,DeepMap曾被英伟达约30亿美元收购。

AI科技评论