长链复杂性」共找到 967 篇相关文章

算法论文8

综述 | 从“说出来”到“脑中算”:Latent Reasoning的范式跃迁与无限可能

大型语言模型用显式思维推理有局限,潜在思维(Latent CoT)让推理在连续隐藏状态空间进行。论文梳理该领域,建立框架,介绍方法,探讨可解释性与无限深度推理,指出价值、挑战与未来方向。

深度学习自然语言处理
开源动态8

把RoPE扔掉,AI更能看懂上下文!Transformer作者团队开源大模型预训练新方法

Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。

量子位
算法论文8

全新线性注意力范式!哈工深张正团队提出模感知线性注意力!显存直降92.3%!

哈工深张正团队联合多团队发布论文,提出 NaLaFormer 框架,解决线性注意力两大核心缺陷,保持线性复杂度同时精度超越,在多任务表现出色,如超分任务显存降 92.3%。

机器之心
算法论文8

LLM算力告急?把文本变图片,推理成本直接减半!

大型语言模型处理文本时计算成本高,本论文探索‘文本即图像’输入压缩策略,将文本渲染为图像输入多模态模型,可减少近一半令牌,且任务性能不受显著影响,在多任务中验证了其有效性。

深度学习自然语言处理
算法论文8

字节Seed提出M3-Agent:像我们一样"记住"与"思考"的视频理解新范式

字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。

深度学习自然语言处理
开源动态8

不用额外缓存!英伟达开源大模型记忆压缩方案,128K上下文提速2.7倍

英伟达联合多机构推出TTT - E2E方法,在文本处理上提速显著且性能不打折。它基于标准Transformer,将文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。

量子位
推荐文章7

将思维(CoT)引入具身世界,哪种路径能真正打通机器人「知行合一」?

文章围绕将思维(CoT)引入具身智能领域展开。介绍CoT从语言层面到成为机器人行为核心认知机制的转变,分析分层架构与端到端模型两种技术路径,还阐述自变量机器人统一架构的优势和能力。

AI科技评论
算法论文8

大模型推理上限再突破:「自适应难易度蒸馏」超越R1蒸馏,CoT语料质量飞升

本文从中兴通讯无线研究院「大模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了CoT语料的质量。

机器之心
新闻资讯7

Jason Wei火速被挖走,奥特曼哭晕!OpenAI龙脉被挖,一亿刀偷走思维之父?

OpenAI痛失思维之父Jason Wei等核心员工,他们将加入Meta。此前Meta已多次从OpenAI挖人,扎克伯格全力推动Meta向AI转型,依靠自有资金布局,欲打造下一代科技霸权。

新智元
产品应用8

英伟达帮你省钱,让大模型推理「短而精」,速度快5倍

过去大模型推理追求思维,导致推理、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理度减超70%且准确率不变,还适用于大模型。

机器之心