长上下文处理」共找到 1022 篇相关文章

算法论文8

扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍

Meta Superintelligence Labs提出REFRAG高效解码框架,解决LLM长上下文输入效率瓶颈。它通过四步流程优化解码,让首个token生成时间加速达30.8倍,扩展上下文,且精度不降反升,不过价值待实际检验。

机器之心
算法论文8

Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini

Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。

深度学习自然语言处理
算法论文8

传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题

文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
算法论文8

ICML 2025 | 千倍长度泛化!蚂蚁新注意力机制GCA实现16M长上下文精准理解

在大语言模型发展中,长文本建模挑战大。蚂蚁研究团队提出注意力机制GCA,可端到端学习检索相关片段,实现超长序列处理与泛化,其Triton kernel实现已开源,论文被ICML 2025接收。

机器之心
开源动态7

Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了

传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。

AI工程化
新闻资讯7

DeepSeek 为什么把缓存涨了 11 倍?长上下文需求暴涨,得交点「存储税」了

8月17日,DeepSeek V4 Pro API输入和输出价格上涨,空闲时段缓存命中价涨5倍,高峰时涨11倍。此前其因高缓存命中率成性价比之选,但长上下文需求爆发致后端“缓存颠簸”,只能通过涨价收“存储税”。开发者可提高缓存命中率应对。

AI科技评论
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
开源动态8

重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个

DeepSeek-OCR模型探索视觉-文本压缩边界,用少量视觉token解码出10倍以上文本信息。它在OmniDocBench基准上表现超GOT-OCR2.0,为LLM长上下文问题提供方案,还能处理多类图像与近100种语言。

新智元
推荐文章7

大模型的第一性原理:(二)信号处理

本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。

机器之心
开源动态8

视频字幕处理开源神器

卡卡字幕助手(VideoCaptioner)操作简单,无需高配置,支持 API 和本地离线语音识别,利用大语言模型处理字幕。它支持多平台视频下载处理,有专业语音识别引擎,能智能纠错、高质量翻译、调整字幕样式。

GitHubStore
上一页1 / 103下一页