「长上下文」共找到 1170 篇相关文章
比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!
Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。
Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力
Anthropic发布Claude Opus 4.7模型,相比4.6版处理长任务更严谨,能自我验证输出。它在视觉、指令遵循、记忆等能力上提升,企业级应用表现出色,还有新功能与安全特性,不过使用成本更高。
突破视频时长限制!Manus上架视频生成功能,网友:比Sora更好
Manus上架视频生成功能,可通过连续拼接突破时长限制。它按“拍电影”方式,根据提示词生成片段再合成故事。网友评价是新创作方式,但效果有提升空间,部分人认为比Sora好。
长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍
牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。
GPT-5.4据传下周上线!200万上下文窗口+持久化状态,告别频繁遗忘
OpenAI工程师在GitHub仓库意外泄露GPT - 5.4,相关信息流传后被撤回。据传下周上线,其有200万Tokens上下文窗口与持久记忆,支持全分辨率视觉直读,将引发硬件内存之战。
内存直降50%,token需求少56%!用视觉方式处理长文本
在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。
多模态后训练反常识:长思维链SFT和RL的协同困境
华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。
Claude 这个更新,让模型能力提升10%+!
Claude开放100万上下文长度更新,实际可用空间接近8倍提升。数据显示,上下文越长Claude与其他模型差距越大。API取消溢价,还更新图片/PDF上限、将Adaptive Thinking转正式版。
Hugging Face开源顶级模型:双模式推理+128K上下文,最强3B
今天凌晨,Hugging Face开源顶级小参数模型SmolLM3,参数30亿,性能超同类。它有128k上下文窗口,支持6种语言、双推理模式。架构细节等全开放,联合创始人强烈推荐,称是3B领域SOTA。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。