「长文本生成」共找到 2952 篇相关文章
真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文
MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。
Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR
GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。
Excel上微软式创新!=COPILOT()函数发布
微软CEO宣布Excel新功能`=COPILOT()`函数,可在单元格直接调用AI。它能进行文本分析、生成内容、整理数据,与计算引擎集成,结果随数据自动更新。现处测试阶段,有调用限制和版本要求。
“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%
多模态长文档视觉问答常见于科研论文等场景,现有技术路线有大视觉 - 语言模型直接端到端和检索增强生成,但各有缺点。MMRAG - DocQA引入新方案,解决多模态连接和跨页证据链接问题。
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
B站下场自研AI配音!纯正美音版甄嬛传流出,再不用看小红书学英语了(Doge)
B站发布TTS模型IndexTTS2,亮点是实现时长控制时再现符合Prompt的情感特征,支持两种生成方式,经测试多项指标达SOTA。它由三核心模块组成,还可能是代号H的AI创作工具一环。
“看懂”指令并做动作!Motion-R1结合COT让角色动起来
大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。
MIDAS:快手可灵发布实时交互式数字人生成框架
近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。
LLM加速利器LMCache,极大降低GPU资源消耗
LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于长上下文场景。它将KV缓存存于多级存储,跨服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。
叫板 OpenAI Sora?Manus 推出文生视频服务,计划向所有用户开放
近日,Manus AI 推出文本转视频生成服务,支持单条提示完成视频制作,目前供部分订阅用户抢先体验,计划向所有用户开放,对标 OpenAI Sora 等竞品。其母公司获投资,还与微软合作,系统有独特优势。