「高效长上下文建模」共找到 1402 篇相关文章
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。
AI 颠覆的第一个职业是程序员?|GAIR Live
文章围绕“AI颠覆的第一个职业会是程序员吗”展开讨论。嘉宾认为AI Coding尚处早期,有潜力成新工程范式。它面临“幻觉”、上下文窗口限制等瓶颈,未来开发者角色或转变为“业务翻译者”和“需求架构师”。
SnapMoGen:44 小时动作数据 + 12 万文本注释,文本驱动动作生成数据集
近年来文本驱动动作生成有进展,但受限于数据集质量。Snap团队提出SnapMoGen数据集和MoMask++模型。前者有2万条动作片段和12.2万条文本描述,后者建模更有效,还结合LLM提升适用性,但二者都有局限。
【博客转载】CUDA Cooperative Groups
文章介绍CUDA cooperative groups,它让开发者创建和管理能同步通信的线程组,为GPU并行算法编程提供更灵活高效方式。文中讨论并行归约算法及用cooperative groups的实现,还对比不同归约求和方法及性能。
学习 MCP 最好的时机是 7 个月前,其次是现在
文章介绍 MCP(Model Context Protocol),它是实现 LLM 与外部能力高效互联的协议,像 USB - C 接口。其采用客户端 - 服务器架构,可让 LLM 突破能力边界。与 Function Calling 相比,MCP 成本低,能让业务团队参与构建智能体。
多模态扩散模型开始爆发,这次是高速可控还能学习推理的LaViDa
近期基于扩散模型的视觉 - 语言模型 LaViDa 出现,它继承扩散语言模型优点。与自回归模型不同,扩散模型能并行、处理双向上下文。LaViDa 在多任务测试有竞争力,推理蒸馏和文本填空表现好,还能权衡速度与质量。
不再“纸上谈兵”:大模型能力如何转化为实际业务价值
InfoQ《极客有约》X AICon 直播栏目邀华为云郑岩、蚂蚁集团杨浩、明略科技吴昊宇,探讨大模型驱动业务提效。分享场景探索、技术落地经验,如选模型考量因素、AI Agent 创新等,还提及 MCP 应用与未来展望。
我用 GLM-5.2 读 148 万字资料:一天读懂一个知识
作者用 GLM-5.2 处理 148 万字 Transformer 资料,它生成可打开的 HTML 阅读页,将内容排成理解路线。GLM-5.2 在评测榜单中进入第一梯队,主打 1M 上下文,还分享了使用该模型处理资料的具体做法。
公里级场景也能稳住了,国产团队把长视频3D重建又往前推了一步
浙江大学、地平线机器人和之江实验室的新工作 Scal3R 要解决长视频 3D 重建问题。它借助 test - time training 技术,设计全局上下文模块和同步机制,提升长序列重建稳定性和精度,能处理超万帧几千米的场景。
智能体编程“小钢炮”:Qwen3.6-35B-A3B开源!
Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智能体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。