「复杂文档处理」共找到 1958 篇相关文章
Liblib AI上线Kontext,门槛大幅降低!藏师傅手把手教你用它解决图片问题
FLUX的Kontext是强大的图像编辑应用,除不能写中文外近乎全能。Liblib AI上线FLUX Kontext,支持Web UI和Comfyui,无需本地跑Comfyui,还能结合Liblib生态处理图片。作者给出保姆级使用教程。
历史首次!o3找到Linux内核零日漏洞,12000行代码看100遍揪出,无需调用任何工具
OpenAI总裁转发成果,o3模型找到Linux内核SMB实现远程零日漏洞,未用复杂工具。研究员实验对比o3、Claude 3.7和3.5,o3表现佳,还能找到新漏洞、给出完善修复方案。
微软正式开源UFO²,Windows桌面迈入「AgentOS 时代」
微软研究团队正式开源业内首个深度集成 Windows 操作系统的桌面智能体平台 UFO² AgentOS。它是 UFO 升级版,解决传统智能体问题,在多维度实现突破,经测试表现领先,代码和文档已开源。
【翻译】在 Codex 中使用 Goals:长时间工作的持久目标
文章介绍 Codex 中的 Goals,它是持久目标,能让线程跨多轮对话朝明确结果推进。阐述了 Goals 与普通 prompts 的区别、编写方法、活跃后的变化、设计方式及适用场景等,还通过案例展示其在研究任务中的应用。
福特把造车压到 93 分钟,AI 正在把“软件生产线”重做一遍
AI时代,研发基础设施正重构。如福特重设汽车生产线,AI也在重造“软件生产线”。文档受众从人变为机器,人与AI分工明确,人跃迁为“定义者”,团队需适应新工作方式。
SceneGen: 单图像驱动的多资产3D 场景生成
上海交通大学提出SceneGen框架,可从单张场景图像及其对应目标掩码中,同时生成带有几何结构与纹理的多个3D资产。它一次前向传播即可完成生成,在效率与稳健性上优于现有方法,虽有局限但应用潜力大。
如何将LLM的"思考习惯"迁移到视觉领域?
传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。
Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%
为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。
万帧实时!流式3D重建天花板,被国产开源模型打破了
蚂蚁正式开源 LingBot-Map,这是基于几何上下文 Transformer 的纯自回归流式 3D 重建基础模型。它能在恒定内存下实现超万帧长视频实时三维重建,处理速度约 20 FPS,在多基准测试中超越现有流式方法。
BRIGHT榜单SOTA!人大&百度ReasonRank:用推理增强的段落重排序器
传统listwise在复杂查询表现差,近期工作泛化性不佳。人大与百度等提出ReasonRank,通过全自动合成13K推理数据及两阶段训练,在BRIGHT等榜单表现优异,且ReasonRank-7B比Rank1-7B快2.5倍。