「流处理架构」共找到 2796 篇相关文章
只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。
近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。
POF | 西交大陈泽伟、陈刚等:面向可变形域非周期非定常流动的几何自适应时空深度学习框架
西交大陈泽伟、陈刚等人提出ViT - STFlowNet框架,用于可变形域非周期非定常流动预测。该框架融合自适应网格变换与ViT架构,克服传统方法局限,测试显示预测精度高、泛化能力好,为飞行器流场感知控制提供工具。
红杉对话 LangChain 创始人:2026 年 AI 告别对话框,步入 Long-Horizon Agents 元年
红杉访谈 LangChain 创始人 Harrison Chase,探讨 Long-Horizon Agents。其认为 2026 年是 Doers 元年,这类 Agent 能处理长时程任务。还提及 Harness 架构、Coding Agent 等,指出 Memory 是壁垒,交互需同步与异步结合。
因果发现大模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116
浙大、清华与稳准智能联合发布因果发现大模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练。
RAG终极框架!港大开源RAG-Anything:统一多模态知识图谱
香港大学黄超教授团队发布开源项目RAG - Anything,构建统一多模态知识图谱架构,解决传统RAG技术局限。它能处理多类型异构内容,提供端到端方案,有多种优势及应用模式,还给出部署指南和未来展望。
Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了
Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。
海螺新模型海外爆火:一夜之间,猫、羊驼、长颈鹿都学会跳水了
国内AI公司Minimax的新模型‘Hailuo 02’本周三官宣上线,在海外爆火。其生成的动物跳水等复杂运动视频AI痕迹不明显,官方称它是全球唯一能处理类似体操高度复杂场景的模型。该模型使用NCR架构。
社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型
Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。
Manus 数月憋大招, 100 个 Agent 并发只为选双鞋?肖弘放话:第一阶段就得先做超贵的 AI!
中国人工智能初创公司 Manus 推出新功能“Wide Research”,可让用户借助多个 AI Agent 同时处理大规模任务。该功能不走“深度研究”路径,架构经优化,计算能力扩展 100 倍,但效果待察。Manus 撤出中国市场,欲借此求差异。
视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理
快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。