「实时视频推理」共找到 3169 篇相关文章
锁定角色,「多主体」也可控!个性化文生图,给你PS般交互体验
LayerComposer革新个性化图像生成,能让用户如在Photoshop般操控元素位置、大小,解决传统方法交互性与多主体扩展难题。它有分层画布、锁定机制、模型–数据共设计三大特点,实验表现出色,未来将促进人机协同创作。
TileLang深入详解-第一章-GPU 体系结构复习
作者借长假学习 TileLang 并撰写此文,先复习 GPU 体系结构,包括计算与线程组织、存储层次、专用指令单元,接着介绍核心性能模型与优化原理,最后给出基于 TileLang 的基准测试实践。
基于Spring AI Alibaba 的 DeepResearch 架构与实践
本文基于 SpringAI Alibaba Graph 构建 Java 版 DeepResearch 系统,实现信息搜集到报告生成的全自动流程。介绍系统能力、架构、核心功能节点及技术点,还阐述 RAG、搜索、MCP、报告生成等功能,给出使用、部署和社区参与方式。
老牌Transformer杀手在ICLR悄然更新:Mamba-3三大改进趋近设计完全体
Transformer架构仍是AI主流,Mamba作为挑战者影响力大。Mamba-3在ICLR 2026盲审,有梯形离散化、复数化状态空间模型、多输入多输出状态空间模型三大改进,实证表现佳,适合多场景。
CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己
美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。
刚刚,清华团队用27M参数击败o3-mini!或将改变AI发展方向
清华大学研究团队发布论文,展示Hierarchical Reasoning Model(HRM)。该模型仅27M参数、1000个训练样本,在推理任务上击败OpenAI的o3 - mini - high,或改变AI发展方向。
清华-腾讯联手:音频 - 视觉多模态任务统一框架
Crab是人大、清华和腾讯合作论文提出的模型,目标是高效一统多模态场景理解任务。它解决了音频 - 视觉理解模型任务干扰、合作显式化不足等难点,通过构建数据集、设计结构和统一架构实现多任务合作。
国产大模型高考出分了:裸分683,选清华还是北大?
字节跳动Seed团队公布全球第一梯队大模型“高考成绩”,Gemini理科655分排第一,豆包文科683分排第一、理科648分排第二。文章解析评测标准,分析各科目表现,还介绍豆包能力提升技术亮点。
SearchAgent-X: 打破效率桎梏,释放下一代「AI搜索智能体」的真正潜能
论文提出SearchAgent-X框架解决AI搜索智能体效率难题。研究剖析效率瓶颈,发现精度和延迟问题,提出优先级感知调度与无停顿检索技术,经评估大幅提升性能且不牺牲答案质量。
Linear-MoE:线性注意力遇上混合专家的开源实践
近年来,线性序列建模和混合专家(MoE)研究进步大,但两者结合研究少,相关开源实现缺失。上海人工智能实验室团队的 Linear - MoE 首次实现两者高效结合并开源技术框架,实验验证其有诸多优势。