视频智能体」共找到 4273 篇相关文章

算法论文8

视频生成一长就漂移竟是前序帧「太干净」惹的祸!研究揭示共享噪声水平才是长视频稳定关键

自回归视频生成模型存在训推不一致导致的误差累积问题,使生成视频越往后越易出现时序漂移和画面崩坏。HiAR团队推出HiAR,通过共享噪声水平减少误差传递,还解决了动作僵化问题,实现分钟级无退化生成。

量子位
开源动态7

MASFactory: 多智能系统开发进入Vibe Graphing时代

AI能力迭代,多智能编排却停留在旧阶段。北京邮电大学GAMMA Lab团队发布MASFactory,用Vibe Graphing编排多智能系统,融合多种开发方式,有全栈可视化等优势,还给出实用案例和开源代码。

深度学习自然语言处理
产品应用8

刚刚,美团推出 136 亿参数视频生成模型

美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。

AGI Hunt
新闻资讯8

从豆包手机谈起:端侧智能的愿景与路线图

近日,字节跳动发布豆包手机助手,标志大模型应用从‘Chat’迈向‘Action’。文章解析其关键技术,指出虽具实用价值,但端侧智能面临安全、自主任务、个性化服务等挑战,还展望了手机助手与端侧智能的未来发展。

AI前线
新闻资讯8

腾讯张正友:具身智能必须回答的三个「真问题」

7月27日,腾讯发布具身智能开放平台Tairos。发布会后,腾讯张正友剖析战略选择背后的三个核心问题:架构上主张分层架构;认为具身智能第一性原理是身脑融合;强调要为长远目标放弃短期商业利益。

机器之心
开源动态7

面壁智能开源 EdgeClaw,一款安全高效端云协同的龙虾 Agent。

当下AI Agent端侧常被忽视,数据任务都涌向云端致隐私泄露和算力浪费。近期面壁智能等联合开源EdgeClaw,以三级安全和性价比感知协同机制,解决OpenClaw数据泄露、token成本高等问题。

开源星探
算法论文8

Graph工程的尽头是,Ontology工程

15家机构联合发布图工程系统性综述,指出此前“XX工程”范式多优化单个智能,而图工程能将智能提升到系统层面。论文还指出图工程语义局限,认为本工程可作下一代系统智能语义地基。

PaperAgent
产品应用7

AI开始学会合作?!实测4大多Agent=10个打工人

Agent热潮进入多智能时代,多款产品涌现。鲸哥测评了它们在商业计划、运营设计等四大场景表现,总结各产品亮点与不足,指出多Agent正推动大模型向“协作式智能”演进。

鲸选AI
算法论文8

视频模型也能推理,Sora2推理能力超过GPT-5

DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。

量子位
算法论文8

Multi-Agent记忆系统MIRIX:比RAG性能飙升35%,存储减少99.9%

现有AI Agent记忆方案有局限,MIRIX作为模块化多智能记忆系统应运而生。它由六种记忆类型和多智能框架组成,支持多种检索功能。在多模态和单模态测试中表现优异,为记忆增强型LLM智能设新标准。

PaperAgent