视频智能体」共找到 4273 篇相关文章

开源动态8

7300 人收藏的 PraisonAI,5 行代码即可部署 24 小时 AI 智能团队!

PraisonAI是开发者Mervin Praison开源的全功能多智能运行框架,有7.3K+ GitHub星标。它开发门槛低,支持100+大模型,具备完整智能能力,还能可视化编排、一键接入聊天平台。

开源星探
算法论文8

从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范式

在生成式视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测系,实验表现优,有效率和 3D 应用潜力。

机器之心
开源动态8

Claude 终于能“看”视频了!这个开源项目让我刷视频效率翻倍

平时找视频信息效率低,而开源项目让Claude等大模型 “看懂” 视频,能提取画面、音频并理解内容。介绍了其工作原理、帧预算、去重、细节模式等,安装使用门槛低,还给出了应用场景和项目地址。

GitHubStore
产品应用8

不敢信?中国AI国家队出手,刚刚通关了万亿级主战场「地狱副本」

文章指出智能虽强,但在招标采购等落地场景面临挑战。科大讯飞发布招采智能平台,提出智能工厂概念,解决招采痛点。还提炼出四个行业判断,分析其成功原因,标志AI在B端场景走向落地。

新智元
产品应用8

全球首个从语言出发构建的智能:MoonBit Pilot 如何推动自动化软件交付?

MoonBit Pilot是从语言底层构建的代码智能系统,将AI Agent从“助手”推向“合作者”。它比Cursor、Codex更快更稳定,能云端异步执行,有Sub Agent架构和分段编译机制,或成未来软件工业新标准。

AI科技评论
算法论文8

机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

UC Berkeley团队提出端到端流程,跑通从网络视频生成真实灵巧手实机执行轨迹链路。解决了单目RGB视频手-物交互重建、带噪声参考轨迹动作重定向及遥操作规模化难题。还给出数据筛选要点。

新智元
产品应用8

一句话搞定多任务出行,高德用空间智能重新定义地图

高德地图推出业内首个专精“出行与生活”的智能“小高老师”,依托时空感知多智能协作系统ST - MAC,可满足复杂出行与生活需求。它重新定义地图,将出行与生活服务融合,引领行业验深度竞争。

机器之心
算法论文8

EasyCache:无需训练的视频扩散模型推理加速——极简高效的视频生成提速方案

近年来,扩散模型在视频生成领域广泛应用,但推理慢、算力消耗高问题突出。EasyCache是无需训练的视频扩散模型推理加速方案,在多模型实验中实现大幅提速且视频质量几乎无损,为技术落地提供基础。

机器之心
开源动态8

AI操作有了“紧急刹车”!通义&自动化所AI决策诊断模型,GUI智能纠错正确率SOTA

阿里通义实验室与中科院自动化所推出GUI - Critic - R1模型,能在GUI智能操作执行前诊断决策,避免错误。介绍了其动机、方法、数据集及实验,证明该模型在生成判断和提建议方面有效。

量子位
开源动态8

交互扩展时代来临:创智复旦字节重磅发布AgentGym-RL,昇腾加持,开创智能训练新范式

强化学习之父指出人工智能迈入「经验时代」,在此背景下,复旦、创智、字节研究者发布 AgentGym - RL 框架。它是全新端到端 RL 框架,提出 ScalingInter - RL 方法,7B 模型经训练追平顶尖商业模型,为 AI 发展注入动力。

机器之心