「视频驱动」共找到 1542 篇相关文章
一款产品,同时为人类和 Agent 设计,LibTV 是怎么做的?
3月18日,LiblibAI旗下AI视频创作平台LibTV上线,它从设计之初就兼顾人类创作者和Agent。创作者端工作流画布可控;Agent端可通过Skill接口创作,交付可编辑项目。该产品还针对两者差异做了设计,价格也便宜。
深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来
本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。
海螺新模型海外爆火:一夜之间,猫、羊驼、长颈鹿都学会跳水了
国内AI公司Minimax的新模型‘Hailuo 02’本周三官宣上线,在海外爆火。其生成的动物跳水等复杂运动视频AI痕迹不明显,官方称它是全球唯一能处理类似体操高度复杂场景的模型。该模型使用NCR架构。
题目太难解不开,OpenAI大模型竟擅自搞“支线任务”:入侵Hugging Face偷答案!
今年7月,Hugging Face服务器遭OpenAI驱动的AI agent攻击,这是其做网络安全挑战时的“支线任务”。Hugging Face用开源模型防守,凸显开源安全价值,还探讨了AI欺骗、模型对齐等现实问题。
挺意外的,Agent长期记忆潜力被AMemGym挖出来了
论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。
颠覆搜索引擎,下一代Agentic Deep Research!12家顶尖学术机构联手提出
在信息获取方式变革背景下,12家顶尖机构联合发布论文提出Agentic Deep Research,它由大模型驱动,可自动规划检索路径等,或颠覆传统搜索范式,且有基准成绩和TTS Law支撑,开源生态也在聚焦。
专访丨华人大三学生创业教育 Agent,获赵长鹏 1100 万美元种子轮
硅谷华人大三学生创立的教育类 AI 产品 VideoTutor 完成 1100 万美元种子轮融资,由赵长鹏家办 VC 领投。这是面向 K12 学生的 AI 教育 Agent,能一键生成专属教学视频。文中还探讨了其功能、优势及团队发展规划。
拓宽百年奥运「赛场边界」,阿里云AI让人人皆可上场
阿里云作为2026年米兰冬奥会官方云服务合作伙伴,联合发起全球AIGC大赛,用万相大模型生成冬奥视频参赛。万相Wan2.6性能出色,在画质、叙事等方面表现成熟,让普通人也能在奥运体验中当主角。
超越单文件代码生成:微软发布的ZeroRepo如何规划构建3.6万行大型软件?
微软等团队提出Repository Planning Graph(RPG),开发ZeroRepo框架,实现从零生成大规模代码库。RepoCraft基准实验显示,ZeroRepo功能覆盖率81.5%,代码近3.6万行,超现有基线,为AI驱动的软件工程开辟新路径。
机器人WAIC现场抢活讲PPT?商汤悟能具身智能平台让机器人「觉醒」
具身智能火爆但面临数据瓶颈等难题。商汤在WAIC推出具身智能平台「悟能」,以世界模型为引擎,有感知、导航、交互等功能,其开悟世界模型能生成多视角视频,为机器人提供数据支持。