「长视频生成」共找到 3148 篇相关文章
ICDE 2026 | 从匹配困境到推理突破:阿里REG4Rec 激活生成式推荐的个性化潜力
阿里国际智能技术团队提出生成式推荐模型 REG4Rec,从表征学习、训练目标和推理策略层面设计,提升推理能力与稳定性。离线实验表现优,已在 Lazada 部署,带来显著商业收益,成果被 ICDE 2026 接收。
捅破具身智能天花板!极佳视界新VLA大模型登场,复杂长时程任务近100%成功率
极佳视界推出GigaBrain-0.5M*VLA大模型,以世界模型条件驱动,引入人在回路持续学习机制。在与主流方法对比中,任务成功率提升30%,长时程任务近100%成功,还具备高效准确的价值预测能力。
扔掉人工公式:快手EMER框架,用“会比较、自进化”的模型重构短视频推荐排序
过去十年,推荐排序多依赖人工设计公式,但此模式遇瓶颈。快手策略算法团队提出 EMER 框架,用“会比较、能进化的 AI 模型”重构短视频推荐排序,在快手主 App 和极速版效果显著,还为行业提供解决方案。
微软炸场了!一张图片仅需3即可生成带完整PBR材质的超高质量3D资产!
微软推出3D资产生成大模型TRELLIS,能接收文本或图像提示,输出高质量3D资产。其结果质量强,支持灵活切换输出格式和局部3D编辑,还给出安装和使用方法及项目地址。
面壁MiniCPM4端侧模型发布:长文本推理 5 倍提速,0.5B 模型拿下新SOTA
2025智源大会,面壁发布MiniCPM4.0端侧模型,含8B稀疏闪电版与0.5B款。其采用InfLLM架构,实现长文本推理5倍提速、最高220倍加速,还在性能、部署等方面优化,适配多芯片与框架。
“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影
约翰·霍普金斯大学与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。
两张图就能重构3D空间?清华&NTU利用生成模型解锁空间智能新范式
ICCV 2025中稿的LangScene-X以全新生成式框架,仅用稀疏视图就能构建可泛化的3D语言嵌入场景。它攻克传统方法痛点,将多模态信息统一在单一模型,为空间智能领域打开新大门。
突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆
机器之心发布文章介绍,大模型长期记忆能力受限于上下文长度。《MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens》提出MSA架构,突破扩展性、精度和效率的不可能三角,实现100M长度的大模型长时记忆框架。
成本暴降99%!万人大会系统全是AI生成的,Vibe Coding终于真上战场了
百度世界大会2025上,无代码对话式应用搭建平台“秒哒”升级到2.0,能全栈应用一键生成,综合成本降99%。它靠多智能体协作,整合百度生态,后端能力强,还发起黑客松大赛,海外版也上线。
创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界
李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。