视频大模型」共找到 9541 篇相关文章

推荐文章8

对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型

本文是对IDEA研究院张磊的深度访谈。张磊在计算机视觉领域成就斐然,他指出具身智能落地需攻克成功率、泛化性等挑战,脑比本体更关键。还阐述了世界模型概念及应用,定义其应具备动作依赖等内容。

AI科技评论
产品应用8

快手AI超级员工上线!一句话剪出完整短视频,从文案到发布一条龙

快手AIGC超级员工Kwali正在内测,可一句话生成完整短视频。它整合多Agent框架,有素材库和数字人资源。能完成脚本、拍摄、剪辑等环节,降低视频制作门槛,重构视频供应链。

量子位
算法论文8

其实,扩散语言模型在最终解码之前很久,就已确定最终答案

随着扩散语言模型(DLM)发展,它成自回归(AR)模型有力替代。但实际推理慢于 AR 模型。研究者发现早期答案收敛现象,提出 Prophet 策略,实验显示其能在保持高质量生成时显著加速推理。

机器之心
算法论文8

RAE+VAE? 预训练表征助力扩散模型Tokenizer,加速像素压缩到语义提取

近期,RAE 提出以「 冻结的预训练视觉表征」作潜空间提升扩散模型性能。同期西安交与微软亚研院提出 VFM - VAE,结合 RAE 与 VAE,能加速模型收敛、提升生成质量,展示扩散模型 Tokenizer 演化方向。

机器之心
算法论文8

揭示扩散语言模型扩展定律,人高瓴团队与蚂蚁集团发布LLaDA MoE v2

中国人民学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。

机器之心
产品应用8

跨维智能DexWorldModel斩获榜首,世界模型真正的考场在机器人执行里

今年4月,Generalist AI发布GEN - 1,其CEO表示不再将模型归类为VLA。当下VLA和世界模型是具身智能主流技术路线,多数世界模型在机器人任务上有瓶颈。跨维智能DexWorldModel在RoboTwin榜单表现出色,还开源EmbodiChain助力行业。

量子位
产品应用8

又是中国团队!一条链接出片,电商AI视频迎来「DeepSeek时刻」

电商AI视频此前生成效果不佳,难以用于投放。营赛AI发布的inSai Hilight是“下一代营销视频解决方案”,在权威评测中表现出色,能保证商品和数字人一致性,靠知识图谱等技术实现高质量视频生成。

新智元
新闻资讯8

Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上

DeepSeek发布新模型DeepSeek - OCR,有诸多技术贡献,获Karpathy等盛赞。它或让文本token输入方式被淘汰。开发者Simon用Claude Code让其在N卡上运行成功,分享了详细过程与经验。

AI前线
算法论文8

Thinking Machine新研究刷屏!结合RL+微调优势,小模型训练更具性价比了

Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练小模型性价比高,还能解决AI“灾难性遗忘”问题。

量子位
开源动态8

快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!

快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。

AI前线