「多人对话视频生成」共找到 1525 篇相关文章
GLM-5.1夺开源模型第一,长程任务更稳,一句话就能生成文章短视频
智谱官宣GLM-5.1开源,代码能力增强,在三项代码评测基准综合平均分上,取得全球模型第三、国产及开源模型第一。它专为长程任务设计,能8小时持续工作,还能一句话生成短视频,是平替Claude Sonnet 4.6的优选项。
腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒
腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。
对话八位具身智能大咖:模型之争、数据来源与第一性原理|甲子光年
在11月20日智源具身OpenDay上,甲子光年创始人张一甲与八位具身智能领域核心践行者对话。探讨世界模型、统一架构等问题,指出具身智能虽前景好,但面临数据、模型等困境,各方分享应对策略与决策原则。
首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒
新加坡国立大学等联合发布EgoTwin,首次实现第一视角视频与人体动作联合生成,攻克视角 - 动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决核心难题,实验性能超基线,为多领域应用提供落地基座。
AAAI|东方理工陈云天等:教会视频扩散模型“理解科学现象”,从初始帧生成整个物理演化
东方理工陈云天等团队在论文中提出让视频扩散模型学习“潜在科学知识”的框架,方法分三步,在流体和台风数据实验中表现超主流方法,展示生成式AI在科学建模的探索。
扔掉人工公式:快手EMER框架,用“会比较、自进化”的模型重构短视频推荐排序
过去十年,推荐排序多依赖人工设计公式,但此模式遇瓶颈。快手策略算法团队提出 EMER 框架,用“会比较、能进化的 AI 模型”重构短视频推荐排序,在快手主 App 和极速版效果显著,还为行业提供解决方案。
256块NPU训成8B视频模型、超越Sora等一众闭源!抖音内容技术团队开源ContentV
近日,抖音内容技术团队开源ContentV,这是面向视频生成任务的高效训练方案。用256块NPU约4周训成8B参数模型,在多评估维度效果与主流方案相近,还探索了有限算力下训练路径,现推理代码与权重已开放。
面壁MiniCPM-V4.5新王炸!8B手机10FPS长视频秒懂,文档手写全能识别!
面壁上新最强端侧多模态模型MiniCPM-V 4.5,基于Qwen3 - 8B与SigLIP2 - 400M构建,总参数量8B。它视觉语言理解强、手机能跑,有高帧率视频理解等特点,还有多方面技术亮点。
实测国内首个对话式AI音乐创作Agent:聊个天就能谱曲填词混剪生成MV
实测国内首个对话式AI音乐创作Agent Tunee,玩法像Suno+ChatGPT结合体。它操作简约功能全,能反复修改创作,还具备多模态内容处理能力,虽有小瑕疵,但体现国产AIGC应用发展趋势。
“你们尽管做空 OpenAI!”奥特曼霸气喊话,纳德拉亲述微软百亿投资内幕 | 巨头对话
外网播客中,微软CEO纳德拉与OpenAI CEO奥特曼对话,谈及微软与OpenAI新合作协议,涵盖股权、收入分成等。还讨论算力投入、AGI规则、上市传闻等话题。二人对合作成果满意,对未来发展充满信心。