可交互音视频」共找到 5044 篇相关文章

算法论文8

NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据集

港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还优化现有数据集。实验显示其在多基准任务上性能提升显著,扩展性佳。

机器之心
新闻资讯8

小扎「芒果」生图只输GPT Image 2,没人教它改稿,它自己学会了

Meta推出图像生成模型Muse Image(代号「芒果」)和视频模型Muse Video预览版。Muse Image在文生图榜单排第二,改变画图方式,能自我修正。它与Muse Spark打通,Muse Video文生视频排第3。不过,其@功能有隐私隐患。

新智元
新闻资讯8

马斯克还在卷10秒,中国AI直接掀桌!16秒一镜到底,全球唯二

2026年AI视频圈竞争激烈,硅谷巨头激战正酣,马斯克Grok Imagine上线生成10s视频功能。在此背景下,中国AI的Vidu Q3登场,16s音画直出一镜到底,还支持多种功能,位列中国第一、全球第二。

新智元
产品应用8

给 Happy Horse-1.0 讲完戏,我无痛当上导演了

文章聚焦阿里新发布的视频模型Happy Horse-1.0,经测试它在多镜头一致性、人物表现力和视频编辑功能上表现出色,能产出电影质感画面,且价格有竞争力,但物理拟真短板明显,已具影视工业应用潜力。

AI科技评论
新闻资讯7

AI搜索平台Glean获1.5亿美元,估值72亿美元

CNBC消息,AI搜索平台Glean完成1.5亿美元F轮融资,估值升至72亿美元。其核心产品是企业级搜索平台,集成多应用。资金将用于团队扩张和拓展市场,但也面临激烈竞争,技术与大模型互补。

AIGC开放社区
推荐文章7

泛娱乐 AI 赛道观察: 从「猜你喜欢」到参与共创,角色才是 AI 时代最核心的资产

文章围绕AI泛娱乐产品展开,指出AI时代产品观应从二元对立转为三元共生。AI实现个性化体验,从“猜你喜欢”到“与你共创”。还分析了不同体验心态及案例,强调角色是核心资产,未来产品降低门槛、扩圈发展。

Founder Park
新闻资讯7

Mira Murati 创业公司首发长文,尝试解决 LLM 推理的不确定性难题

OpenAI前CTO Mira Murati创立的Thinking Machines Lab首发文章《克服LLM推理中的不确定性》,指出大语言模型推理难获复现结果,深入探究其不确定性根源,提出使核函数具备批次不变性的方法并给出实现与实验。

Founder Park
产品应用8

TRAE Work 上线 Design 模式:产品经理还需要 Figma 吗?

TRAE Work 上线 Design 模式,将一句话描述变成编辑设计稿,还能将设计稿转代码,在同一平台完成从需求到代码的链路。作者测试后发现其效率大幅提升,并分析了该模式与其他工具的区别及 AI 设计趋势。

特工宇宙
产品应用2

cursor 2.0实测:cursor的摆烂之作

作者实测Cursor 2.0后大失所望。它交互粗糙,多智能体虽有多个回答但选方案操作不明;因Claude涨价推出智能分发和自研Composer,后者除快无优势且需魔法;内置浏览器交互麻烦,窗口管理离谱,语音模式基本不用。

AI产品自由
产品应用7

给 AI 一张陶罐碎片图,它能还原破裂过程吗?Minimax H3 vs Seedance 2.0 Fast 实测

文章实测 MiniMax H3 和 Seedance 2.0 Fast,给模型一张破碎陶罐图,让其生成破碎过程视频。分析 H3 技术逻辑,对比两模型效率、质感和物理细节等差异,指出开放与闭源模型的特点及视频模型待解决的问题。

AI科技评论