「多模态编辑」共找到 1123 篇相关文章
在参与OpenAI、Google、Amazon的50个AI项目后,他们总结出了大多数AI产品失败的原因
Aishwarya Naresh Reganti和Kiriti Badam参与超50个AI项目后,指出多数AI产品失败。他们认为构建成本降低,但设计和明确痛点才是关键,还分享开发陷阱、成功路径,介绍CC/CD框架及AI未来走向。
这个真人版《火影忍者》竟然是AI做的,来自中国AI视频新王者Vidu Q3
开年国产AI竞争激烈,AI视频生成圈新出全球首个支持16秒音视频直出的Vidu Q3。它能全自动生成,语言支持多语种,经权威认证排名中国第一、全球第二,可实现图生和文生音视频,提升了AI视频生成能力。
2026 初的大模型,离电影 Her 还有多远?
作者重看电影《Her》后,对比 2026 年初现实 AI 与电影中萨曼莎的能力,从七个维度分析差距。指出功能性上已接近,但存在性层面差距大,还探讨了 AI 发展趋势与存在意义。
人类记忆 vs 大模型记忆,到底差在哪?
这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型大语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。
和快手聊了之后才知道,传统搜索早变天了
文章从工程师视角剖析现代搜索,指出传统搜索难适应多模态内容世界。快手推出 UniDex 和 UniSearch,前者变革搜索倒排,后者为统一生成式搜索架构,二者成快手新一代工业搜索‘双引擎’,有广阔应用前景。
AI视频进入“加速度”时代:30%加速+细节随手P,等等党和抽卡党都有救了!
AI视频进入“加速度”时代,拍我AI(PixVerse)V5 Fast上线。其生成速度提升超30%,还推出Modify精修功能,支持万物替换、局部修改、人物编辑等,让AI视频从一次性生成走向可反复打磨。
具身智能一步踏入Scaling Law!10B+基础模型,27万小时真实数据
AI机器人创业公司Generalist推出新型具身基础模型GEN-0,参数量10B+,专为多模态训练构建。该模型展现强大Scaling Law,能力可扩展,有和谐推理等特性,在多方面有突破,成果备受赞誉。
NeurIPS 2025 | ARGRE框架实现高效LLM解毒:自回归奖励引导,安全对齐更快、更准、更轻
北航等机构研究提出自回归奖励引导表征编辑(ARGRE)框架,在LLM潜在表征空间可视化毒性变化路径,实现测试阶段高效“解毒”。实验显示其降低毒性、缩短推理时间,不影响模型能力,优于基线方法。
腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实
腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。
Vision-Zero:零数据VLM自我进化!陈怡然团队提出零监督训练新范式
陈怡然团队提出零监督训练新范式Vision-Zero,在多模态任务表现突出。它借鉴自博弈技术,设计自博弈框架,解决数据稀缺和知识天花板问题,还缓解跨能力负迁移,开源代码与模型可供研究。