图像与视频生成」共找到 2812 篇相关文章

产品应用8

谷歌推出“神经操作系统”原型,Gemini 2.5 Flash驱动,UI即时生成无需编码

谷歌开发者博客展示由大模型驱动的“神经操作系统”研究原型,由Gemini 2.5 Flash - Lite驱动,屏幕由大语言模型即时生成。介绍了实现UI即时生成等的核心技术理念,虽为原型但应用前景好。

AI寒武纪
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频

近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
算法论文8

MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」

麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。

新智元
新闻资讯8

看完快手这场沙龙,我对生成式推荐的判断变了

作者参加快手技术沙龙,认为生成式推荐正重构推荐系统底座。快手在生成式推荐领域体系化演进,如OneReason让推荐系统学会思考,Pool - Rec解决算力问题,OneSearch V2和GR4AD用于场景实践,还举办LLM - Rec挑战赛。

MacTalk
产品应用7

一步步实战 CopilotKit(AG-UI协议):生成式 UI 与集成 Human-in-the-Loop【下】

文章延续上篇Demo,探索CopilotKit在重要场景的应用,如基于Agent的生成式UI、HITL人类参与流程等。展示了相关实例操作步骤与前端效果,指出其为构建智能应用奠定基础,降低AI融合门槛。

AI大模型应用实践
算法论文8

ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架

北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”两阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备可解释性和可编辑性。

机器之心
算法论文8

ICML 2025 | 多智能体的ChatGPT时刻?上交MAS-GPT实现工作流一键生成

上海交通大学等机构推出 MAS - GPT,提出生成式 MAS 设计范式,可一键生成可执行的 MAS。它解决了现有 MAS 方法无适应性、成本高、泛化性低等问题,实验显示其表现出色,未来潜力大。

机器之心
产品应用7

用AI把一段视频变成可视化网页,Google的新模型又卷飞了。

Google更新Gemini 2.5 Pro至05 - 06版。此版代码能力在WebDev Arena盲测登顶,超Claude 3.7 Sonnet;还提升视频理解,可将视频转为可视化网页,虽有产品打磨问题,但进步值得肯定。

数字生命卡兹克
开源动态8

超越谷歌Banana,字节联合香港中文大学等高校开源最强图像编辑生成系统DreamOmni2

香港多高校与字节跳动联合研发的DreamOmni2系统,实现图像编辑与生成领域SOTA。它用三步造出高质量数据,提出索引编码等方案,联合训练模型,实际效果超越部分商业模型,为AI创作带来新可能。

AIGC开放社区
算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心