「多人物视频生成」共找到 2700 篇相关文章
理解与生成统一多模态模型:现状与未来 | 直播预约
从GPT - 4o到Gemini,AI实现跨模态联合理解与生成,核心是统一多模态基础模型。但开源社区构建强大统一模型面临挑战。南大等团队梳理超750篇论文分析技术路线,将有直播探讨现状与未来。
SceneWeaver:面向通用三维环境生成的反思型智能体框架
室内场景合成在具身智能兴起下愈发重要,现有方法存在局限。BIGAI提出SceneWeaver框架,通过基于工具的迭代优化统一多样场景合成范式,具有高保真模拟、强健物理交互等优势。
对话VAST曹炎培:2秒才是3D生成本该有的速度
本文对话VAST首席科学家曹炎培,介绍其最新Smart Mesh功能,仅靠提示词或参考图,2秒内极速生成3D模型。Tripo P1.0重构AI 3D底层范式,实现原生三维空间概率生成。VAST获5000万美元A轮融资,今年将推UGC 3D平台。
这个开源项目把视频处理与投稿接成一条流水线
Y2A-Auto是面向YouTube、AcFun和bilibili的自动化处理工具,将下载、识别、翻译等操作集成到Web管理后台。用户可手动或自动处理,支持多平台投稿,有多种功能和灵活配置,适合持续处理授权内容的用户。
视觉Token注入CLIP语义,走向多模态理解与生成新范式
腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。
Windows AI助手免费进化!能操作电脑、登录网页、生成代码
Windows Copilot正式更新,Microsoft 365 Copilot中Researcher智能体新增“计算机使用”能力,能操作电脑、登录网页、生成代码等。更新已在预览版上线,还介绍了其运行机制和性能测试情况。
倒反天罡:ChatGPT教人说话?36万视频+77万播客已证实!
最新研究警告,ChatGPT正改变英语表达方式,植入自身偏好。研究人员分析超36万视频和77万播客,发现GPT词汇使用率显著攀升。但研究有局限,且AI沟通还引发信任危机等问题。
阿里搞了个全能解析器,文档、图片、音频、视频一锅端
阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。
从亲密伙伴抢人,Cursor挖走Claude Code两位核心人物
据The Information报道,AI编程应用Cursor开发商Anysphere从Anthropic挖走Claude Code两位负责人。Cursor依赖Anthropic的AI,此举或让双方关系变复杂。同时,Anthropic年收入达40亿美元,Cursor业务增长也强劲。
Sora 2深夜来袭,OpenAI直接推出App,视频ChatGPT时刻到了
别家节前卷大模型时,OpenAI 悄悄发布 Sora2 并推出 App,还有配套视频推送算法防成瘾。Sora2 在物理准确性等方面优于以往系统,具备同步对话和音效能力,Altman 称是 ChatGPT for creativity 时刻。