「视觉-语言生成」共找到 3489 篇相关文章
Agentic Enterprise:生成式软件重新定义企业形态|AGIX PM Notes
文章指出软件正从静态代码集合变为“Living Software”,企业是其理想训练环境。还提及市场资金流向、多起企业投资合作事件,如英伟达投资英特尔、OpenAI租服务器等,最后介绍了ETF流动性相关知识。
Vercel Zero 引发争议:AI 时代真的需要一门新语言吗?
Vercel 推出 v0 API,让开发者能以编程方式访问其 AI 应用构建智能体,支持多种请求与外部工具。它将应用构建智能体作为基础设施开放,社区关注其对全程可编程应用开发的支持潜力。
AI生成内容行标来了!工信部立项管理,欢迎参与起草
据工信部通知,清华大学牵头的《元宇宙 共性服务 数字内容管理要求》行业标准获批立项并征集起草单位与专家。此为全国首部聚焦元宇宙数字内容标准,覆盖多环节,助力产业健康发展。
创新中心| AI视觉创意不再拼“出图快”,而是拼“人味浓”?
北京AIGC视听产业创新中心位于朝阳区,是推动影视制作基地建设的举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚60余家伙伴。首创郎园拓展能力,项目延伸多地。
NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据集
港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。
强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神
2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。
长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍
牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。
SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」
新加坡国立大学等机构团队提出 SPIRAL,让模型在零和游戏自对弈强化推理,摆脱人工监督。研究发现游戏可培养推理能力并迁移到数学,还开发系统保障训练,虽有局限但为 AI 发展指明方向。
千卡集群破壁之道:vivo视觉多模态大模型训练效率跃迁实战
多模态大模型在多领域需求增长,但千卡级 GPU 训练挑战大。vivo AI 架构师王兆雄在大会演讲,结合 LLaVA 和 DiT 模型实践,解析优化策略,分享提升训练效率与稳定性的经验,还展望了 AI Infra 未来。
Python语言从2.7到3.14的能力变化与演进逻辑
文章从编程风格、类库生态、性能优化等多维度,阐述Python从2.7到3.14版本的能力变化与演进逻辑。如编程风格现现代化转型,类库生态战略性调整,性能优化有突破性进展等,还分析了演进背后的推动力及未来趋势。