「扩散生成技术」共找到 4715 篇相关文章
ElevenLabs 发布“视频到音乐”:AI 读懂视频内容,为其创作氛围匹配的 BGM。
ElevenLabs推出“视频到音乐”功能,其“Eleven Music”模型能分析视频上下文、情绪和风格,一键生成匹配的定制背景音乐,还能添加画外音和音效,为创作者提供端到端音视频解决方案。
星标超 29 万,OpenClaw 两天两次大更!适配GPT 5.4,告别“抽卡式 Prompt”
GitHub星标超28万的AI Agent开源项目OpenClaw,在周六与周日迎来两轮重量级更新,集中在模型能力、Agent架构、工程部署及安全机制四个方向。2026奇点智能技术大会将邀专家探讨其产业实践价值。
特斯拉Cybercab正式上线:没有方向盘没有刹车,已开始在奥斯汀拉客
当地时间9月3日,特斯拉在奥斯汀启动Cybercab付费服务,该车无方向盘、刹车等。其成本约1.8万美元,远低于对手。不过,它面临监管和技术约束,目前投放规模小,未来发展待验证。
潘建伟团队突破量子操控极限!AI助力2024个原子60毫秒精准重排
潘建伟团队利用AI技术,60毫秒内构建2024个原子的无缺陷二维和三维原子阵列,刷新世界纪录。系统保真度追平国际最高水平,为构建容错通用量子计算机奠定基础。
AI 球球直播呼吁脑机接口开源,海外 KOL 疯狂艾特马斯克,疑似 X 宕机?
AI「论论」直播提出脑机接口「GPT 时刻」将到,认为该技术必然大规模到来,开源是唯一出路,引发全球社交媒体讨论。它描绘脑机接口利弊,呼吁大家思考技术安全保障。
首个长程Doc2Repo训练集!代码Agent不止修bug,开始造仓库
中国人民大学高瓴人工智能学院发布DeNovoSWE数据集,专注长程软件工程任务。它通过特定机制构造高质量数据,为代码智能体长程能力训练提供支持,实验显示能显著提升模型仓库生成能力。
AI 互动游戏的 GPT 时刻到了!谷歌Genie 3首测!太牛了!
谷歌去年发布世界模型Genie 3,支持实时生成可交互视频内容,因成本高未开放。现美国18岁以上Ultra用户可试玩,其操控延迟低、画面清晰、物理交互真实,还介绍了操作流程等。
突发:微软转向使用 Anthropic 以减少对 OpenAI 的依赖
据 The Information 报道,微软将为 Office 365 Copilot 引入 Anthropic 技术,减少对 OpenAI 依赖。因 Anthropic 模型性能更好,微软还将通过 AWS 付费访问其模型,此前 GitHub Copilot 已引入该技术。
AI应用开发与落地实践:从“能用”到“好用”的惊险一跃
本文深入剖析2025年AI应用开发四大核心范式与实践。涵盖AI Agent爆发、RAG技术深化、垂直AI落地及多模态应用,为开发者提供实战指南,助其将技术转化为成功产品。
解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南
给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。