「多人对话视频生成」共找到 1525 篇相关文章
AI 巨头对话:Sam Altman 与 Satya Nadella 论 AI 未来、算力与微软王牌
OpenAI的Sam Altman和微软的Satya Nadella在播客中探讨AI未来等话题。涉及1.4万亿算力投入、微软与OpenAI新合作协议细节,指出瓶颈在数据中心和电力,还谈及AI经济模型、未来愿景等。
教育工作者如何使用AI?Anthropic分析了7.4万份对话后,发现了这些
Anthropic分析7.4万份匿名对话,揭示高校教师用Claude的情况。教师用AI场景多样,如课程开发、学术研究等。使用方式分协作增强与完全委托,AI评分有争议,研究也存在局限。
3.4K star!阿里出品对话式UI神器,轻松打造专业级聊天界面!
ChatUI 是阿里开源的对话式 UI 设计语言与 React 组件库,有智能消息流处理、无障碍访问认证等亮点。技术架构明确,与同类项目对比优势独特,还给出使用指南和实践场景。
无限长、零掉帧!StableAvatar口型同步全新技术
当前音频驱动头像视频生成扩散模型合成长视频时难兼顾音频同步与身份一致,瓶颈在音频建模。复旦大学提出StableAvatar,首个端到端视频扩散Transformer,能无限时长生成,还介绍原理与演示效果。
Claude Code 新增 /btw 功能:让你在 AI 干活时「插嘴」提问
Anthropic工程师Thariq宣布Claude Code新增`/btw`命令,支持在其执行任务时开启「旁路对话」。该功能不打断任务、不污染主对话历史,能解决提问痛点,反映AI编码工具走向「持续协作」趋势。
对话 Befreed 创始人:从「个人学习」切入的 AI Agent,把学习变成一种生活方式
文章对话 Befreed 创始人 Jisong Liu ,介绍其以「强个性化学习 Agent」为核心的音频学习产品,它能把零散学习累积成知识路径,采用订阅制,有付费转化,还分享了创业、社媒运营等经验。
字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理
字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。
当Sora 2意外停摆,这个国产视频生成创业团队,直接「开源」三连击
OpenAI叫停Sora 2项目,同期北京AI初创公司Sand.ai在GitHub连续三天开源核心技术栈,包括音视频同出大模型、分布式Attention组件、全局编译框架,还介绍了团队和产品,展现全栈实力。
SIGCOMM 2025|重新定义个性化视频体验,快手与清华联合提出灵犀系统
快手与清华孙立峰团队联合发表论文,提出灵犀系统,这是业界首个大规模生产环境中面向用户个性化体验的自适应视频流优化系统。该系统能解决现有方法在部署中的难题,实现个性化QoE优化。
SGLang|SGLang Diffusion
来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。