「视频跟练」共找到 1068 篇相关文章
字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键
今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。
字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键
今天,字节正式发布豆包大模型 2.0 系列,围绕大规模生产环境需求优化,提供多款通用 Agent 与 Code 模型。其成本优势明显,多模态能力升级,未来将聚焦长链路智能系统构建。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
机器人“狂踹不倒”视频刷屏!太空舱遍布城市街巷,银河通用这几手秀麻了
银河通用发布全新通用动作追踪框架Any2Track,让机器人精确模仿人类动作,还能抗干扰。团队将动作捕捉学习解耦为两阶段,兼顾精准模仿与抗干扰。其银河太空舱让机器人融入生活,全栈自研技术推动具身智能落地。
免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频
Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。
腾讯悄悄出了个插件版“Cursor”,还跟微信小程序打通了。
腾讯云发布代码助手CodeBuddy 3.0,它是插件而非IDE产品,可融入各职位工作流。其亮点是打通微信开发者工具,能利用微信知识库直出小程序,作者体验后认为开发便捷,有望成创造与分发新渠道。
腾讯悄悄出了个插件版“Cursor”,还跟微信小程序打通了。
腾讯云发布代码助手CodeBuddy 3.0,它是插件而非IDE产品,可在多代码产品安装。其亮点是打通微信开发,能直出小程序。作者体验后用它半小时做出小程序,期待腾讯AI生态发展。
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。
每周产业洞察 | AI音视频模型能力全面嵌入“专业级视听内容”交付,对齐“制作级”
北京AIGC视听产业创新中心位于朝阳区,是朝阳区推动影视制作基地建设举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚近百家合作伙伴。首创郎园拓展服务能力,项目多地开花。
被Anthropic强制改名!Clawdbot 创始人一人开发、100% AI 写代码,腾讯又跟上了热度
个人AI助手ClawdBot席卷硅谷,后被Anthropic强制改名Moltbot。它由Peter Steinberger一人开发,近乎100%用AI写代码。该项目已开源,有诸多亮点,但也存在安全隐患,网友使用场景多样。