视频分镜」共找到 1565 篇相关文章

算法论文8

从打器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
新闻资讯7

欧洲黑马Mistral Medium 3来了!跑对标最强Claude,实测大翻车

Mistral AI发布多模态模型Mistral Medium 3,官方称其性能接近Claude Sonnet 3.7且成本低,有诸多亮点。但网友实测结果不一,部大佬认为性能不如官方宣传,建议别下载。

新智元
产品应用7

刚刚,Top级的视频AI免费了!我反手做了个精致版《牛来》

明星AI实验室Agnes发布的Agnes Video 2.5系列已上线Pavo创作平台。其中,Agnes Video 2.5 Flash免费,适合AI短剧创作者;Agnes Video 2.5每天送积,适合商业场景。实测显示其效果佳,免费还能大胆试错。

量子位
新闻资讯8

谷歌Gemini 3.2偷跑上线!2200行代码一到底,Claude/GPT坐不住了

发布会未开,谷歌Gemini 3.2 Flash网页端静默上线,编码实力强悍,代码量大幅提升。其核心技术是蒸馏与稀疏化,推理成本大降。Gemini App集成第三方应用,谷歌I/O大会多款产品将曝光,此次发布对谷歌至关重要。

新智元
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。

InfoQ
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今天,字节正式发布豆包大模型 2.0 系列,围绕大规模生产环境需求优化,提供多款通用 Agent 与 Code 模型。其成本优势明显,多模态能力升级,未来将聚焦长链路智能系统构建。

AI前线
开源动态8

长达790年视频头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”

北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。

AIGC开放社区
开源动态8

机器人“狂踹不倒”视频刷屏!太空舱遍布城市街巷,银河通用这几手秀麻了

银河通用发布全新通用动作追踪框架Any2Track,让机器人精确模仿人类动作,还能抗干扰。团队将动作捕捉学习解耦为两阶段,兼顾精准模仿与抗干扰。其银河太空舱让机器人融入生活,全栈自研技术推动具身智能落地。

量子位
新闻资讯7

GPT-5“变笨”实锤,退休教授出了道井字棋送题,结果它真送了

退休经济学教授用井字棋简单问题测试GPT - 5,其表现拉胯,与“博士级AI”宣传不符。后续操作离谱,或因OpenAI策略调整。此外,OpenAI在测ChatGPT新功能,奥特曼开始炒GPT - 6。

量子位
开源动态8

【博客翻译】使用PyTorch加速生成式AI第四部:Seamless M4T,快速优化

这是使用纯原生PyTorch加速生成式AI模型系列博客的第四部,专注加速FAIR的Seamless M4T - v2模型。通过torch.compile + CUDA Graph,在不损失精度下实现text decoder模块2倍、vocoder模块30倍加速,端到端推理2.7倍加速。

GiantPandaLLM