「视频学习」共找到 2288 篇相关文章
第一股AI亚文化兴起了
今年兴起由文生视频技术推动的AI亚文化,如AI生成的职场视频,主角是Sam Altman对历史名人进行PUA,国内外这类视频数据都很好。亚文化兴起特征是解构权威,且技术成熟促使其诞生。
快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了
ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。
马斯克宣布:Grok学会看片了!无字幕看懂陶哲轩菲奖级难题
马斯克宣布Grok可分析任何视频。它能对伪造视频鉴假溯源,但也有处理画面靠字幕、有幻觉问题和效果不稳定的缺陷。实测中它能理解无字幕视频,还整理访谈内容。这功能虽便利,但引发人类能力退化担忧。
30万被引的AlphaGo之父,创业4个月融资近百亿元!笃信RL实现ASI
4月27日,AlphaGo之父David Silver创办的Ineffable Intelligence获11亿美元种子轮融资,投后估值51亿美元。该公司押注强化学习和自我经验学习,试图挑战大模型主线。未来或采用大模型预训练和强化学习混合路线。
当AI遇到物理学 —— AAAI大会主题演讲(Daniel)
2026年AAAI大会上,物理学家Daniel Whiteson演讲探讨机器学习与基础物理。指出粒子物理用还原论解释宇宙,虽发现基础粒子,但仍有诸多未知。粒子对撞实验复杂,需机器学习辅助,深度学习已广泛应用,还能助力发现新粒子。
The Batch:927|极速扩散学习
研究表明扩散图像生成器学习重建预训练编码器嵌入可加快训练,Apple团队提出的FAE,通过缩小嵌入再重建解决了因嵌入尺寸大导致的训练受阻问题,性能与先进模型相当且训练更快。
对「学习」的一切认知都错了
曾被认为不可能的超大模型如今成功驱动ChatGPT等,改变了对学习的理解。彩票假说解释其成功:大网络有中奖子网,能提供更多找简单解的机会,调和了经验与经典理论。
LightX2V Ulysses Attention 实现学习笔记
本文记录了LightX2V中Ulysses Attention的实现方式与张量形状推导。在多模态/视频场景,其实现可概括为一种layout变换,还提供`enable_head_parallel`和`use_fp8_comm`选项,效果受运行环境等因素影响。
RSS 2025|从说明书学习复杂机器人操作任务:NUS邵林团队提出全新机器人装配技能学习框架Manual2Skill
新加坡国立大学邵林团队提出 Manual2Skill 框架,利用 VLMs 将说明书视觉指令转化为机器人装配技能,含层级化装配图生成、分步骤位姿估计、动作生成与执行三阶段,实验验证其在多场景的有效性。
余家辉交卷!Meta MSL连发图像/视频模型
Meta MSL由余家辉带队发布图像模型Muse Image,开启视频模型Muse Video预览。Muse Image表现出色,采用独特创作流程,能与Muse Spark联动,有多种实用功能;Muse Video待改进,将未来几月推出。