学术视频自动化」共找到 1566 篇相关文章

开源动态8

LeCun预言成真!790年长视频,炼出最强开源「世界模型」

2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。

新智元
算法论文7

SSM+扩散模型,竟造出一种全新的「视频世界模型」

在AI热词不断涌现的时代,斯坦福大学等机构研究将长上下文、状态空间模型、扩散模型等结合,创造全新「视频世界模型」。它用状态空间模型实现长期记忆,还设置局部注意力机制,训练和推理表现出色。

机器之心
开源动态7

当AI小说遇上短视频:这款神器让你1秒变导演!

作者小G推荐开源项目TaleStreamAI,它能将AI小说片段转为电影感短视频,具有全自动处理等功能,官方提供一键安装包,对创作者、程序员等有不同价值,开发者还在招募人员。

GitHubStore
产品应用7

从人工到AI驱动:天猫测试全流程自动化变革实践

AI时代,天猫技术质量同学探索AI在测试全流程提效的落地方案,将传统测试工作链拆解为五阶段,目标是实现全流程自动化等。介绍了测试体系变革、所需关键能力、技术架构及落地收获与未来趋势。

阿里云开发者
算法论文8

CVPR 2026 | 1000万段驾驶视频,教会模型如何估计相机位姿

Wayve的LA - Pose研究,不依赖百万级3D标注,从约1000万段未标注驾驶视频自监督学习‘潜在动作’,再用少量3D标注微调,转化为相机位姿估计能力,在多基准上提升精度且泛化能力强。

机器之心
算法论文7

Waver:面向统一图像与视频生成的高性能基础模型

字节提出的Waver是面向统一图像与视频生成的高性能基础模型,支持T2V、I2V、T2I。它引入新架构、结合筛选流程与质量模型。虽有局限,但表现出色,架构设计独特,功能多样。

带你学AI
开源动态8

Google刚刚开源的一款AI工具,Gemini 2.5驱动浏览器自动化

Google在GitHub开源AI浏览器自动化工具Computer Use Preview,基于Gemini 2.5模型,用自然语言控制浏览器完成复杂任务。支持双环境,集成Gemini API/Vertex AI,适用于Web测试等,零代码入门。

开源星探
开源动态8

突发!微软刚开源GitHub Copilot Chat,超强AI Agent自动化编程

今天凌晨4点30,微软首席执行官分享VS Code的最新AI开源编辑器GitHub Copilot Chat。其亮点是支持AI Agent自动化编程,能执行多步骤编码任务。还支持人机协作、MCP协议等,在GitHub很受欢迎。

AIGC开放社区
产品应用8

生产级Prompt自动化推理评估A/B实验结果的工程实践

本文围绕生产级Prompt自动化推理评估A/B实验结果展开,介绍系统背景与痛点,展示主Prompt和决策树,用deepseek - r1等模型推理。通过分析Bad Cases优化Prompt,总结设计原则和迭代方法,还给出通用启示与展望。

阿里云开发者
开源动态8

Sora2还在5秒打转,字节AI生视频已经4分钟“起飞”

字节和UCLA联合提出Self - Forcing++方法,无需更换模型架构或重收集数据集,就能生成分钟级长视频,最长达4分15秒,高质量且开源,在长、短时长生成上性能领先。

量子位