素材转视频」共找到 1105 篇相关文章

产品应用8

pdf2skill:让计算机视觉初学者把PDF文档变成AI技能包

pdf2skill技术是“文档技能编译器”,能将PDF知识化为AI可调用技能包。它解决了计算机视觉研究和工程中的痛点,介绍了原理、实战案例、代码实现,还对比性能、给出使用指南。

机器学习AI算法工程
开源动态8

本周 5 个火火火的Github开源项目,太香了!

文章介绍了本周5个热门GitHub开源项目。有能生成城市地图海报的MapToPoster,离线翻译工具Argos Translate,终端历史增强神器Atuin,轻量超高效版OpenClaw的PicoClaw,以及开源轻量级文本语音工具Pocket TTS。

开源先锋
产品应用8

1700个OpenClaw技巧,我用多邻国的方式学会的!

AI带来学习方式变革,OpenClaw技巧众多难记。智谱清言APP的学习搭子功能,可将GitHub项目生成多邻国式课程,还能处理论文、演讲等素材,通过多种技术实现知识读薄、读活、读透。

量子位
开源动态8

国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线

蚂蚁灵波发布开源SOTA级世界模型LingBot - World,全面对标谷歌Genie 3,部分性能指标超越。它有高保真、长视频生成等优势,还能解决具身智能痛点,发布后引发海外关注,促使Genie将开源。

新智元
开源动态8

蚂蚁深夜开源比肩Genie 3的世界模型,我也看到了具身智能的未来。

蚂蚁旗下灵波科技凌晨开源世界模型LingBot-World,可对标Google Genie 3。它能实时交互生成世界,与视频生成模型不同。有三个版本,具备长时记忆稳定、风格泛化性强、动作代理出色等特点。

数字生命卡兹克
产品应用7

更新啦!我用 Claude Skills 做的剪辑 Agent!识别效果+交互大升级

作者成峰根据用户反馈对剪辑 Skills 做了大改,替换火山引擎音视频识别模型、提升交互界面。改进包括用 API 替代本地模型、重构口误识别系统、设可视化审核界面,还介绍了简单使用方法。

AI产品自由
产品应用8

豆包的新身份曝光:在国际艺术展当起了“AI讲解员”

文章讲述作者在浦东美术馆「AI与艺术」豆包讲解体验日活动的经历,实测豆包作为AI讲解员的业务水平,如筛重点、实时讲解、补知识,还揭秘其靠豆包大模型1.8的多模态处理等能力任职。

量子位
算法论文8

人脸机器人登上Science Robotics封面:用AI教会仿生人脸机器人「开口说话」

2026年1月15日,美国哥伦比亚大学工程学院研究登上《Science Robotics》封面,展示用AI让仿生人脸机器人“开口说话”技术。机器人经自监督学习,能将声音自然唇动,有跨语言泛化能力,助其跨越“恐怖谷”。

机器之心
算法论文8

SIGGRAPH Asia 2025最佳论文 | 港中大、曼彻斯特大学获奖

SIGGRAPH Asia 2025将“最佳论文奖”颁给港中大与曼彻斯特大学团队研究。该研究提出全新切片计算框架,把切片生成与路径规划化为数学优化问题,解决传统DLP 3D打印难题,还介绍了进阶策略和实验结果。

机器之心
产品应用8

万相2.6 X千问APP,功能价值和情绪价值兼具|甲子光年

12月16日阿里发布视频生成模型“万相2.6”,实现“角色扮演”功能突破。千问APP接入后上线“AI小剧场”,打破次元壁。千问兼具功能与情绪价值,阿里全栈布局助力其成“超级入口”。

甲子光年