长视频生成」共找到 3155 篇相关文章

开源动态7

比NotebookLM更实用,基于LLM的AI PPT开源工具,连配套演讲稿都给写好了。

现在很多人用Nano Banana、NotebookLM做PPT,但存在字体、内容契合度等问题。本文推荐基于LLM的开源AI PPT工具LandPPT,它支持多格式文档生成、有深度研究等功能,协议宽松可商用。

开源AI项目落地
产品应用7

我有听书障碍,但被这个 AI 电台拿捏了

作者曾有听书障碍,却被 Huxe 这款 AI 音频 App 吸引。它由 Google 团队打造,能将邮件摘要、新闻等生成“私人电台”。有个性化简报、自定义音频内容等功能,集成 ASR、NLP 和 TTS 模块。

MacTalk
新闻资讯8

机器人界的「Imagenet 时刻」,李飞飞团队官宣全球顶级具身智能挑战赛

李飞飞团队与斯坦福AI实验室官宣首届BEHAVIOR挑战赛将登陆NeurIPS 2025。这是具身智能“超级benchmark”,涵盖1000个日常任务,以50个时段任务为核心赛题,还是全面的具身智能研究资源。

机器之心
新闻资讯8

AI 性格失控等诡异现象,终于有了科学解释

Anthropic新研究发现控制语言模型「性格特征」的人格向量,解释AI恶意、谄媚等现象。研究开发自动化流程生成向量,通过实验验证其对模型行为的控制,还有监控、防护等功能,不过也引发争议。

AGI Hunt
算法论文8

CVPR2025|MCA-Ctrl:多方协同注意力控制助力AIGC时代图像精准定制化

中国科学院计算技术研究所团队提出无需微调的通用图像定制方法 MCA - Ctrl,利用扩散模型内部知识,结合条件语义与主体内容。实验显示其在编辑和生成任务表现优,解决了现有技术瓶颈。

机器之心
新闻资讯7

直播预约 | 世界模型,点燃下一个AI爆点(第二期)

本周三‘世界模型’沙龙反响热烈,决定加场。4月23日19:00 - 20:30,机器之心集结4位专家探讨世界模型前沿话题,包括刘子纬、赵行、贾奎、刘桂良,直播在机器之心视频号进行。

机器之心
开源动态8

微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!

现在的 ASR 模型处理音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景。

开源星探
算法论文8

4D通用世界模型!中科院NeoVerse用百万单目视频直接构建

中国科学院自动化研究所与CreateAI团队构建4D世界模型NeoVerse,它用全新端到端架构,从单目视频高效重建4D高斯泼溅,模拟成像退化提升生成鲁棒性,在多任务表现卓越。

AIGC开放社区
开源动态8

微软的prompt压缩方案-LLMLingua,开源

使用大语言模型时,提示信息会致运行慢、费用高、易超限。微软推出的LLMLingua可压缩提示信息,有完整开源。它历经多版本演进,还能用于安全防御,使用简单,值得开发者跟踪。

AI与安全
推荐文章7

开发者不仅编写代码,也在创造世界

智能GitHub Copilot副驾驶等生成式AI技术出现,使编程从“指令式”转向“意图式”。开发者需具备对问题、模型、交互的新“品味”,微软相关工具顺应此趋势,峰会将探讨相关话题。

AIGC开放社区