音频基础模型」共找到 7943 篇相关文章

产品应用8

6秒造一个「视频博主」,Pika让一切图片开口说话

8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。

机器之心
算法论文8

「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式

针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型

机器之心
新闻资讯7

Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨

2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。

AIGC开放社区
新闻资讯8

斯坦福吴佳俊「计算机与思想奖」获奖演讲全文:从一张照片,逆推一个世界|IJCAI 2026

8月20日,斯坦福大学吴佳俊在IJCAI 2026发表“计算机与思想奖”获奖演讲。他指出像素是表象,物理结构才是因果,提出以物理代码为桥,融合基础模型泛化力与物理模拟因果性,构建视觉与物理智能。

AI科技评论
新闻资讯7

腾讯回应 OpenClaw 之父 Peter 的“抄袭”指责;突发!字节AI视频模型Seedance 2.0发布紧急叫停;Mac mini因“养虾热”断货 | Q资讯

本周AI圈热点不断:腾讯回应OpenClaw之父“抄袭”指责;字节AI视频模型Seedance 2.0发布叫停;Meta或裁员20%;美团王兴谈海外战略与AI冲击;“养虾热”致Mac mini断货;DeepSeek V4和腾讯新混元模型4月将发布。

InfoQ
产品应用8

Notion 3.0 |AI转型最成功的互联网产品是怎么做的?

Notion更新3.0,可视为有所有上下文的通用Agent产品,能调用顶尖模型。它有基础AI能力,如选模型、加上下文等,还升级了Agent创建、MCP等功能,依托生态让提示词可变现。

歸藏的AI工具箱
开源动态8

“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式

Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型

GitHubStore
产品应用8

150PB工业数据+智能体革命,西门子开启AI制造新纪元

西门子在工业AI领域成果显著。其工业智能体系统贯穿工业脉络,Industrial Copilot提升开发效率。工业基础模型扎根150PB工业数据,与主流大模型路径不同。西门子靠数据和行业know - how构筑护城河。

机器之心
开源动态8

错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人

HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。

小华同学ai
新闻资讯7

万字对谈 Physical Intelligence(π):具身智能的卡点和下一步突破,到底在哪?

本文是对Physical Intelligence联创兼CEO和核心研究科学家的访谈。他们探讨具身智能现状,指出当前瓶颈是智能软件,还谈到VLM性能、数据收集、模型训练等问题,认为通用机器人基础模型被低估。

Founder Park