「音频驱动虚拟形象」共找到 856 篇相关文章
错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人
HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频,模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。
支持中文!NotebookLM自动生成播客
Google宣布NotebookLM语言摘要功能支持50多种语言,包括中文,可将上传文档转成播客对话形式。以一篇AI进化论文为例展示效果,其音频和内容质量不错,学习输入立体,还能助力AI播客创作。
“今天的顶级智能,一年后就会沦为平庸的廉价品” OpenAI总裁:AGI 的终极交互是“没有界面,没有产品”
OpenAI总裁Greg Brockman分享了对AI发展的看法,称2023年推出的插件功能失败,因当时大模型未准备好。他认为未来AGI是隐形虚拟助理,无界面和产品。还指出算力稀缺,智能折旧快,模型改进空间大。
DeepMind发布SIMA 2!打通「感知-推理-行动-反思」闭环
DeepMind推出的SIMA 2,可让智能体在虚拟环境中边聊天边进行复杂多模态推理。它整合Gemini能力,从指令执行者变为互动伙伴,有强大迁移泛化与自我提升能力,是迈向AGI重要一步,但也面临一些挑战。
深入解析多邻国的 FinOps 之旅:将云支出转化为工程洞察
多邻国在《每位工程师都该了解的 FinOps》中分享实践经验,将财务意识融入工程流程,用成本可视化机制让开发者了解成本影响,采用相关指标平衡创新与效率,借助工具优化成本,行业正从‘削减成本’转向‘数据驱动责任制’。
展览聚焦|类型叙事中的技术、情感与未来主义
中间美术馆正展出“抛锚歌单”,汇集16位中瑞艺术家作品。本文聚焦艺术家杨迪,他以影像和装置为媒介,借类型文学与电影叙事框架探讨科技时代困境。其作品揭示虚拟迁徙代价,还分享创作相关看法。
强化学习教父重出江湖, 生成式AI的时代要结束了?
新智元报道,强化学习之父Richard Sutton称GenAI时代正结束。他加入ExperienceFlow.AI,要让AI靠「经验」觉醒。该公司定位打造「经验驱动的去中心化超级智能」,认为AI下一阶段应从世界中学习。
当 Kanban 不再管理人:Routa Kanban 如何管理 Agent Team
本文探讨了 Routa Kanban 如何管理 Agent Team,指出在 AI4SE 时代,多 Agent 协作进入日常软件交付需建设管理界面与工程护栏。Routa Kanban 把多 Agent 协作推进到‘管理驱动’,其价值在于将隐性约束显性化。
谷歌新发现:DeepSeek推理分裂出多重人格,左右脑互搏越来越聪明
谷歌研究表明,DeepSeek - R1等顶尖推理模型解题时,内部会自发“分裂”出不同性格虚拟人格,像在进行社交、辩论会,且越“吵”越聪明。团队借助SAE解码其脑内群聊,还发现‘哦!’能提升推理准确率。
大模型之后,AI 开始“自己动手”了
从生成式AI到Agentic AI,互联网从“信息获取”转向“任务完成”。全球科技巨头抢滩智能体,国内腾讯云升级智能体开发平台。腾讯吴运声表示,技术与业务需求双轮驱动其发展,还分享了应对落地挑战的办法。