可交互音视频」共找到 5044 篇相关文章

新闻资讯8

陈天桥旗下盛大AI东京研究院于SIGGRAPH Asia正式亮相,揭晓数字人和世界模型成果

在SIGGRAPH Asia 2025期间,盛大AI东京研究院首次公开亮相。当前数字人交互缺乏“灵魂”,存在长期记忆与人格一致性、多模态情感表达缺失和缺乏自主进化能力等问题。为此,研究院推出Mio框架解决挑战。

机器之心
开源动态8

首个基于MCP 的 RAG 框架:UltraRAG 2.0用几十行代码实现高性能RAG, 拒绝冗长工程实现

检索增强生成系统(RAG)复杂度提升,工程实现成本高。清华大学等联合推出首个基于MCP架构的UltraRAG 2.0,组件化封装、调用扩展灵活,低代码实现高性能,用于科研和行业应用。

AI前线
产品应用8

Claude Code 首席工程师揭秘 AI 如何重塑开发日常!

近日,Anthropic发布Claude Code首席工程师Boris与对外沟通负责人Alex的对话,揭秘Claude Code诞生、能力、技巧与展望。它在终端辅助编程,适配多环境,还集成Claude Max套餐,新模型让其功能更强大。

AI科技大本营
新闻资讯8

画质重生,第一!腾讯TEG香农实验室斩获CVPR 2025 UGC Video Enhancement 冠军

CVPR NTIRE是计算机图像恢复与增强领域有影响力的赛事。在NTIRE 2025 UGC Video Enhancement中,腾讯TEG香农实验室团队自研算法夺冠,成果落地提升视频清晰度。团队还参加实时赛道获佳绩,且做了硬件推理优化。

腾讯技术工程
产品应用8

Notion 3.0 |AI转型最成功的互联网产品是怎么做的?

Notion更新3.0,视为有所有上下文的通用Agent产品,能调用顶尖模型。它有基础AI能力,如选模型、加上下文等,还升级了Agent创建、MCP等功能,依托生态让提示词变现。

歸藏的AI工具箱
产品应用8

国内首个免费提供的深度研究,反而有市面上最好的体验

秘塔深度研究(https://metaso.cn/)上线,是首个将深度研究作免费基础功能的产品。它在算法、交互等多方面优化,降低成本、保障准确,还创新交互形式,搜索结果清晰有条理,体验佳。

歸藏的AI工具箱
开源动态7

免费开源低成本的3D动作捕捉系统

FreeMoCap是无标记点3D动作捕捉系统,用普通USB摄像头就能实现研究级全身动作捕捉,支持单/多相机模式,输出3D骨骼数据,导入Blender等工具,具有低成本、开源扩展等优势。

GitHubStore
开源动态8

哈工大发布动画多智能体,文本一键生成连贯动画

随着多模态模型兴起,AI生成叙事性视频成热点,但现有方法处理长视频有挑战。哈工大发布AniMaker框架,由多个智能体协作,实现文本到动画自动化转换,解决了视觉连贯和叙事一致等问题。

AIGC开放社区
开源动态7

深度体验超牛超多功能的开源AI菜谱工具,AI让每个人都以是米其林大厨。

文章推荐了开源AI菜谱工具“一饭封神”,它能根据食材、口味、人数等生成菜谱,还有营养分析、饮品搭配等功能,有多种趣味板块,玩性和实用性强,比部分小红书菜谱靠谱。

开源AI项目落地
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所与腾讯AI Lab团队,从解释性分析出发,发现LLM内部含多个采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上表现优于传统算法。

PaperAgent