音视频实时交互模型」共找到 1736 篇相关文章

推荐文章8

WaveSpeedAI 成泽毅:AI Infra 本来就是一门能挣钱的生意

WaveSpeedAI成泽毅本在大厂做Infra,后创业。他先在社区验证技术价值,创业首日就定全球化策略。WaveSpeedAI团队小而灵活,用利他思维合作,在视频生成领域降成本,验证了推理基建有市场。

Founder Park
算法论文8

真实联网搜索Agent,7B媲美满血R1,华为盘古DeepDiver给出开域信息获取新解法

华为诺亚方舟实验室提出 Pangu DeepDiver 模型,实现 LLM 搜索引擎自主交互新范式。它用真实互联网数据训练,在 WebPuzzle 等基准测试中,7B 的 DeepDiver 媲美 671B DeepSeek - R1,展现强大信息获取与泛化能力。

机器之心
新闻资讯8

Artificial Analysis 发布 2025 年 AI 现状 Q3 季报

Artificial Analysis发布2025年Q3 AI现状报告,揭示五大关键趋势,如推理模型占智能榜单前十、智能体能力突破、开源模型发布创新高、图像视频技术主流化、原生语音模型达生产级,还将举办简报会。

AGI Hunt
推荐文章8

AI,正在吞噬所有软件。

作者从用户体验设计师和公司创始人视角,探讨AI时代软件的变革。人人能造软件,成本降低;软件从资产变耗材;Agent填平人机交互鸿沟,产品形态转向Skills;用户可能不再是人;中间层正消亡。

数字生命卡兹克
新闻资讯8

刚刚,ChatGPT支持MCP了!一句Prompt即可全自动化

今天,OpenAI官宣ChatGPT的MCP功能上线,仅Plus和Pro用户可用。MCP可让AI模型等标准化交互,使ChatGPT自动化程度大幅提高。官方Demo展示其强大潜力,网友态度积极,但功能仍有改进空间。

新智元
产品应用8

抖音+Claude Code=?马斯克都要转发的产品!一句话,就能做一个中国风福尔摩斯游戏!

Loopit被称为‘AI编程版的抖音’,用户说句话就能做互动内容,如解谜游戏等。它让编程像拍视频一样成消费品,有创作和社区,结合抖音轻量与游戏互动感,粘性更高。

AI产品自由
开源动态8

开源黑科技!向量数据库,居然要被 MP4 给干掉了!

GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。

AGI Hunt
算法论文8

5秒完成3D场景编辑,北大&港中文&上海AI Lab搞出VGGT-Edit,120倍加速太炸了

北大、港中文等团队提出原生3D编辑框架VGGT-Edit,不再绕回2D,直接在3D空间编辑。它采用残差场预测等机制,在DeltaScene测试集表现出色,单次编辑约5秒,最高120倍加速。

量子位
新闻资讯7

Google 亲手证明:GUI 已死,但尸体还在动

Google DeepMind发布Flash - Lite Browser,能用Gemini 3.1 Flash - Lite实时生成网站。它表明GUI连预先设计都不需要,界面正发生三层分化,虽有不足,但展现界面从预制到即时生成的趋势。

AGI Hunt
算法论文8

强化学习的两个「大坑」,终于被两篇ICLR论文给解决了

现有强化学习算法基于理想化交互模式,难应对真实环境。Mila 实验室两篇 ICLR 2025 论文提出实时强化学习框架,分别解决推理延迟和动作缺失问题,还可结合使用,对关键领域意义重大。

机器之心