实时视频推理」共找到 3149 篇相关文章

开源动态8

视频存储文本的黑科技!

memvid-rs是memvid的Rust重实现,可将文本文档编码为视频二维码实现存储和检索。它有高性能、用TRUE机器学习等特点,兼容多格式、跨平台,无需安装,适合存档文本语料库等。

GitHubStore
推荐文章8

Fluss 湖流一体:Lakehouse 架构实时化演进

湖仓一体 Lakehouse 成主流架构,但数据时效性最多达分钟级。阿里云罗宇侠在 QCon 大会分享 Fluss 湖流一体方案,解析技术架构与原理,介绍融合趋势、核心优势、使用方法及未来规划。

InfoQ
产品应用7

DeepSeek-R1 更新,思考更深,推理更强

DeepSeek R1 模型完成小版本升级至 DeepSeek - R1 - 0528,用户可在官网、APP 等体验,API 同步更新。该版本强化深度思考能力,在多基准测评表现优异,还改善幻觉、提升创意写作等能力。

AI工程化
开源动态7

1.5B参数!支持本地实时语音转录

Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。

AI工程化
新闻资讯7

余家辉交卷!Meta MSL连发图像/视频模型

Meta MSL由余家辉带队发布图像模型Muse Image,开启视频模型Muse Video预览。Muse Image表现出色,采用独特创作流程,能与Muse Spark联动,有多种实用功能;Muse Video待改进,将未来几月推出。

量子位
新闻资讯8

英伟达新GPU,超长上下文/视频生成专用

在AI Infra Summit上,英伟达宣布推出NVIDIA Rubin CPX GPU,专为处理百万token级代码生成和生成式视频应用。它是首款为超大上下文AI量身定制的CUDA GPU,性能强且能效高,预计2026年底推出。

量子位
开源动态8

斯坦福开源复杂推理AI Agent,融合超10种工具

传统AI助手应对复杂任务能力有限,斯坦福开源OctoTools,这一复杂推理AI Agent融合11种工具。它在16项基准测试中准确率高,能应对多领域复杂场景,框架含工具卡片、规划器等构件。

AIGC开放社区
开源动态8

让本地大模型不再重复推理的缓存技巧

本地跑大模型时,同样问题换说法问,模型又要重新推理。`constraint-cache`这个Python库可解决此问题,它将语义相似查询规范化为统一缓存键,实现近乎即时的重复查询响应,还避免了随机性响应问题。

AI工程化
新闻资讯8

AI Spot 学术分享会丨ICLR 2026 深度推理专场

当大模型走向深度推理,ICLR 2026 汇聚全球顶尖成果。OpenMMLab 等联合发起 AI Spot ICLR 2026 学术分享会,5 月 14 日 19 点直播,聚焦模型‘慢思考’,嘉宾将解读四大核心技术。

OpenMMLab
产品应用8

CapCut Mate:开源剪映自动化神器,让AI替你剪视频

CapCut Mate是开源免费的剪映草稿自动化助手,让开发者通过API控制剪映核心功能,效率提升超100倍。它功能丰富,覆盖剪辑全流程,适用于多场景,还提供三种使用方式。

小华同学ai