音视频识别模型」共找到 8187 篇相关文章

算法论文8

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。

量子位
产品应用8

一个重要的发布被忽略!Decart发布实时“Sora”,直播/游戏业迎来新变革

Decart推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创的“实时流扩散”技术。其响应时间低于40毫秒,攻克了“错误累积”和实现实时响应两大难题,还计划拓展应用及升级功能。

AI工程化
开源动态7

效果逼真到让人窒息!​开源Ctrl-Crash模拟车辆事故

近年来视频扩散技术在生成车辆碰撞真实场景时面临挑战,因驾驶数据集中事故样本稀缺。Mila团队提出Ctrl - Crash可控碰撞视频生成模型,支持反事实场景生成,但也存在一些局限。

带你学AI
新闻资讯7

Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨

2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。

AIGC开放社区
新闻资讯8

2026「中国 AGI 创新影响力机构 TOP 30」发布

过去一年 AI 行业变化溢出模型层,Coding Agent 铺开,视频生成实现商业变现,具身智能供应链成型。Founder Park 从四维度选出「中国 AGI 创新影响力机构 TOP 30」,涵盖多领域团队。

Founder Park
产品应用8

图像编辑新神器:英伟达用拍电影思维解决图像编辑与世界模拟一致性难题

AI图像编辑物理一致性难题待解,现有方法易产生违反物理定律的漂移编辑。英伟达和多伦多大学提出ChronoEdit框架,将图像编辑视为拍微型电影,借助视频生成模型的时间连续性知识解决问题,在实验中表现卓越。

AIGC开放社区
推荐文章8

他救了OpenAI、年赚过亿、三家明星CTO,却自曝跟不上AI发展了!硅谷大佬告诫:不是马斯克,就别碰大模型

Bret Taylor履历丰富,曾助力OpenAI解决危机。他认为AI市场将分化为前沿基础模型、AI工具层和应用型AI三个板块,不建议普通创业者做基础模型,看好应用型AI中Agent生态。还分享创业、编程等多方面见解。

InfoQ
新闻资讯8

字节 AI 卷出新高度:豆包试水“上下文定价”,Trae 覆盖内部80%工程师,战略瞄定三主线

近日字节分享 AI 技术发展三主线,6 月 11 日火山引擎有系列发布更新。豆包 1.6 实行上下文定价,成本降低;超 80% 字节工程师用 Trae;视频生成模型 Seedance 1.0 Pro 具性价比;智能体带动强化学习算力攀升。

AI前线
开源动态8

PaddleOCR 3.0发布:OCR精度跃升13%,支持多语种、手写体与高精度文档解析

2025年5月20日,飞桨团队发布并开源PaddleOCR 3.0,适配飞桨框架3.0正式版。其提升文字识别精度,支持多文字类型和手写体识别,满足复杂文档解析需求,结合文心大模型4.5 Turbo提升关键信息抽取精度,还新增国产硬件支持。

开源AI项目落地
产品应用8

刚刚,好莱坞特效师展示AI生成的中文科幻大片,成本只有330元

AI领域发展迅速,视频生成能力提升。百度全球首发中文音视频一体化模型百度蒸汽机2.0,实现人物口型等毫秒级同步,多版本升级且价格有竞争力。实测效果好,技术上解决难题,还开创应用驱动研发范式。

机器之心