激波与涡识别」共找到 6668 篇相关文章

新闻资讯7

多模态扩散模型开始爆发,这次是高速可控还能学习推理的LaViDa

近期基于扩散模型的视觉 - 语言模型 LaViDa 出现,它继承扩散语言模型优点。自回归模型不同,扩散模型能并行、处理双向上下文。LaViDa 在多任务测试有竞争力,推理蒸馏和文本填空表现好,还能权衡速度质量。

机器之心
开源动态8

2K Star!颠覆PPT!这个560KB的HTML文件,把整个办公套件装进了一个文件里!

Bento是开源项目,把文档、编辑器等全打包进约560KB HTML文件,功能堪比PowerPoint。它数据纯JSON、支持AI协作端到端加密协作,还自研多个引擎,有多种上手和AI协作方式。

开源星探
产品应用8

全球第一,13个SOTA!我们找到了龙虾界掌管GUI的神

明略科技推出自研 GUI-VLA 智能体模型 Mano-P 1.0,不依赖 API 对接浏览器场景,可操作桌面软件网页界面。它在 13 个多模态基准榜单达 SOTA,支持本地运行,数据零上云,采用分阶段开源策略。

机器之心
算法论文8

工业级文本转SQL新思路:成本暴降、超3000列超大数据库依然稳健

华中科大复旦联合发布AutoLink框架,引入自主智能体,模拟人类工程师工作流。在不输入全量数据库模式下,实现对超大规模数据库模式的高精准链接筛选,以低Token消耗刷新两大榜单纪录。

AIGC开放社区
新闻资讯7

国产先进封装的协同进程,究竟走到了哪一步?

AI算力浪潮下,产业焦点从‘制程竞速’转向‘系统协同’,Chiplet2.5D/3D先进封装成关键路径。湾芯展上,硅芯科技牵头的‘Chiplet先进封装生态专区’让国产先进封装协同具象化,展现产业链闭环能力。

芯师爷
产品应用8

132万字实时字幕!阿里语音模型支持影视飓风100小时直播

阿里升级实时语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小时直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。

千问大模型
开源动态8

世界模型+强化学习=具身智能性能翻倍!清华&加州伯克利最新开源

具身智能发展中样本效率成瓶颈,传统无模型强化学习依赖盲目试错。清华加州伯克利团队提出BOOM框架,通过自举循环机制解决在线规划策略学习矛盾,实验表现卓越,为具身智能落地提供支撑。

量子位
开源动态8

港中文联手美团开源“视觉推理通才”!图像视频10类任务一网打尽

香港中文大学MMLab美团研究团队开源OneThinker模型,它可覆盖图像视频十类核心视觉任务,在31项测试中表现出色,还展现泛化能力。研究团队搭建数据集,并引入EMA - GRPO算法提升训练稳定性。

量子位
新闻资讯8

Demis Hassabis揭秘世界模型Genie 3的真正意义:为AGI打造无限“虚拟子宫”

Google DeepMind CEO Demis Hassabis产品负责人深度对谈,爆料将游戏智能体SIMA放入Genie 3生成世界训练,探讨AI从游戏到思考系统的演进、Genie 3意义及AGI评估挑战,还提及Kaggle合作推游戏竞技场。

AI寒武纪
产品应用8

全球首创!B站推出影视级TTS语音模型,支持零样本语音+情绪双克隆,精准时长控制!

近日,B站语音团队推出全新一代语音合成模型IndexTTS2,提供影视级音质、情绪克隆和时长控制。其情绪时长精细控制功能全球首创,还具备零样本语音克隆等能力,支持本地运行中英文双语。

开源星探