混元世界模型1.5」共找到 9219 篇相关文章

产品应用8

132万字实时字幕!阿里语音模型支持影视飓风100小时直播

阿里升级实时语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小时直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。

千问大模型
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。

深度学习自然语言处理
开源动态8

空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没

上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。

机器之心
新闻资讯7

真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge

Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。

新智元
推荐文章8

对话RoboScience邵林:VLOA大模型如何突破具身智能泛化瓶颈

本文对话RoboScience联合创始人邵林,探讨VLOA大模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。

甲子光年
开源动态8

刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3

互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型

量子位
8

李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!

全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。

新智元
产品应用7

本地运行OpenAI Whisper语音识别模型,Unity3d环境下高性能离线转写解决方案

这是为whisper.cpp提供的Unity3D绑定库,能在本地设备高性能运行OpenAI Whisper自动语音识别模型推理。支持多语言识别与翻译,有不同大小模型,可本地运行,还介绍了使用方法。

GitHubStore
新闻资讯7

OpenAI宋飏被Meta挖跑了!扩散模型崛起关键人物,加入MSL再会师清华校友赵晟佳

最新消息,扎克伯格从OpenAI挖走华人研究员宋飏。他是扩散模型崛起关键人物,曾带队OpenAI战略探索团队。在OpenAI他成果显著,其研究或终结扩散模型。现加入Meta MSL,与清华校友赵晟佳会师。

量子位
开源动态8

耶鲁等团队联合发布首个虚拟细胞Agent,可自动设计出先进的模型

耶鲁等团队发布首个多智能体系统CellForge,可自动化设计虚拟细胞模型。它能输出模型架构和代码,有跨模态能力,性能超多个领域代表性模型,可降低科研门槛,加速药物研发。

力学与人工智能