「模型应用」共找到 8826 篇相关文章
132万字实时字幕!阿里语音模型支持影视飓风100小时直播
阿里升级实时语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小时直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。
亲测太强了!2分钟用Gemini 3 pro实现拍立得应用
作者看到网友用Gemini 3 pro做的有趣应用后亲自尝试,在Google AI studio用Gemini 3 pro仅2分钟、三次对话就做出拍立得相机应用,还提供了照片删除和下载功能,附上实现过程和应用链接。
GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”
多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。
空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没
上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。
清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟
清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
1.3亿美元!LiblibAI拿下国内AI应用赛道年度最大融资
2025年,AI应用公司LiblibAI完成1.3亿美元B轮融资,由红杉中国等联合领投,老股东超额增持。这是今年国内AI应用赛道最大融资,标志投资热点转向应用层。该平台有独特生态,还将加速全球化布局。
模力工场 032 AI 应用榜:桌面 Agent 强势来袭,阶跃登顶本周榜首
模力工场032周AI应用周榜出炉,25款应用上架。本期用户讨论最高的是桌面Agent形态,AI从“对话框助手”走向“接管桌面执行者”。还精选十款应用解读行业风向,反映AI正进入执行与交付阶段。
李飞飞押注的3D世界模型黑科技,被这篇论文一次性扒光!
李飞飞创业公司World Labs发布空间智能模型成果,推出Marble平台。本文分享3D、4D世界模型技术综述,系统梳理原生表示的世界模型,给出分层分类法、数据集与评测指标,并开源维护。