实时世界模型」共找到 8095 篇相关文章

新闻资讯8

AI 的下一个战场:端侧模型崛起

模型退烧,小模型接棒。腾讯、阿里等大厂纷纷官宣小模型成果,英伟达、OpenAI 等也有相关动作。端侧模型赛道广阔,但技术含量不低,面壁智能在端侧模型探索上成果丰硕,其 MiniCPM 系列不断迭代,还在多领域落地。

AI科技评论
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。

带你学AI
开源动态8

MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行

面壁智能等发布 MiniCPM-o 4.5 技术报告,开放全双工全模态 API。该模型 9B 参数,RTX5070 可实时运行,下载量超 25 万。报告披露 Omni - Flow 框架,模型性能强,还能催生新应用。

AI前线
新闻资讯7

LeCun离职后不止创一份业!押注与大模型不同的路线,加入硅谷初创董事会

离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流大模型路线不同,其Kona模型在数独测试上表现远超大模型

量子位
新闻资讯7

模型是「躲在洞穴里」观察世界? 强化学习大佬「吹哨」提醒LLM致命缺点

加州大学伯克利分校副教授、强化学习大牛Sergey Levine在博客指出,当前大语言模型(LLM)只是对人类大脑和思维的间接「扫描」,如同被困洞穴看人类智慧「投影」,无法代替真正思维。

机器之心
算法论文8

ECCV 2026 | 一段视频,重建一个可仿真的动态世界

机器人走出实验室后,训练数据需覆盖真实世界情况。OVOW由多团队完成,被ECCV 2026接收。它从单目视频出发,输出可编辑、可碰撞的实例级Mesh,串联视觉基础模型完成流水线工作,能用于物理仿真。

机器之心
产品应用8

谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果

Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用多平台多语言,谷歌期待用户反馈以优化体验。

AI寒武纪
开源动态7

NovaSR:一个52KB的音频超分模型,把16kHz模糊音频变成48kHz清晰版

最近,只有52KB的音频超分辨率模型NovaSR开源,能把16kHz模糊音频变成48kHz清晰版,处理速度极快,可实时处理音频流。它能提升TTS模型质量等,虽有不足,但平衡了速度与质量。

AI工程化
新闻资讯8

逛完世界机器人大会,我们发现了四大趋势|甲子光年

2025世界机器人大会8月8日在北京开幕,有200余家企业参展。甲子光年总结四大趋势,如激光雷达厂商入局、人形机器人进厂、VLA模型异军突起、仿生机器人走入现实,预示机器人产业走向实战。

甲子光年
新闻资讯8

刚刚,Gemini 2.5系列模型更新,最新轻量版Flash-Lite竟能实时编写操作系统

谷歌更新Gemini 2.5系列模型,包括2.5 Pro和Flash稳定版及新推出的Flash-Lite预览版。谷歌CEO称Flash-Lite性价比高,适用于量大且注重成本的任务。报告还提及“智能体恐慌”现象。

机器之心