「实时语音技术」共找到 3268 篇相关文章
9位顶级研究员连讲3晚,华为盘古大模型底层研究大揭秘
华为诺亚方舟实验室成果颇丰,4月开发千亿级通用语言大模型Pangu Ultra,5月推出稀疏大语言模型Pangu Ultra MoE。5月28 - 30日,机器之心联合举办分享会,9位研究员揭秘量化、剪枝等关键技术突破。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
近日,智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,打破具身智能演进制约。
突发!OpenAI以64亿美元,收购iPhone设计师公司io
今天凌晨1点CNBC消息,OpenAI将以64亿美元全资收购前苹果iPhone设计师乔尼・艾维的AI设备初创公司io,推动其进军硬件领域。艾维将承担深度创意与设计职责,其创意团队Love From保持独立。
谷歌开源基于物理模拟的气象模型,能预测暴雨、台风、大干旱
传统通用循环模型处理小尺度有局限,谷歌开源基于物理模拟的神经通用环流气象模型NeuralGCM,在预测突发恶劣天气出色,还介绍其动态核心、物理模拟模块等,经测试有一定优势。
宇树机器人租不出去了
2025开年,宇树机器人因春晚表演成“顶流”,人形机器人租赁爆发。但热潮渐退,其租赁市场萎缩,复购率低。技术上实现简单动作难,商业化前景存疑,行业凸显理想与商业的矛盾。
Anthropic:现在学习FDE,年薪百万!
Anthropic大佬分享FDE岗位价值,指出其非外包,是面向客户的软件工程师。还阐述适合的人才、团队,纠正三大误区,强调客户买的是解决问题的过程,现场沟通能力正升值。
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
给Claude Code装个电表,这个开源的ESP32仪表盘火了
Clawdmeter是开源的基于ESP32的桌面小仪表盘,能监控Claude Code使用额度和会话状态。它通过电脑端daemon获取信息,用BLE蓝牙发送到ESP32屏幕显示,功能丰富,还像桌搭玩具。
具身智能空间视觉死穴,终于被最新顶会彻底解决!
招商局先进技术研究院下属实验室提出新的移动数据范式,以极低成本破解 VLA 的空间泛化瓶颈。研究团队识别出 VLA 模型三种捷径学习模式,提出层次化数据解耦策略,该方案在主流 VLA 模型上验证有效。
让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题
它石智航联合四大顶尖机构发布论文 “TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在真机验证中性能优异。