语义动作流」共找到 612 篇相关文章

开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
开源动态8

最低 306KB,这款低延迟语音检测神器太绝了!

语音交互中,VAD至关重要。新开源的TEN VAD能精准识别语音起止,是替代WebRTC VAD和Silero VAD的优选。它低延迟、高准确率、极致轻量,已被Kaldi集成,还能跨平台部署,使用方便。

开源先锋
推荐文章8

Shopify 经验贴:如何搞出一个生产级别可用的 AI Agent 系统?

Shopify 以 AI 助手 Sidekick 为例,分享从简单工具调用系统演变为复杂 AI Agent 平台的经验,包括架构设计、评估方法和训练技术等方面,还给出构建生产级别可用的 AI Agent 系统的四条核心建议。

Founder Park
新闻资讯7

让记忆学会“进化”:探索 LLM Agent 的运行时价值感知与自适应检索 | 直播预约

本次直播将介绍最新研究成果 MemRL,提出作用于情景记忆的运行时强化学习方法,使 LLM Agent 能判断记忆价值,检索高价值经验,提升复杂未知环境下泛化性能与任务成功率。

深度学习自然语言处理
算法论文8

让扩散模型「可解释」不再降质,开启图片编辑新思路

过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。

机器之心
开源动态8

多模态开发革命!Gabber开源:图形化构建实时AI应用,效率提升10倍!

AI应用迈向多模态交互,传统开发方式周期长。开源项目Gabber是实时AI应用引擎,通过模块化与图形化简化开发,有诸多特性,还给出安装指南,适用于多种场景。

开源星探
新闻资讯7

当AI开始过度思考「hey」这个字…

两张对话截图展现语言模型缺陷,用户发简单问候,模型过度分析,从问候语正式程度到表情符号语义权重,这种过度分析让对话不自然,错过人类交重点。

AI工程化
算法论文8

世界模型最新综述!中科院联合MBZ、NTU、Oxford系统梳理前沿进展

中科院联合多机构及顶尖学者合作,系统梳理世界模型建模范式、方法等,归纳为四大分支,还梳理其在多领域应用、基准数据集等,讨论走向通用智能面临的障碍。

机器之心
算法论文8

国内首篇!融合语言模型的多模态触觉传感器,推动机器人触觉迈向人类水平

清华大学丁文伯团队联合多机构,受鸽子感知机制启发研发仿生多模态触觉传感器 SuperTac,构建 8.5B 参数触觉语言模型 DOVE,成果发表于《Nature Sensors》,推动机器人触觉迈向人类水平。

机器之心
算法论文8

北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统

现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。

AI科技评论