商汤悟能」共找到 5056 篇相关文章

新闻资讯7

14万一台家务机器人!斯坦福华人博士具身创业首款产品亮相,用户还买回去自己教

斯坦福华人博士赵子豪与迟宬创业推出家务机器人Memo,售价2万美元。它完成多项家务,依赖ACT - 1具身模型,该模型用技捕捉手套采集人类数据训练,用户还教它新本领,预计2026年正式推出。

量子位
算法论文8

仅看视频就copy人类动作,宇树G1分分钟掌握100+,UC伯克利提出机器人训练新方式

UC伯克利团队研发出名为VideoMimic的新系统,将视频动作迁移到真实机器人。它已让宇树G1模仿100多段人类动作,还适应各种地形。其工作流程含视频转仿真、仿真训练策略、策略迁移到实体机器人。

量子位
产品应用7

豆包大模型2.0+Claude Skills,3步装好,终于有AI帮我"看视频做笔记"了!火山引擎全系列可用!

传统视频总结工具只基于音频总结,内容浅显。而豆包大模型2.0是多模态原生模型,同时处理画面和声音。只需3步安装配置,就让它真正“看”视频,输出详细笔记。

AI产品自由
开源动态8

一句话搞定后端?揭秘被 52.1k 开发者选择的 PocketBase:真让你 0 运维快速上线产品吗?

PocketBase是“把后端打包成一个文件”的开源项目,既可以作为独立的轻量后端服务直接运行,也作为Go库嵌入到应用中。它解决团队做MVP等遇到的痛点,有诸多核心功和技术优势。

小华同学ai
产品应用7

蚂蚁多模态统一框架Ming-Omni:看懂世界、会说话、还画画

文章介绍蚂蚁多模态统一框架Ming - Omni,它可统一处理图像、文本等多模态数据。该框架解决了多模态训练中模态表示差异、收敛速度不一致等问题,采用分阶段预训练,用于图像、音频生成及多模态交互。

CourseAI
产品应用7

Google发布“法律版Gemini”:审合同,也连接律所核心数据

8月25日,Google Cloud发布Gemini Enterprise for Legal面向律所和企业法务团队开放预览。它想解决让模型进入律所现有工作系统,不打乱权限等规则的问题,通过MCP连接系统并继承权限,还组织各方合作。

AIGC开放社区
算法论文8

进化的Skill,才是好Skill~

2026年,我们追求“越干越好”的Agent。AutoSkill和XSKILL两篇论文指出,静态的Skill只是高级Prompt,自我进化的Skill才是真正的数字资产,还介绍了两者的设计、优势及未来Skill的标准形态。

PaperAgent
算法论文8

一个标点就迷惑LLM-as-a-Judge!

论文揭露惊人漏洞,一个标点或通用推理开场白就欺骗最先进的LLM裁判,导致强化学习训练崩溃。研究通过实验验证漏洞,提出Master - RM模型,其FPR近乎0%且保持通用裁判力。

深度学习自然语言处理
开源动态8

美团重磅开源!13.6B通用视频生成大模型,文生视频、图生视频、还续写!

AI视频生成竞争激烈,美团团队在GitHub开源通用视频生成模型LongCat-Video,参数量13.6B,文生视频、图生视频、视频续写,几分钟生成720p、30fps长视频,有核心优势,还介绍了安装部署等内容。

开源星探
开源动态7

下一代架构设计工具,说话就

next-ai-draw-io是开源项目,用自然语言描述就让AI自动生成draw.io格式的图。有文字生成图表等核心功,技术栈用Next.js + AI SDK + react-drawio,支持多提供商,还介绍了安装、部署方法。

GitHubStore