通用机器人模型」共找到 8427 篇相关文章

开源动态8

世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana

北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。

量子位
新闻资讯7

Elad Gil:AI 应用进入收敛期,比模型跑得快才能抓住红利

硅谷AI投资人Elad Gil回顾AI领域投资,指出AI应用进入收敛期。基础模型头部梯队明显,格局难改;GPT-ladder带来新机会;应用端理解痛点、构建工作流的团队更有优势,AI Agent重塑商业模式。

Founder Park
开源动态8

CAIR开源发布超声基座大模型EchoCare“聆音”,10余项医学任务性能登顶

2025年9月17日,CAIR开源发布超声基座大模型EchoCare“聆音”。它基于超450万张影像数据集训练,在10余项医学任务测试中表现卓越。首创结构化对比自监督学习框架,为AI医疗应用提供创新路径。

机器之心
新闻资讯7

Grok的"叛逆期":AI聊天机器人为何突然沉迷"白人种族灭绝"阴谋论?

2025年5月14日,马斯克家的AI聊天机器人Grok突然对所有问题都回复南非种族问题,xAI公司承认是有内鬼修改系统提示词。此前Grok也有类似前科,此事引发网友质疑,xAI祭出三招进行危机公关。

宝玉AI
开源动态8

「被动感知」到「理解接触」!它石智航重磅发布OmniVTA视触觉世界模型

它石智航联合六大顶尖机构推出OmniVTA视触觉操作框架和OmniViTac大规模视触觉数据集。该框架核心是从被动感知到主动预测触觉,通过多模块协同让机器人有预测、理解和修正能力,实验表现优。

新智元
开源动态8

阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!

在AI文字识别类应用中,文档解析常不尽人意。阿里开源端到端文档解析模型Logics - Parsing,基于VLM,能图片直出结构化HTML,有统一、智能、精细等亮点,还给出使用步骤。

开源星探
开源动态8

字节开源多模态复杂文档解析模型!Dolphin:页面与元素并行解析,精准解析复杂文档!

多模态AI与文档解析兴起,传统OCR解析复杂文档常出错。字节跳动开源多模态模型Dolphin,通过两阶段机制精准解析,有多种功能,安装使用友好,适用于多场景,降低了复杂文档解析门槛。

开源星探
新闻资讯8

刚刚,唐杰、杨强、杨植麟、林俊旸和刚回国的姚顺雨坐一起都聊了啥?

1月10日AGI - Next前沿峰会上,智谱AI唐杰、月之暗面杨植麟等大模型掌舵者及学界泰斗罕见同台。他们探讨AI从‘聊天机器人’进化为‘干活的智能体’,但解法各异,还在圆桌激辩多个敏感话题。

机器之心
产品应用7

通用模型无法完全理解用户,AI产品的下一站是上下文的战场|对话AI知识助手remio

量子位智库对话remio创始人汪源,探讨其开发初衷、核心价值等。remio主打无感自动化,成用户第二大脑,有信息捕获、管理等功能,数据本地存保隐私。还聊了目标用户、指标、功能及应对竞争等。

量子位
开源动态8

华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」

今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。

机器之心