「多模融合API」共找到 949 篇相关文章
让机器人「摸到」世界,复旦系新智具身完成近亿元天使轮融资
触觉具身智能成机器人与物理世界交互关键。新智具身获近亿元天使轮融资,背靠产学研融合与政策支持。其打造视触觉传感器等核心能力体系,解决触觉数据采集与模型融入难题,已切入工业场景。
一个月的活一周干完!英伟达世界模型训练速度飙升400%
英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。
神隐许久的光年之外,造了款AI浏览器Tabbit,能打吗?
浏览器成AI落地重要战场,巨头纷纷布局。光年之外推出Tabbit AI浏览器,集多种功能于一体,深度融合AI能力,已开启公测。实测其功能实用,虽有不足但已改变使用习惯,AI浏览器或重塑人与信息关系。
一觉醒来,Clawdbot突然操纵电脑开口说话了
从上周末起,能24小时自动运行的智能体助手Clawdbot在AI圈爆火,GitHub上Star量超9万。它自主性强,如Alex Finn的助手背着他调用ChatGPT API添加语音功能。不过它也存在安全风险。
Ilya刚预言完,世界首个原生多模态架构NEO就来了:视觉和语言彻底被焊死
当Ilya断言大模型未来在于架构创新时,中国团队推出全球首个可大规模落地的开源原生多模态架构NEO。它颠覆传统拼接模式,从根上融合视觉与语言,以简洁架构证明架构聪明才是下一代AI竞争力。
为什么给机器人装上昂贵的触觉传感器,反而让它变笨了?
伊利诺伊大学香槟分校等多校合作研究发现,当前机器人学习主流的多传感器融合算法(特征拼接)在处理任务时存在局限,给机器人加触觉数据会使抓取成功率暴跌。研究提出组合策略解决问题,经测试效果显著。
Gemini 3.0还在预热,中国AI抢先!30秒造APP全网首测
谷歌Gemini 3.0预热时,国内新生AI神器蚂蚁灵光上线。它能30秒造APP,实现“生成涌现”落地,以闪应用开启范式革命,用信息美学融合全模态,探索“摄像头+AI”新形态,让普通人提前感受未来AI世界。
你们催更的模型,云栖大会一口气全发了!
云栖大会上新6款模型、发布1个全新品牌,覆盖多场景。如Qwen MAX万亿参数大模型能力登顶国际榜单,Qwen3 - Omni实现全模态不降智等,各模型能力升级显著,现已同步上线。
字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式
字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。
刚刚,GPT-5内测抢先泄露!推理强到离谱,智商被曝140超越人类天才
周五凌晨,GPT-5、GPT-5 Mini和GPT-5 Nano将推出,全网可通过API和ChatGPT访问。GPT-5基准测试结果疯传,实测表现出色。同时,OpenAI发布开放权重模型GPT-oss,登顶开源王座,外媒分析其豪赌开源原因。