全模态具身」共找到 2735 篇相关文章

推荐文章7

sglang 源码学习笔记(二)- backend & forward 过程

本文深入解析sglang forward核心实现流程,介绍了forward传递过程、AttentionBackend数据结构,以flashinfer为例展开分析,还说明了cudaGraphRunner初始化、Capture、Replay过程,助读者理解代码。

GiantPandaLLM
开源动态8

无痛使用vLLM的工来了!

vLLM功能强大但上手门槛高,开源项目vLLM Playground是界面化工,能解决使用难题。它零配置,集成官方vLLM recipes,内置性能测试,安装简单,对业务团队很友好。

AI工程化
开源动态8

Google大神开源Agent Skills:专治AI偷懒

AI编程工常偷懒致上线问题多,Google大神Addy Osmani开源Agent Skills,含19个覆盖流程的技能、7条快捷指令和反借口机制,可通过一条命令使用,支持多种工

AI工程化
开源动态8

炫酷能,一个窗口搞定所有,狂揽 1.5w 星!

Wave Terminal是开源跨平台终端应用,将命令行与图形化工集成,操作在自由拖拽布局界面完成,减少上下文切换。有灵活布局、强大编辑器等特性,安装简单,创造新高效工作流。

开源先锋
产品应用8

MiniCPM 4.0来了!220倍极速狂飙,端侧模型的比赛,结束了

面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有三级火箭推理加速体系,性能强,适配平台,应用广泛,或成端侧AI分水岭。

AGI Hunt
产品应用8

智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化

北京智源研究院发布大规模多模态世界模型“悟界·Emu3.5”,它能模拟复杂动态物理世界,揭示“多模态Scaling范式”。该模型继承深化Emu3技术哲学,在多方面有提升,为世界模型领域提供进化路线。

AI科技评论
开源动态8

最新原生端到端OCR开源项目!

腾讯开源最新原生端到端OCR:HunyuanOCR,仅1B参数,OmniDocBench得分94.1超竞品,功能覆盖场景。还介绍了DeepSeek - OCR的桌面客户端,支持拖拽识别、导出文件等。

GitHubStore
开源动态8

中科院甩出多模态“核弹”!类GPT-4o多模态模型开源!支持语言-视觉-语音任意组合交互!

中国科学院计算技术研究所(ICTNLP)开源类GPT - 4o多模态模型Stream - Omni,支持文本、视觉和语音任意组合交互,核心是高效模态对齐技术,少量多模态数据即可训练,有多种使用场景。

开源星探
开源动态7

Vercel 开源 Open Agents,支持后台运行 AI 编码工作流

Vercel 开源 Open Agents,支持创建和运行后台编码智能体,提供栈解决方案。它采用三层架构,核心是智能体与沙箱解耦,支持多步执行等功能,定位为参考实现,引发不同反响。

InfoQ
新闻资讯7

GPT-5.4据传下周上线!200万上下文窗口+持久化状态,告别频繁遗忘

OpenAI工程师在GitHub仓库意外泄露GPT - 5.4,相关信息流传后被撤回。据传下周上线,其有200万Tokens上下文窗口与持久记忆,支持分辨率视觉直读,将引发硬件内存之战。

新智元