「多模态智能体」共找到 4168 篇相关文章
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
5Y News | 地瓜机器人完成1.5亿美元B2轮融资
近日,地瓜机器人完成1.5亿美元B2轮融资,B轮累计2.7亿美元。2025年业务成果出色,出货量增180%、客户量翻倍、开发者破10万。它与地平线打造具身智能大脑基座,释放多场景应用潜力。
763亿港元,大模型公司最大规模IPO!MiniMax登陆港交所,开盘前大涨50%
MiniMax正式在港交所主板挂牌上市,股票代码“00100”。此次全球发售约3358万股,募资约55.4亿港元。市场认购热烈,早盘一度涨幅超50%,市值突破763亿港元。其技术多模态齐发,组织高效,为行业提供新样本。
宇树上市:王兴兴的十年非共识|甲子光年
2026年宇树科技成功上市,创始人王兴兴创业十年有诸多“非共识”观点。如高性能机器人不意味昂贵,堆数据难带来具身智能,AI强对硬件要求或降低。如今宇树成行业共识,也面临新挑战。
ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境
北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。
写顶会LaTeX论文的门槛彻底被谷歌PaperOrchestra打下来了~
谷歌推出多智能体协作框架PaperOrchestra,能将非结构化研究素材转化为符合顶会要求的LaTeX投稿论文。它解决了现有自动化研究框架在论文写作环节的问题,实验显示全面超越现有基线。
第八届 「GAIR 全球人工智能与机器人大会」即将启幕:穿越AI长夜,共睹群星闪耀
2025年12月12 - 13日,第八届GAIR全球人工智能与机器人大会将在深圳举办。大会设三个主题论坛,聚焦大模型、具身智能等议题,有青年与前辈交流,还有海内外学者、产业界人士参与,也关注算力赛道。
刚刚,OpenAI Sora 2重磅登场!首个APP上线,或将成为AI时代新TikTok
凌晨1点,OpenAI推出Sora 2,AI视频迎来「GPT - 3.5时刻」。它物理智能提升、实现音画同步,人物一致性等刷新SOTA。Sora App上线或重塑短视频交互与社区互动,还在安全治理上布下多层防线。
重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!
传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。