「多模态统一建模」共找到 1467 篇相关文章
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
智能体的记忆管理机制及其潜在风险 | 直播预约
大语言模型(LLM)智能体兴起,记忆机制是核心。本次报告将探讨记忆管理对其性能的影响及潜在风险,展示缓解关键挑战的策略,介绍新攻击范式,揭示安全漏洞,强调需重新审视与建模。
优理奇机器人完成两轮合计3亿元天使++++轮及天使+++++轮融资,“算法-硬件-场景”三位一体加速具身智能应用落地
优理奇机器人近日完成两轮合计3亿元融资,是半年内第五轮。其坚持“场景驱动”,产品在运动会获奖,量产交付订单超千台。构建完整技术栈,推出标准化机械臂产品,创始人看好具身智能统一发展。
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
黄仁勋GTC开场:「AI-XR Scientist」来了!
英伟达CEO黄仁勋在GTC大会展示LabOS,这是全球首个融合AI与XR的协研科学家平台。它将多模态感知等技术融合,构建端到端闭环,还通过三大生物医学案例展示功能,开启人机协同科研新纪元。
全新SkyReels发布,昆仑万维要通吃创意生态 | 甲子光年
11月4日,昆仑万维发布全新SkyReels,定位“一站式、零门槛多模态AI创意平台”。它有无限画布、智能副驾、AI视频模板三大革新,重构创作流程。其技术进化快,还加入平面设计功能,有望撬动更大应用市场。
超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦
中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。
重磅!华为开源业界首个Serverless分布式计算引擎openYuanrong,单机体验编程、极致分布式运行性能
近期,华为开源自研的 Serverless 分布式计算引擎 openYuanrong,它是业界首个统一支持通算和智算场景的开源引擎。能解决传统 Serverless 产品通用性不足等问题,已在华为多个核心产品应用,提升了开发效率和资源利用率。
信息熵之后,清华提出状态熵!量化分析「系统智能性」的全新视角
清华大学科研团队从自治系统的演化动力学出发,提出状态熵概念,分析其与系统聚合度关系,为系统智能性度量提供新视角。论文给出状态熵统一定义及演化解析表达式,还在典型系统上分析其演化规律。
为 OpenAI 秘密提供模型测试, OpenRouter 给 LLMs 做了套“网关系统”
OpenRouter成立于2023年初,为用户提供统一API Key调用各类模型,OpenAI会用其秘密测试。平台token用量高速增长,还发布模型用量排行榜引关注。创始人认为大模型非赢家通吃,未来想成agent最佳推理层。