「多模态智能」共找到 4129 篇相关文章
智元机器人发布并开源首个机器人动作序列驱动的世界模型
智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。
低延迟、高吞吐,LLM优化与高效推理引擎综述
LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。
原生Agent杀入画布!一站式搞定专业创作,全程可控、不抽卡
国内RunningHub平台推出原生AI智能体全能内容创作平台RHTV,它能一站式搞定专业创作,流程可控。实测显示,它能编排短剧、生成商用物料,还内置影视级工具,且依托庞大生态,能力无上限。
OpenAI推出GPT-5.4 mini/nano;MiniMax发布M2.7;小米发布MiMo-V2系列模型
OpenAI、MiniMax、小米陆续发布新模型。OpenAI推GPT - 5.4 mini与nano,优化速度和成本;MiniMax的M2.7能自我演化;小米MiMo - V2系列覆盖智能体核心、全模态理解和情感语音合成。
OpenClaw 之后,Agentic RL有了新训练范式
大模型技术推动AI从‘回答问题’迈向‘执行任务’,Agentic AI兴起。中国科大认知智能全国重点实验室提出Claw - R1项目,将前沿Agent Runtime与强化学习训练框架结合,为Agentic AI提供新训练基础设施。
DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro
DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。
官宣!姚顺雨出任腾讯首席AI科学家,带队大语言模型、AI Infra
12月17日腾讯官方消息,腾讯升级大模型研发架构,新成立AI Infra部等。姚顺雨出任首席AI科学家,兼任AI Infra部、大语言模型部负责人,他在智能体方向成果多,论文总引用超1.9万。
Claude Skills|将 Agent 变为领域专家
今年10月,Anthropic推出Claude Skills能力,可在Claude多产品使用。它是向Agent注入内部知识的标准化方案,与MCP可协同工作,还介绍了实现Agent Skills的方法及主动式智能导购AI助手构建。
华为乾崑 all in 启境,开启造车新模式
在华为乾崑生态大会上,启境给出了自己的答案。华为不仅技术赋能启境,还将团队、流程与之深度融合。启境目标是打造不妥协产品,成为‘六边形战士’,其愿景是塑造‘移动智能体’。
拜拜了GUI!中科院团队“LLM友好”计算机使用接口来了
中科院软件所团队研究指出,现有LLM智能体成功率低、效率差的瓶颈在于GUI。其设计与LLM能力错配,团队提出声明式接口GOI,实现策略 - 机制分离,经测试性能提升显著。