「多模型适配」共找到 9739 篇相关文章
AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒
清华大学等联合研发的 AgentCPM-Explore 智能体模型,基于 4B 参数在深度探索类任务表现出色,有打破参数壁垒等亮点,还全流程开源,解决小模型性能提升挑战,邀伙伴共建端侧智能体生态。
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。
真可用!美团数字人模型开源,MV、电商等统统拿下
美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。
VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架
VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。
马斯克从英伟达挖人做AI游戏!第一步:研发世界模型
据《金融时报》报道,今年夏天xAI从英伟达挖来多名资深研究员入局世界模型。马斯克重申2026年底前发布AI生成游戏的目标,xAI首批落点或为电子游戏,还组建全模态团队,若各板块通过世界模型互通,其AI帝国将形成闭环。
阿里一口气发了N款新模型,让我们向源神致敬。
阿里云栖大会发布众多模型,有Qwen3 - Max、Wan2.5等。Qwen3 - Max对标顶尖模型;Wan2.5支持音画同出;Qwen3 - VL是强大视觉语言模型且已开源;Qwen3 - Omni是全模态模型。此外还有多个新模型,构建全场景生态。
DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。
DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。
开箱即用、本地安全、多 Agent 协同解决方案!
过去一年,Agent热度高,但企业应用面临算力、安全和部署门槛。5月22日浪潮信息推出元脑智能体工作站Z3,整合大模型本地推理等功能,解决本地多Agent运行问题,降低使用门槛,保障安全。
谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星
今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。
腾讯混元团队最新研究:让 AI 从「固定模型」走向「实时适配系统」
腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实时动态生成适合任务的参数,而非依赖固定参数。通过多类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。