多模态专家混合」共找到 1549 篇相关文章

算法论文8

开放世界任务成功率82%!美的攻克机器人泛化控制难题

美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。

量子位
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
算法论文8

MIT新研究:大模型加噪声就能替代GRPO/PPO调参

MIT新论文提出,预训练模型周围存在大量“专家模型”,只需添加高斯噪声并集成,性能就能比肩甚至超越GRPO/PPO等调参算法。由此启发了RandOpt算法,经测试准确率不错,但也有依赖预训练等缺点。

量子位
新闻资讯7

5亿热钱砸向具身智能新玩家!地平线VP创业,余凯又投了

具身智能赛道火热,无界动力获5亿天使轮融资。其创始人张玉峰是前地平线副总裁,团队实力强。此轮融资将加速基础模型研发与专家模型落地,公司首代机器人平台已在两方向突破。

量子位
新闻资讯8

前小米 OS 高管创业:你的下一部「手机」未必是手机

前小米OS高管董红光创立光帆科技,他认为AI将重塑消费电子行业,未来交互是“需求式”和“多模态”的,手机或不再是最适配设备,穿戴设备或先变革,未来多设备联动由AI大脑调度。

Founder Park
开源动态8

ICML 2025 | 长视频理解新SOTA!蚂蚁&人大开源ViLAMP-7B,单卡可处理3小时视频

在视觉语言模型取得突破的当下,长视频理解挑战凸显。蚂蚁和人大团队提出视觉语言大模型ViLAMP,采用‘混合精度’策略,在多基准测试中超越现有方案,单卡可处理3小时视频,为实际应用带来新可能。

机器之心
新闻资讯8

Google 发布 Gemini 3.1 Flash-Lite:每秒 363 tokens,百万 token 只要 $0.25

Google发布Gemini 3.1 Flash-Lite,输出速度达363 tokens/秒,比上一代快45%,首个token响应快2.5倍。价格降低,输入$0.25/百万tokens,输出$1.50/百万tokens。跑分不错,还有动态思考功能,支持多模态输入。

AGI Hunt
开源动态7

Meta没做的,英伟达做了!全新架构吞吐量狂飙6倍,20万亿Token训练

英伟达发布全新架构9B模型NVIDIA Nemotron Nano 2,以Mamba - Transformer混合架构实现推理吞吐量最高提升6倍,对标Qwen3 - 8B并在多任务中表现持平或更优,还开源模型及大部分预训练数据。

新智元
新闻资讯7

AI 大模型热潮的第三年,这场直播给出了 4 个值得参考的判断 | 极客时间企业版

极客时间企业版 6 月 16 日直播,快手、造物者咨询等专家分享 AI 落地经验。探讨协调税、‘AI 虚假繁荣’、工程化人才及 AI 转型痛点与行动,为企业把 AI 融入组织提供参考。

InfoQ
产品应用8

刚刚,小扎砸143亿的「牛油果」来了!硬刚GPT-5.4,硅谷最贵华人首作

Meta超级智能实验室首个作品Muse Spark上线,跑分从18飙到52,盘中暴涨10%。它是「全能六边形战士」,有原生多模态感知等能力,上线「沉思模式」,功能先在美国铺开,未来接入社交平台,免费用但闭源。

新智元