「多模态专家混合」共找到 1549 篇相关文章
阿里发布Qwen3-TTS:跨语言混合无缝切换,方言音色全面覆盖!
TTS技术从单一合成进化到多模态表达,但传统模型在跨语言/方言混合场景有不足,商业工具费用高且不开源,开源方案训练数据少。阿里推出Qwen3 - TTS,实现人类级自然度和表现力,功能强大,应用场景多。
百度文库网盘发布 GenFlow2.0,支持同时调用超 100 个专家智能体
8月18日,百度文库联合百度网盘发布全球首个全端通用智能体「GenFlow2.0」。它支持超100个专家智能体并行工作,解决描述难、等待久等问题,还打通百度生态资源,兼容MCP协议,接入荣耀智能助理。
代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放
检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。
ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体
阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。
Anthropic开始抢科学家了?周薪2.7万驻场,专治Claude专家级错误
Anthropic新推出STEM Fellow岗位,招募STEM领域专家驻场三个月,周薪3800美元,用其判断力校准Claude输出质量。其三年来科研路线不断加码,正构建科研生态。AI科研瓶颈是判断力而非算力。
谷歌Gemini一次提示能耗≈看9秒电视,专家:别太信,有误导性
谷歌报告称处理一个中位数的Gemini文本提示能耗低,2024 - 2025年单个文本提示能耗降33倍、碳足迹减44倍,归功于全栈式优化。但专家质疑其方法论,指出未算间接用水、碳排放核算不全等问题。
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana
北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。
首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等
清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。
Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音多模态大模型
中国科学院计算技术研究所团队提出文本-视觉-语音多模态大模型Stream-Omni,能支持多种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有多种交互能力。
拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩
昨夜阿里推出全新多模态模型Qwen-VLo,在原有能力上全面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。