多模型调度」共找到 9739 篇相关文章

开源动态7

吴恩达开源的OpenWorker,为什么「不 Work」了?

美国时间7月23日,吴恩达与Rohit Prasad发布开源桌面Agent OpenWorker。它把Agent工作流压缩成桌面应用,但上线一周暴露出模型兼容、数据流向和权限控制等问题,反映出Agent赛道走向成熟产品的挑战。

AI科技评论
产品应用8

只要1分钟!电脑装满血龙虾,现在跟下载APP似的

智谱推出电脑端应用AutoClaw(澳龙),从安装到使用仅需1分钟,无需配置。它可切换模型,预置50个Skills。能一键接入飞书,玩法样,还降低了OpenClaw使用门槛。

量子位
新闻资讯7

Meta出走华人创业团队,种子轮800万美元,要打造视觉AI记忆大脑

由前Meta顶尖科学家创立的Memories.ai获800万美元种子轮融资。其大视觉记忆模型LVMM解决AI‘记忆缺失’问题,在领域刷新SOTA基准,应用潜力大,还开放API及网页应用。

机器之心
算法论文8

「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式

针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在基准测试中超越开闭源模型

机器之心
开源动态8

1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!

在文本转语音(TTS)领域,生成长篇、说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。

开源星探
算法论文8

ICML 2026 现场|九篇 Spotlight 论文,透视 AI 最前沿

7月7日,ICML 2026正会首日,雷峰网精选九篇Spotlight论文,涵盖生成模型、智能体系统等领域。如SDEVI框架解决不规则时间序列生成难题,MASpoB让智能体提示优化可行等。

AI科技评论
产品应用8

谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果

Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用平台语言,谷歌期待用户反馈以优化体验。

AI寒武纪
开源动态8

惊艳!GitHub 开发者一键接入!4.2k star 项目 Champ,用一张照片秒变动画

Champ项目致力于从一张静态人物图生成人体动画,将3D参数化人体模型引入扩散模型。它解决了传统动画效果不真实等痛点,有诸核心功能,技术优势明显,在领域有高应用价值。

小华同学ai
新闻资讯8

2026「中国 AGI 创新影响力机构 TOP 30」发布

过去一年 AI 行业变化溢出模型层,Coding Agent 铺开,视频生成实现商业变现,具身智能供应链成型。Founder Park 从四维度选出「中国 AGI 创新影响力机构 TOP 30」,涵盖领域团队。

Founder Park
算法论文8

CMAME|美国西北大学,德州大学|Wing Kam Liu及 TJR Hughes 等: LLM赋能的下一代计算机辅助工程

工程仿真里有限元方法常见,但计算与人力成本高。此研究提出把大语言模型变为计算机辅助工程智能体,开发不依赖训练数据的降阶求解器,在问题上表现佳,为下一代计算机辅助工程提供框架。

力学与人工智能