世界基座模型」共找到 7962 篇相关文章

算法论文8

让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法

南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型

量子位
开源动态8

阿里 Qwen 又双叒发模型,继基础、编程模型后,最强推理模型 Qwen3 Thinking 登场,击败Gemini 、R1?

阿里通义千问发布最强推理模型 Qwen3-235B-A22B-Thinking-2507,逻辑、通用技能等能力更强,原生支持 256K 上下文。此前已发布基础和编程模型,Qwen API 在 OpenRouter 表现佳,受社区关注。

AI进修生
开源动态8

连续自回归的dots.tts:小红书开源语音合成模型基座

语音合成赛道发展如早期大语言模型,路线未收敛。小红书与上海交通大学合作开源的 dots.tts,是 20 亿参数、全连续、端到端自回归 TTS 基础模型,有准确度高、可扩展等特点,还开源了代码。

机器之心
开源动态8

哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型

动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型

带你学AI
推荐文章8

端到端语音模型:从语音表征到模型架构

本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。

InfoQ
算法论文8

上海交大DENG Lab提出「LatentUM」:Unified Model的真正「战场」在视觉推理与世界模型

上海交通大学 DENG Lab 提出的 LatentUM,尝试让统一模型把生成的视觉内容纳入推理闭环。它在多项任务上超越基线,其核心思路是生成与语言共享语义空间的离散 visual semantic tokens,模型含三大关键设计。

机器之心
算法论文8

陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o

陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。

量子位
开源动态8

小米打通智驾和具身大模型,然后开源了

小米汽车陈龙团队开源全球首个跨具身基座模型MiMo - Embodied,基于MiMo - VL架构,采用四阶段训练策略,打破室内操作与户外驾驶领域鸿沟,在29个Benchmark上超现有模型

量子位
新闻资讯7

模型到真实世界:具身智能落地面临哪些关键问题?

近年来具身智能成重要方向,但在真实物理世界应用有诸多技术挑战。9月11日‘基座之上’论坛将亮相外滩大会,聚焦前沿技术与场景落地,同期启动挑战赛,现专业观众报名通道已开。

机器之心
新闻资讯8

聊聊 Token 出海的生意经:模型开源给世界,中国赚什么?

本文围绕中国开源模型展开,介绍了 Cursor 使用 K2.5 模型事件,阐述了开源模型供应链,分析了中国开源模型受欢迎原因,探讨小公司技术机会,还提及开源面临的挑战及未来趋势,指出其正改变全球 AI 基础设施格局。

刘言飞语