「端到端具身大模型」共找到 8937 篇相关文章
一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠
长期以来,机器人系统多依赖专有模型,场景变化时需重新训练。如今具身智能步入下半场,它石智航通用具身大模型AWE3.7用同一颗“具身大脑”贯通多场景,回应了通用泛化命题。
Qwen开源版Banana来了!原生支持ControlNet
Qwen推出新图像编辑模型Qwen - Image - Edit - 2509,支持多图融合、增强单图一致性,原生支持ControlNet。还开源端到端全模态模型Qwen3 - omni,性能优异,功能丰富。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试
浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。
首家央企AI独角兽浮出水面!背靠自研大模型,4家国家队资本背书
中电信人工智能科技(北京)有限公司成为央企首家AI独角兽,完成首轮增资,引入四家国家级战略投资方。其靠自研“星辰”系列大模型,在多领域突破,实现技术与市场认可闭环,有望推动AI产业落地。
因果发现进入基础模型时代:CDFM 如何从数据中推断因果结构 | GAIR Paper 120
因果发现正从“手工挑选算法”走向“大模型统一零样本推断”范式。广东工业大学等团队提出CDFM,能统一处理多种情况,解决传统方法痛点,在多方面展现良好性能,是因果发现基础模型时代的重要起步。
AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板
MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。
谷歌之后,英伟达入局扩散大语言模型,Fast-dLLM推理速度狂飙27.6倍
大语言模型领域,推理效率制约实际应用。谷歌Gemini diffusion曾展扩散模型并行潜力,但开源扩散LLM推理慢。近日,NVIDIA等推出Fast - dLLM,无需训练即插即用,推理速度狂飙27.6倍,兼顾速度与精度。
以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度
近年来大语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁大模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。
多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距
近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。