「多模态语言推理」共找到 3468 篇相关文章
告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher
过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。
当黄仁勋反复提起OpenClaw,他到底在焦虑什么?|甲子光年
美国当地时间3月18日,「甲子光年」参加英伟达黄仁勋在GTC 2026的媒体会。黄仁勋多次提及OpenClaw,认为它很重要。英伟达不仅造GPU,还构建AI工厂,试图成为新计算秩序定义者。
物理AI的「原生」时刻:原力灵机发布具身大模型DM0
主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。
Qwen3-ASR的MLX原生实现:让SOTA语音识别跑满苹果芯片
Qwen3 - ASR是强大开源语音识别模型,但官方实现无法充分利用苹果芯片GPU能力。开发者完成MLX重写,让其能在苹果芯片上原生运行,实测性能佳,还有诸多核心功能及安装使用示例。
MiniMax M2.5发布:硬刚 Claude Opus,一美元包断一小时的生产力
MiniMax M2.5发布,硬刚Claude Opus 4.6,以一美元包断一小时的低价降低AI生产力门槛。它在编程、办公等多场景表现出色,速度快且成本低,背后是RL Scaling等技术支撑。
可灵3.0系列模型正式上线:属于每个人的导演时代来临
可灵AI正式全球上线3.0系列模型,覆盖影视级全流程链路。该系列基于All-in-One理念构建,解决了行业一致性等问题,在多方面做了增强,完成从单点生成到专业调度的跃迁,让AI成创作协作者。
如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证
大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。
阿里开源 Qwen3-TTS 全家桶!语音设计、克隆、生成全打包,开源 2 天 3K Star!
阿里通义团队开源 Qwen3 - TTS 全家桶,含语音设计、克隆、生成功能,开源 2 天获 3K + Star。它有秒级克隆、语音设计等能力,有 0.6B 和 1.7B 两种规格,双轨架构等技术创新保障性能。
哈工大最新研究AI Meets Brain
传统大模型有“健忘”问题,哈工大《AI Meets Brain》研究借鉴人类记忆机制,为AI智能体打造强大记忆系统。研究涵盖核心洞察、记忆形态、分类框架等内容,还探讨了记忆赋能方式及未来发展方向。
把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法
Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。