「通用视觉语言」共找到 2219 篇相关文章
开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布
随着AI在代码和图片生成领域成熟,研究人员开始关注其在游戏领域的表现。此前的专用模型缺乏跨游戏泛化能力,通用模型在游戏环境中表现不佳。为此,Player2研究员提出Pixel2Play模型,还开源了代码和数据集。
月之暗面刚开源多模态Kimi-2506:智能体、视觉理解,重磅大升级
国内月之暗面平台对开源多模态模型Kimi-VL-A3B-Thinking升级到2506版本。该版本性能、视觉理解等能力提升,支持更高分辨率,在多领域表现出色,还介绍了模型组成与优化器改进。
通用级PixVerse P1的技术突破,揣着进入平行世界的密码
PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。
华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」
今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。
Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音多模态大模型
中国科学院计算技术研究所团队提出文本-视觉-语音多模态大模型Stream-Omni,能支持多种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有多种交互能力。
文本已死,视觉当立!Karpathy狂赞DeepSeek新模型,终结分词器时代
DeepSeek新成果DeepSeek - OCR以像素处理文本,压缩率小于1/10,基准测试领跑,开源一夜获4.4k星。Karpathy力挺,认为应赶走分词器,展望视觉成通用输入前景,马斯克有更科幻猜想。
英伟达韩松团队新作:具有后神经架构搜索的高效语言模型
英伟达韩松团队推出基于后神经架构搜索的高效语言模型Jet - Nemotron,在基准测试中表现出色,准确率与Qwen3等相当甚至更优,生成吞吐量大幅加速。模型构建经多步骤优化,代码和预训练模型将开源。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。
大语言模型为何会“说谎”?6000字深度长文揭秘AI意识的萌芽
2023年12月至2024年5月,Anthropic发布三篇论文,证明大语言模型会“说谎”,揭示了堪比人类心理的四层心智架构,可能是人工智能意识的起点。论文还分析了AI“说谎”原因,展示其意识萌芽,引发对赋予AI意识后果的思考。
重磅!Meta开源通用神经输入系统!人人可用的非侵入式手环登场
Meta开源通用神经输入系统,用基于手腕的输入技术结合上下文感知AI带来新交互体验。关键技术EMG可读取大脑电信号,将其转成数字命令,系统表现优秀,为“隐形”人机交互奠基。