视觉语言预训练」共找到 3302 篇相关文章

开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区
开源动态7

Alibaba开源WebDancer解决DeepResearch复杂信息检索难题

Alibaba开源WebDancer,从数据和训练阶段出发提出端到端自主信息检索代理构建范式。实验中,它在GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。

CourseAI
新闻资讯7

GPT-5.4意外泄露!OpenAI最新模型瞄准这2大能力突围

GPT - 5.4疑似泄露,此前在OpenAI编码助手、GitHub代码拉取请求等多处有踪迹。传闻其将搭载200万Tokens上下文窗口,具备像素级精准视觉分析能力,不过也可能是炒作,网友关注其准确率。

量子位
新闻资讯7

V4或Code要来?刚刚,DeepSeek-V3.1-Terminus发布!

DeepSeek线上模型升级为DeepSeek-V3.1-Terminus,单从名字看像是V3终极版,或在筹备V4及Code模型。deepseek - chat和deepseek - reasoner完成升级,此次更新改进语言一致性,优化Agent能力。

PaperAgent
新闻资讯7

DeepSeek深夜更新后自曝:我是V4(?!)

DeepSeek网页端深夜大更新,推出「快速模式」和「专家模式」,还有「视觉模型」开启灰度测试。虽官方未说明,但网友推测专家模式可能是V4或V4 Lite,完整版V4或许不远。

量子位
新闻资讯8

黄仁勋暴论核弹:AGI已经实现,Ilya错了,程序员有10亿

在Lex Fridman的专访中,黄仁勋抛出诸多惊人观点,如称已实现AGI,反驳Ilya“预训练触顶”言论,认为推理计算难且重要,还对未来技术、行业、职业发展等多方面进行展望。

量子位
算法论文8

结构化扩展拿下Agent工具检索新SOTA,精准找到API|ICLR'26

宁波东方理工大学沈晓宇团队在ICLR 2026发表论文,指出当前工具检索瓶颈在于工具文档。提出对文档结构化扩展,再训练模型的方案,构建TOOL - REX等组件,实验显示显著提升检索性能。

量子位
开源动态8

1.7K Star 新晋神器!一款轻量、开箱即用的终端日志神器,AI 助力、实时可视化,效率飞升!

现在系统日志信息量大、噪声多,传统工具定位问题既慢又麻烦。而开源工具Gonzo基于Go语言开发,有实时日志流处理、交互式仪表盘等功能,安装简单,打破传统工具局限,节省时间。

开源先锋
算法论文7

告别Reasoning模型的“灵光一现”,推理能力可控了

当前GPT - 4o、DeepSeek - R1等大模型推理的‘高级操作’随机触发,不可控。研究者受经典推理三要素启发,教会模型三种‘元能力’,经三阶段训练,模型效果提升,让推理能力可控。

深度学习自然语言处理
新闻资讯7

刚刚,北京建了一座AI工厂:目标10万P算力,日产10万亿Token!

九章云极在2026全球智算科技峰会发布AI工厂战略,含训练和Token工厂,目标10万P算力、日产10万亿Token。用DCU度量投入,Token度量产出,重构智能生产与交付体系,适配不同企业需求。

量子位