「新推理模型」共找到 9794 篇相关文章
在ICLR 2026主会之前,我们和30多位入选者聊了聊最前沿的AI细节
4月14日,智源社区、DeepTech联合举办ICLR 2026预讲会。会议聚焦顶会核心精华,三十余位论文作者分享AI Agent、大语言模型等热门领域成果,展示解决大模型痛点的研究。
李飞飞刚立规矩才13天,国产卡上「真物理」就来了!
李飞飞为「世界模型」立规矩13天后,中国「草根」团队Mogo推出全球首个具备高动态物理交互能力的世界模型Magpie 1.0,在国产芯片上实现超10分钟物理一致性,开辟全新技术路径。
自媒体误读了 DeepSeek-OCR:一图胜千言
近期,DeepSeek-OCR引发关注,但很多媒体误读其为OCR工具,实际是视觉语言模型。它是为大文档等场景优化的视觉压缩与识别系统,架构新颖,训练讲究,效果出色,为行业带来新思路。
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
奖励是假的,能让Qwen提升25%性能却是真的!
华盛顿大学博士生团队用Qwen模型对虚假奖励进行RLVR,使MATH - 500准确率显著提升约25%。研究发现RLVR不考虑奖励正确性,还分析了虚假奖励有效的原因,提示现有研究要在非Qwen模型验证。
硅谷的企业级AI正在这样赚钱|2025人工智能现状报告
ICONIQ Capital发布的2025年人工智能现状报告聚焦企业级AI变现。报告基于对300名软件公司高管的调查,分析了模型选择、支出、工具使用等情况,指出AI产品战略进入新阶段,定价策略在重塑等。
视觉生成的另一条路:Infinity 自回归架构的原理与实践
本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
小扎又开源了:7B实现自监督学习SOTA
Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。
中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考
上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。