视觉分词器」共找到 875 篇相关文章

产品应用8

GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂

为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。

AI寒武纪
算法论文8

首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」

UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。

机器之心
产品应用8

英伟达拿出推理版VLA:Alpamayo-R1让自动驾驶AI更会动脑子

当今自动驾驶模型虽强大,但在‘长尾场景’易翻车。英伟达推出的Alpamayo - R1是带推理能力的视觉 - 语言 - 行动模型,有核心创新,实验中性能显著提升,训练分三阶段,让自动驾驶迈向可解释。

机器之心
开源动态8

探索文本压缩极限!C3纯文本压缩pipeline:20倍压缩解码准确率98%

DeepSeek团队的DeepSeek - OCR技术引发关注,研究者重新审视视觉压缩路径后提出C3技术。C3采用纯文本压缩管道,实验表明其压缩精度远超DeepSeek - OCR,还具独特遗忘模式,代码模型均已开源。

AINLPer
产品应用8

一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后

DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。

AI寒武纪
算法论文8

突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题

AI后训练依赖监督微调或程序化检查,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。

机器之心
算法论文8

英伟达的AI已经开始接管整个项目了?SATLUTION自主进化代码库登顶SAT竞赛

NVIDIA Research提出SATLUTION框架,将LLM代码进化能力扩展到完整代码库规模,能处理复杂项目。它协调LLM智能体对SAT求解代码库迭代优化,在SAT竞赛中超越人类冠军,成本低且效率高。

机器之心
算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因

随着大语言模型发展,多智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪,在失败归因任务上超大型闭源模型,还能助力系统自我提升。

深度学习自然语言处理
产品应用7

人形机人终于学会洗碗了

Figure机人学会洗碗,用的是叠毛巾和分包裹同款Helix架构,无新算法和特殊工程,仅增加新数据。该架构是端到端“视觉 - 语言 - 动作”模型,同一系统增数据就能学新技能。

量子位
开源动态8

吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板

Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。

新智元