视觉知识」共找到 1118 篇相关文章

开源动态8

告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher

过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。

机器之心
开源动态8

DeepSeek开源的不仅仅是个新OCR模型。。。

DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
推荐文章7

我的 2025 总结:当 AI 开始释放创造力,工程师如何重新站位

2025 年 AI 开始释放创造力,重新定义知识工作。作者在编程上向创造性工作倾斜,设计适配 AI 的架构、落地 DSL;写作上 AI 提升生产力但削弱创作欲。2026 年需探索新竞争力,实现角色转变。

phodal
算法论文8

多模态推理最高加速3.2倍!华为诺亚新算法入选NeurIPS 2025

华为诺亚方舟实验室研究入选NeurIPS 2025,其提出视觉感知投机推理(ViSpec)框架,解决草稿模型处理图像信息效率难题,在不牺牲生成质量下,对主流VLM最高达3.22倍推理加速。

量子位
算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
算法论文8

让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法

南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。

量子位
算法论文8

文本分类重大创新:持续学习新增类别,不会灾难遗忘

在生成环境中,传统文本分类方法新增业务标签需从头训练,易致知识灾难性遗忘。今天介绍的自适应分类器,通过四项创新,可实现动态类添加和持续学习,而不会发生灾难性遗忘。

CourseAI
算法论文8

国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab

现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。

量子位
新闻资讯8

马斯克将用最强Grok 5,挑战LOL最强战队T1!

马斯克让Grok 5戴「纯视觉感知」与「拟人延迟」镣铐挑战LOL传奇战队T1。这是终极图灵测试,AI像人一样感知与推理。对决为特斯拉Optimus练兵,若AI看懂团战,就能理解现实世界。

新智元
产品应用7

打破幻觉!Qwen最新OCR让印章、表格、公式识别准确率飙升45%

基于推理增强框架的视觉语言模型处理OCR任务有成果,但存在生成幻觉问题,特定领域不如专家模型。DianJin - OCR - R1通过推理与工具交互,按‘思考 - 调用工具 - 重新思考’流程提升OCR性能,减少幻觉。

CourseAI