纯视觉任务」共找到 2502 篇相关文章

开源动态7

The Batch: 904 | 智能体全面释放

2025年11月开发者Peter Steinberger发布个人AI智能体OpenClaw,1月下旬在HackerNews提及后迅速走红。它可完成多种任务,有独特工作方式和架构,但也存在安全漏洞,引发AI社群讨论。

DeeplearningAI
开源动态8

刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」

年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。

PaperAgent
新闻资讯7

直播预约 | 迈向用于演绎推理的诚实语言模型

本次讲座聚焦迈向用于演绎推理的诚实语言模型。当前语言模型难诚实推理,输入不足会产生无根据答案。为此制定多步骤任务,提出强化学习方法ACNCHOR,稳定学习过程、提高推理性能。

深度学习自然语言处理
算法论文8

解决特斯拉「监督稀疏」难题,DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law

自动驾驶领域VLA大模型面临‘监督稀疏’难题,特斯拉公布此挑战。DriveVLA - W0研究提出用世界模型解决,将‘预测未来图像’作自监督训练任务,还提出轻量级架构降低推理延迟。

机器之心
算法论文8

ICML 2025 Spotlight|南洋理工陶大程教授团队等提出基于RAG的高分辨率图像感知框架,准确率提高20%

南洋理工陶大程教授团队等合作,为解决多模态大语言模型处理高分辨率图像问题,探索 RAG 应用可行性,提出 Retrieval-Augmented Perception (RAP) 框架,在多任务上提升性能,已被 ICML 2025 接收。

机器之心
新闻资讯7

The Batch: 972|Grok 的 Cursor 联盟获得回报

SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。

DeeplearningAI
产品应用8

开源的 skill 被抄了千赞,我用 Lovart 给自己做了个品牌!

作者开源剪辑 Agent 被抄赞多,决定为账号做品牌视觉。其非设计师,用 Lovart 改变与 AI 沟通方式,通过 Brand Kit、字体生成器等完成系列设计,还能导出 PSD,沉淀 Skill。

AI产品自由
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
算法论文8

显存暴降92%!哈工大为线性注意力开辟了新道路

哈尔滨工业大学等团队发现线性注意力性能不足根源是查询范数丢失等。基于此提出NaLaFormer,在ImageNet - 1K准确率最高提7.5%,超分任务峰值内存降92.3%,为线性注意力发展开辟新道路。

AIGC开放社区
算法论文8

梁文锋署名!DeepSeek再发炸裂论文:提出“条件记忆”新范式,彻底打破GPU推理显存墙

来自DeepSeek的新论文提出“条件记忆(Conditional Memory)”新范式,推出Engram模块,实现可扩展知识查找。研究揭示U形缩放定律,构建的Engram模型性能超越MoE基线,还打破了GPU显存瓶颈。

AI寒武纪