视觉思维链推理」共找到 2695 篇相关文章

开源动态8

刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」

年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。

PaperAgent
算法论文8

解决特斯拉「监督稀疏」难题,DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law

自动驾驶领域VLA大模型面临‘监督稀疏’难题,特斯拉公布此挑战。DriveVLA - W0研究提出用世界模型解决,将‘预测未来图像’作自监督训练任务,还提出轻量级架构降低推理延迟。

机器之心
开源动态8

首个开源多模态Deep Research智能体,超越多个闭源方案

首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。

量子位
新闻资讯7

The Batch: 972|Grok 的 Cursor 联盟获得回报

SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。

DeeplearningAI
产品应用8

开源的 skill 被抄了千赞,我用 Lovart 给自己做了个品牌!

作者开源剪辑 Agent 被抄赞多,决定为账号做品牌视觉。其非设计师,用 Lovart 改变与 AI 沟通方式,通过 Brand Kit、字体生成器等完成系列设计,还能导出 PSD,沉淀 Skill。

AI产品自由
新闻资讯8

吴恩达年度AI总结来了!附带一份软件开发学习小tips

AI大神吴恩达总结2025热门AI趋势,包括模型推理成标配、Meta引发人才争夺战、数据中心火热、智能体编程重塑软件开发。还给出软件开发学习建议,如参加课程、动手实践、读论文。

量子位
新闻资讯8

刚刚,马斯克发布Grok 4!全榜第一,年费飚到2万+

北京时间中午,马斯克现身 xAI 发布会发布 Grok 4,称其是世界最好的 AI。Grok 4 推理能力强,多类基准测试成绩领先,还在多方面能力获加强,已上线但付费昂贵。

机器之心
算法论文8

让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了

近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。

机器之心
开源动态8

源神阿里!图像生成Ovis-Image再开源,7B小参数媲美GPT-4o和20B开源模型

阿里Ovis团队发布Ovis - Image,7B参数文本到图像模型,在文本渲染任务媲美GPT - 4o和20B + 开源模型。它架构优化、数据工程精细、训练范式独特,实测数据表现佳,显存占用低、推理快。

AIGC开放社区
算法论文8

Lumina-mGPT 2.0:自回归模型华丽复兴,媲美顶尖扩散模型

上海人工智能实验室等团队提出Lumina - mGPT 2.0自回归模型,统一多种图像任务。它采用独立训练架构、统一多任务处理框架和高效推理策略,实验表现优异,后续将优化采样时间并扩展至多模态理解。

机器之心