计算机视觉」共找到 767 篇相关文章

开源动态8

小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!

文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。

开源星探
产品应用7

只提升2个点?我实测Claude 4.1后,发现官方在骗人

官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进步大,尤其在理解提示词和视觉设计能力上,还能精细修改多文件。

AI产品黄叔
算法论文8

攻克「恶意投毒」攻击!华南理工联合霍普金斯和UCSD,连登TPAMI、TIFS顶刊

华南理工大学计算机学院AI安全团队联合国际高校,聚焦联邦学习中防范恶意投毒攻击。提出FedID和Scope两种创新防御方法,前者用多种度量标准和动态加权检测恶意梯度,后者通过逐维归一化等揭示后门维度,均有良好效果。

新智元
算法论文8

Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」

新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。

机器之心
算法论文8

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。

机器之心
开源动态8

OpenAI携手五巨头开源革命性超算协议:一举解决超大集群LLM训练不稳定和网络性能难题

OpenAI联合英伟达等五巨头推出超算开放网络协议MRC并正式向行业开放。MRC目标是性能可预期,有多平面网络、自适应包喷射、SRv6源路由三大核心机制,已在OpenAI多台超级计算机上部署。

AI寒武纪
产品应用7

CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态

CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。

机器之心
算法论文8

边画边想!多模态Reasoning迎来巨大提升!

论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。

深度学习自然语言处理
新闻资讯7

万字总结:如何练就适配人形机器人的可靠「灵巧手」?|GAIR Live

在具身智能崛起时,灵巧手成人工智能落地核心突破口。2025年5月25日相关线上沙龙中,嘉宾围绕灵巧手软硬件、数据与模型、落地应用等交流,探讨数据难题、开源价值、落地挑战及中美差距等。

AI科技评论
算法论文8

世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。

机器之心