「视觉关键线索」共找到 1681 篇相关文章
干货满载!腾讯云AI技术周圆满收官,回顾如何利用AI增效创收
2025腾讯全球数字生态大会启幕前夕,腾讯云联合InfoQ打造「AI技术周」,9月8 - 14日直播输出,围绕多关键议题邀大咖对话,公布多项AI+产品进展,涵盖降成本搭应用、AI Agent落地、数据库智能进化等内容。
理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA
统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。
2025 AI Agent全景报告:50+权威数据,85%企业已上车、发展趋势预测!
index.dev发布AI Agent调研报告,盘点50多个关键数据,涵盖应用趋势、场景、工作流等。截至2025年,85%组织集成AI Agent,市场价值73.8亿美元,预计2032年达1036亿美元。报告还分析技术栈各层应用及市场趋势。
社区供稿 | 阿里国际Ovis2.5重磅发布:以小博大,刷新开源模型性能新高度
阿里国际发布多模态大模型Ovis2.5,在OpenCompass综合得分提升,保持SOTA水平。它在原生分辨率视觉感知等三方面突破,有9B和2B两版本,代码、模型等资源已开源,技术原理涉及架构、训练与数据。
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。
只提升2个点?我实测Claude 4.1后,发现官方在骗人
官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进步大,尤其在理解提示词和视觉设计能力上,还能精细修改多文件。
仅需0.7秒单图像实时3D重建,开源扩散模型
单图像3D重建是计算机视觉难题,传统基于回归和生成式方法各有局限。Stability - AI开源SPAR3D模型,融合两种方法规避局限,仅0.7秒完成单图实时3D重建,实验显示性能显著优于其他基线方法。
刚刚,OpenAI通用智能体ChatGPT Agent正式登场
北京时间周五凌晨,OpenAI发布全新ChatGPT Agent,实现通用智能体能力关键升级。它能自动用多种工具规划,完成复杂任务,已向部分订阅用户开放。其整合多能力,配备工具,基准测试表现佳,但也有安全风险。
一篇综述:知识图谱的3种类型,6大推理任务
知识图谱(KGs)在认知智能系统中作用关键,知识图谱推理(KGR)能基于现有事实推断新知识。文章综述了3种知识图谱类型、6大推理任务,介绍推理方法、应用,还指出KGR面临的挑战与机遇。
Cursor迎来史诗级更新,关于Cursor 1.0.0版本,这里有你需要知道的一切!
2025年6月5日,上线2年的Cursor迎来首个正式版1.0.0。此次更新功能多且关键,如上线代码审查工具Bugbot、全面开放后台代理功能等,虽提升了开发效率,但部分功能有使用成本,对新手不太友好。