「视觉智能」共找到 3974 篇相关文章
一年成爆款,狂斩 49.1k Star、200 万下载:Cline 不是开源 Cursor,却更胜一筹?!
AI编程助手市场看似火热,实则盈利艰难,如Cursor等工具亏本运营。Cline选择开源,坚持软件免费、服务变现,一年成爆款。其创始人分享了产品理念、技术选型、市场定位等,还探讨了MCP生态、编程智能体发展等话题。
百度:和大家一起讲 「超级有用」的故事
作者参加百度AI DAY智能云创新行业专场,看到百度全栈AI解决方案矩阵及应用案例。百度通过构建生态、全栈自研、推动科技平权等举措发力AI,诸多应用已取得商业成果,有望在AI商业化长跑中胜出。
智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开
上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。
只提升2个点?我实测Claude 4.1后,发现官方在骗人
官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进步大,尤其在理解提示词和视觉设计能力上,还能精细修改多文件。
仅需0.7秒单图像实时3D重建,开源扩散模型
单图像3D重建是计算机视觉难题,传统基于回归和生成式方法各有局限。Stability - AI开源SPAR3D模型,融合两种方法规避局限,仅0.7秒完成单图实时3D重建,实验显示性能显著优于其他基线方法。
2027年实现AGI?计算物理学家怒怼:纯属无稽之谈!
知名博主Scott Alexander领衔的项目称AI将在2027年达超人智能。但计算物理学家经研究指出,该预测模型漏洞百出,如数学错误、曲线选择无依据、图表与模型不符等,即便新模型改进部分问题,多数批判仍成立。
首个转型AI公司的新势力,在全球AI顶会展示下一代自动驾驶模型
上周,小鹏 G7 亮相,首发自研芯片与 VLA - OL、VLM 模型。同时,小鹏在 CVPR 2025 分享研发进展。其世界基座模型展现高智能,还将结合世界模型迭代。此外,小鹏验证 Scaling Laws,转型 AI 公司,全链路优化技术。
推理能力大比拼,《推理模型综合测评报告 2025 》正式发布
过去半年,推理能力成大模型新分水岭。InfoQ研究中心评测八款热门模型,围绕五大维度,用超90%原创试题。发现各模型在不同维度表现有差异,推理模型发展正从‘一个大脑’变为‘带工具的多能智能体’。
如何通俗的读懂算力?
文章以拼图比赛作比,介绍了通用、科学、智能、AI专用这四种算力类型及其作用,指出摩尔定律失效下工程师探索创新提升算力。还阐述算力生态各环节,最后点明未来AI成算力市场核心引擎,中国算力发展亮眼。