视觉分析」共找到 1726 篇相关文章

推荐文章7

亲历两场编程语言迁移“惨案”,谷歌大佬揭露技术选型真相:90%决策与技术无关

谷歌大佬 Steve Francia 结合自身经历,指出技术选型常受身份认同等非技术因素影响。如早期创业公司因 CTO 执意换语言错失市场,谷歌团队跟风选 Rust。还分析了背后原因及代价,并给出破局建议。

InfoQ
产品应用8

当搜索遇见 AIGC:京东零售的“千人千面”素材生成实践

在 AIGC 浪潮下,视觉生成技术重构电商生态。京东零售李岩介绍“千人千面”商品素材生成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。

InfoQ
产品应用7

理解规范驱动开发:Kiro、spec-kit和Tessl

作者尝试理解规范驱动开发(SDD),查看了 Kiro、spec - kit 和 Tessl 三个自称 SDD 的工具。介绍了 SDD 定义、规范含义,分析评估工具的挑战,还指出工具存在不适合多数编程问题、审查体验差等问题。

InfoQ
开源动态8

Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana

北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。

AI工程化
开源动态8

SGLang 优化Triton FusedMoE 的一个新技巧​

蚂蚁在SGLang中提交优化PR,针对Fused Triton MoE的Down Projection kernel加入TMA优化,在DeepSeek - R1模型的H200 TP8 prefill场景下性能提升显著,还详细分析了优化背景、思路、实现细节及测试结果。

GiantPandaLLM
开源动态8

Dexmal原力灵机开源Dexbotic,基于PyTorch的一站式VLA代码库

Dexmal原力灵机推出基于PyTorch的开源视觉-语言-动作模型(VLA)代码库Dexbotic,面向具身智能研究者。其架构含三大核心组件,有五大特征,还推出开源硬件,未来将持续投入生态建设。

机器之心
新闻资讯8

为什么 OpenAI 们都要搞 AI 基建?Groq 创始人把背后的逻辑讲透了

文章通过对Groq创始人Jonathan Ross的访谈,探讨AI基建问题。指出AI应用增长受限算力,算力提升易见效,自研芯片可掌控命运。还分析芯片制造难点、市场供需、能源需求等,预测AI将带来用工短缺和新产业。

Founder Park
产品应用7

AI花17小时写了篇30页学术论文!自主选题,包含实验,还符合APA格式规范

Virtuous Machines AI系统花17小时、114美元,找288个真人做实验,写了篇30页认知心理学领域学术论文,从选题到成稿全自动化。其架构独特,不过也存在理论误解等小缺点。

量子位
算法论文8

缺数据也能拿SOTA?清华&上海AI Lab破解机器人RL两大瓶颈

现有机器人视觉 - 语言 - 动作(VLA)模型训练范式存在数据采集成本高、泛化能力不足等问题。清华和上海AI Lab团队提出SimpleVLA-RL,解决了VLA模型训练的核心瓶颈,在多基准测试中实现SoTA性能。

量子位
推荐文章7

C端热战,B端暗涌:大模型真正的战场才刚刚开始 | 《中国大模型落地应用研究报告 2025》正式发布

InfoQ研究中心联合中欧AI与管理创新研究中心发布《中国大模型落地应用研究报告2025》,从驱动因素、C端产品现状到B端落地现状,勾勒大模型应用转折期的图景,分析应用难的原因及各端现状。

InfoQ