「视觉思维链推理」共找到 2706 篇相关文章
让VLA真正跑上机器人:北大团队开源Jetson-PI,Jetson Orin控制频率提升8.66倍
文章聚焦让VLA模型在机器人上高效运行难题。北大等团队提出Jetson - PI方案,从异步推理算法等三层面优化,在Jetson Orin上控制频率提升8.66倍,推动具身智能向工业应用跃迁。
汉字防AI作弊!甩英文、拉丁文十几条街
中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉大语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。
帮大家总结了一下凌晨的Google I/O 2026开发者大会。
本文总结Google I/O 2026开发者大会成果,涵盖AI模型、产品、Agent系统、视觉生成、搜索、电商等多领域。如推出Gemini 3.5 Flash,升级产品功能,发布新Agent系统,推进电商协议,还有科研成果与硬件更新。
英伟达为何持续押注VASTData?AI存储正在成为新的“算力”|甲子光年
AI产业曾聚焦GPU,如今数据存储设施重要性凸显。VAST Data完成约10亿美元F轮融资,估值300亿美元,英伟达持续跟投。它重构AI数据基础设施,国内焱融科技有相似技术路线且具自主可控优势。
超150位全球AI一线技术专家齐聚巴黎,这场大会到底聊了些什么?|GOSIM Paris 2026圆满收官
5月6日,GOSIM Paris 2026进入第三天,议程转向技术实践。超150位全球AI专家齐聚,探讨模型推理优化、开源社区治理等。Niko Matsakis等分享前沿观点,还有五大主题论坛及工作坊,展示开源AI生态成果。
Lovart第一时间上线Image 2:每个人真的可以瞬间拥有一个设计部了
Lovart上线Image 2,有去AI味的写实感、强大文字生成与泛化推理能力,完爆Nano Banana 2。它结合独家工作流,带来设计体验飞升,还给出五个使用场景案例,并对比了与Claude design的差异。
一个投资人与他的AI龙虾助手70天真实协作笔记|甲子光年
恒海奇点创始人姜海舟分享与OpenClaw构建的AI Agent协作系统70天经验。他指出企业AI化瓶颈在信息结构,提出四个判断,包括AI缺信息、‘眼高手低’者赢、AI不裁人、‘吓尿点’临近,认为窗口期只剩3 - 6个月。
刚刚,Anthropic首超OpenAI!暴买谷歌TPU,Claude杀疯了
Anthropic与谷歌、博通合作打造3.5 GW TPU集群,预计2027年上线。其年化收入破300亿美元首超OpenAI,客户呈指数级增长。但训练和推理成本高,与OpenAI都在冲刺IPO,竞争激烈。
编程智能体的核心组件【译】(重发,补图)
文章围绕编程智能体展开,先厘清大语言模型、推理模型与智能体关系,指出智能体是含‘模型 + 工具 + 记忆 + 环境反馈’的循环系统,后介绍编程智能体六大核心组件,还对比了与 OpenClaw 的区别。
1.4亿宝可梦玩家,都在给AI免费打工…
1.4亿《精灵宝可梦Go》玩家10年拍300亿张实景图,为Niantic免费收集数据。Niantic用此数据训练VPS视觉定位系统,提升机器人配送效率,还获巨额投资,剥离游戏业务专注空间AI。