「视觉思维链」共找到 1149 篇相关文章
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
离谱!我以为它只是提示词合集,结果 16.4 万 Star prompts.chat 直接把 Prompt 收藏夹干成团队资产库
一开始以为 prompts.chat 只是提示词合集,实际它把零散 Prompt 变成可搜索、可自托管、可接工具链的团队资产库。截至 2026-06-29,它在 GitHub 有 16.4 万 Star,还介绍了其功能、适用场景和局限。
库克与苹果
苹果CEO库克宣布卸任,转任执行董事长。他在苹果28年,任CEO 15年,让苹果市值和营收大幅增长,打造强大供应链,推出多新品类。但造车项目取消,Vision Pro未打开大众市场,AI发展滞后。接班人是硬件工程师John Ternus。
林俊旸离职后首度发声:万字复盘,大模型下一站「智能体式思考」
前阿里千问负责人林俊旸离职后发文,复盘大模型行业演进,指出 AI 大模型未来主线是智能体式思考。文中分析推理模型崛起的启示,探讨思考与指令融合难题,还阐述智能体式思维含义、强化学习基础设施挑战等。
CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态
CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。
1万亿参数Ling-1T开源,国产LLM牛了~
Ling-1T是Ling 2.0系列首款旗舰“非思维”模型,总参数量达1万亿。预训练数据超20万亿token,支持128K上下文长度。在多项任务中表现出色,是目前已知最大的FP8训练基座模型,已完成全面评测。
提效40%?揭秘AI驱动的支付方式“一键接入”系统
文章围绕AI驱动的支付方式“一键接入”系统展开。先指出跨境支付接入流程痛点,介绍借助Qwen Coder + MCP工具链构建提效系统的目标。接着阐述技术架构、流程,以及提升AI采纳率的方法,最后展示效果、规划未来。
通向L3的正确范式?理想i8全球首发VLA高阶辅助驾驶,我们帮你试了试
本周二,理想全新纯电SUV理想i8上市,其搭载的VLA辅助驾驶系统受关注。理想发现端到端数据驱动升级有局限,VLA架构改进让系统有思维、沟通等能力,还带来平顺性等提升,且研发各方面能力强。
边画边想!多模态Reasoning迎来巨大提升!
论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。
万字总结:如何练就适配人形机器人的可靠「灵巧手」?|GAIR Live
在具身智能崛起时,灵巧手成人工智能落地核心突破口。2025年5月25日相关线上沙龙中,嘉宾围绕灵巧手软硬件、数据与模型、落地应用等交流,探讨数据难题、开源价值、落地挑战及中美差距等。