「视觉质量」共找到 1249 篇相关文章
12年首次大改!真有人喜欢苹果的“液态玻璃”吗?至少Flutter 开发者的噩梦开始了
在 WWDC 2025 上,苹果宣布在多操作系统引入‘液态玻璃’新视觉风格,是 12 年来最大 UI 革新。这或成苹果移动端外观重大转变,但也掩盖其 AI 落后现状,还让开发者面临功耗、适配等挑战。
14B检索能力超过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~
有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。
手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源
面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。
ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点
Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。
超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law
近期具身智能领域竞争激烈,银河通用联合多机构发布 LDA-1B 模型,能统一利用各类具身数据。它在基准测试中表现出色,代码已开源,还解决了数据格式、质量等问题,实战效果也很突出。
Lyft 使用 AI 和人机协同扩展了全球范围内的本地化能力
Lyft 实现 AI 驱动的本地化系统,加速应用与网页内容翻译。新系统结合大语言模型、自动评估与人工审核,将翻译周期从数天缩至分钟级,兼顾质量与适配性,还分批量和实时翻译架构处理不同场景。
全球首个世界统一模型发布,机器人家庭成员来了!
自变量机器人发布全球首个世界统一模型架构的具身智能基础模型WALL - B,它打通视觉、听觉等模块,让机器人理解物理世界。还让机器人拥有多能力,通过真实家庭数据形成数据飞轮,助力其融入家庭。
告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍
视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。
学会“吃一堑长一智",性能飙升11%!XSKILL让AI积累经验和技能
XSKILL框架让AI像人一样积累经验和技能,将任务级技能与动作级经验统一到双流设计中,通过视觉接地提取和检索知识,在多个基准测试中显著提升性能,还展现出跨模型迁移性。
Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA
人大高瓴与快手联合发布全新评测基准GISA,用于评估智能体搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能体距人类水平差距大。