「视觉大模型」共找到 9284 篇相关文章
谷歌突袭发布AI应用,无需Wi-Fi、手机就能跑大模型!网友实测两极分化
谷歌推出 Google AI Edge Gallery 应用,可在 Android 设备离线运行 AI 模型。它有本地运行、智能选模等特点,响应快且隐私性好。不过网友实测评价不一,有人认为它是旧技术包装,还被指比 Core ML 落后。
Claude Code凭什么牛?大模型团队天天用自家产品,发现bug直接就改了
Claude Code虽有争议,但很成功,4个月用户达11.5万。Claude Code负责人透露构建细节,如产品理念、评估标准、反馈机制等,还阐述编程领域变化、模型与工具共同进化等内容。
Mini-SGLang,30万行代码浓缩为5000行,大模型推理高性能教学与研究模版
SGLang发布Mini-SGLang,将30万行代码缩至5000行,保留核心特性,为大模型推理提供高性能教学与研究模版,解决教育门槛高和科研原型开发难的痛点,还经测试验证了性能。
华为开源7B多模态模型,视觉定位和OCR能力出色,你的昇腾端侧“新甜点”来了
华为推出开源多模态模型openPangu-VL-7B,适配昇腾端侧。它推理性能性价比高,在多核心任务表现突出,技术报告还披露核心技术细节,为昇腾使用者带来新选择,丰富昇腾生态。
开源DeepSeek R1增强版:推理效率快200%,创新AoE架构
德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三大模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本大减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。
当模型成为公共基础设施,特赞如何架构企业级 Agentic AI?
当大模型成公共基础设施,企业需构建围绕业务结构的智能系统架构。特赞提出的 GEA 企业级智能体架构体系,围绕企业业务运行结构设计,能让智能体参与企业经营判断。
比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式
Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。
腾讯组织大调整,前 OpenAI 研究员姚顺雨担任首席 AI 科学家
腾讯进行组织架构大调整,成立AI Infra部等部门。前OpenAI研究员姚顺雨出任首席AI科学家,兼任多职。此次调整旨在整合模型、数据、算力,腾讯还大力招募人才,此前元宝借开源起量,凸显自研重要性。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。
世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制
Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。