「视觉 - 语言推理」共找到 3214 篇相关文章
港科大&北京人形提出LOVON:足式机器人开放世界全域目标追踪新范式!
港科大广州联合北京人形创新中心推出LOVON框架,融合大语言模型、开放词汇视觉检测和语言 - 运动映射模型,解决足式机器人开放世界全域目标追踪难题,有抗干扰视觉处理等优势,性能超传统方法。
3D高斯泼溅,可输入视图量高达500!推理速度提升3倍,内存少80%
ZPressor能高效压缩3D高斯泼溅(3DGS)模型的多视图输入,解决其在处理密集视图时的性能瓶颈。它基于信息瓶颈原理,分三步压缩信息,降低内存占用和推理时间,提升3DGS在高视图输入下的性能。
华为开源7B多模态模型,视觉定位和OCR能力出色,你的昇腾端侧“新甜点”来了
华为推出开源多模态模型openPangu-VL-7B,适配昇腾端侧。它推理性能性价比高,在多核心任务表现突出,技术报告还披露核心技术细节,为昇腾使用者带来新选择,丰富昇腾生态。
上交大和辉羲把LLM刻进ROM!推理性能冲2万token/s,GPU时代终结?
硅谷Taalas将大模型‘物理焊死’进芯片引关注,而上海交大、辉羲智能与微软亚洲研究院团队用ROM+SRAM异构架构,将端侧LLM推理速度推至20,000 tokens/s。介绍了ROMA和TOM架构优势及应用场景。
首次曝光!OpenAI新一代旗舰Astra换上“循环深度”推理架构:用计算深度换参数规模
9月2日消息,OpenAI将推出的旗舰模型Astra采用“循环深度”新技术,用较小模型实现庞大模型性能,降低成本。但该技术会让AI推理过程不可读,加重安全担忧,此前奥特曼已因Astra“能力过强”踩刹车。
全球首个从语言出发构建的智能体:MoonBit Pilot 如何推动自动化软件交付?
MoonBit Pilot是从语言底层构建的代码智能体系统,将AI Agent从“助手”推向“合作者”。它比Cursor、Codex更快更稳定,能云端异步执行,有Sub Agent架构和分段编译机制,或成未来软件工业新标准。
硅谷直击:黄仁勋入局龙虾大战,宣告 SaaS 已死,推理算力需求暴涨万倍!
本文为 CSDN 对英伟达 GTC 2026 大会的现场报道。黄仁勋宣告 SaaS 已死,揭幕 Agent 时代,指出 AI 重心正从训练转向推理,还推出 Vera Rubin、LPX 等新品,强调能效即钱,企业软件将向 Agent-as-a-Service 转变。
挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改
五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。
告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25
埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。
新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型
Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。