「LLM式视觉编码器」共找到 1611 篇相关文章
首个大规模记忆湖发布,AI Infra跑步进入“记忆”时代
LLM是AI的“第一大脑”,记忆平台是“第二大脑”。当前AI企业应用进入生产力时代,竞争聚焦“隐性知识”记忆化。质变科技发布MemoryLake,具备多方面能力,在性能上优势显著,已服务众多用户和企业。
从「能用」到「好用」:数据可视化的三个维度,你还在第一层吗?——人大提出图表创作新方式
数据可视化面临静态视觉与动态叙事挑战,如设计繁琐、动画门槛高、交互难复用。中国人民大学IDEAS Lab团队与山东大学交叉研究中心推出PiCCL、CAST、Libra,解决创作难题,还探索用大模型提升可视化效率。
端到端智驾新SOTA | KnowVal:懂法律道德、有价值观的智能驾驶系统
北京大学王勇涛团队提出新型自动驾驶系统 KnowVal,通过感知与知识检索模块协同实现视觉 - 语言推理。它构建驾驶知识图谱,有价值模型用于轨迹规划,实验在多基准测试表现佳,还通过定性分析验证效果。
跳出「黑盒」,人大刘勇团队最新大语言模型理论与机理综述
大语言模型工程成功但理论研究滞后,被视为「黑盒」。人大刘勇团队用生命周期分类法,将LLM理论研究整合为六阶段,系统综述底层理论与机制,指出前沿挑战,为其向严谨科学转型提供路线图。
2026年最火的AI机遇,为什么是「OPC」?
2025年末北京颁发首个OPC服务计划,中关村AI北纬社区打造OPC先行示范高地。OPC以一人带AI Agent跑通公司全流程,2026年将因边际成本崩塌、交互范式转移而爆发,文中还拆解5个顶级OPC样本并给出工具栈。
这一年,DeepSeek消耗14万亿Token,编程仅占1/10,超一半用于角色扮演?
a16z和OpenRouter基于100万亿token研究揭示LLM使用情况:开源模型占三成市场,编程任务成刚需,角色扮演是金矿。还提到‘玻璃鞋效应’影响用户留存,市场分层为‘高端闭源+性价比开源’双轨制。
微软 Agentic 组织:下一代 AI 系统
微软研究院提出全新推理范式AsyncThink,让LLM从单打独斗进化成带团队的项目经理。它把并发控制转为纯文本协议,经两阶段训练,实验中全方位碾压传统方法,还具跨领域泛化能力。
小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度
小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。
NeurIPS 2025 Spotlight | GeoSVR:稀疏体素的新潜力——超越3DGS系列的高精度三维表面重建
计算机视觉中表面重建难题待解,现有方法有瓶颈。北航等团队提出 GeoSVR 框架,围绕几何约束与表面正则化设计,在多数据集超现有方法,兼顾精度、完整性与效率,为多领域提供支持。
让大模型合成检查器:UIUC团队挖出Linux内核90余个长期潜伏漏洞
伊利诺伊大学香槟分校张令明老师团队的论文提出KNighter,它让大模型生成静态分析检查器,在Linux内核挖出92个长期潜伏漏洞,将LLM归纳能力沉淀为规则,带来可落地等好处。