多语言视觉问答」共找到 1663 篇相关文章

算法论文8

NeurIPS 2025 Spotlight | GeoSVR:稀疏体素的新潜力——超越3DGS系列的高精度三维表面重建

计算机视觉中表面重建难题待解,现有方法有瓶颈。北航等团队提出 GeoSVR 框架,围绕几何约束与表面正则化设计,在多数据集超现有方法,兼顾精度、完整性与效率,为多领域提供支持。

机器之心
开源动态7

直播预约 | LightMem:面向大模型的轻量化可插拔记忆系统

本报告聚焦大语言模型长期记忆构建与轻量化机制。现有外部记忆系统有记忆臃肿、组织低效、更新代价高问题。为此提出LightMem架构,能为大模型提供轻量、高效、可扩展记忆组件。

深度学习自然语言处理
产品应用7

刚刚,这家0产品0模型就估值854亿的公司,终于发布了首款产品!

Thinking Machines Lab推出首款产品「Tinker」,这是专为语言模型微调而生的API,让开发者摆脱底层架构束缚,用简单Python代码专注创新。它功能强大,目前免费私测,已获普林斯顿、斯坦福等团队使用。

新智元
开源动态7

国产开源大模型:再见9月,你好10月~

9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。

PaperAgent
产品应用8

AI视频生成走向「演技生成」时代,生数科技Vidu全球发布Vidu Q2

9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,打破AI生成表情假、动作飘忽等问题,实现从“视频生成”到“演技生成”跨越,有AI演技生动、镜头语言丰富等亮点,已多端上线。

机器之心
开源动态8

CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己

美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。

AIGC开放社区
算法论文8

训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
开源动态8

The Batch: 864 | GLM-4.5:一款开放的智能体竞争者

大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。

DeeplearningAI
推荐文章8

硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

本文详细列举 8 个主流大语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。

机器之心
产品应用8

Kubernetes环境中作业帮大模型服务流量调度优化实践

随着大语言模型应用渐广,Kubernetes 现有 Ingress 组件在大模型服务流量管理上有局限。作业帮提出创新调度方案,整合成模型网关,具备五项核心功能,提升了资源效率、稳定性和易用性。

InfoQ