「多模态处理」共找到 1794 篇相关文章
DeepSeek-OCR降本增效,10×暴力压缩还能读得清
Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理
面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。
别误会00后了!美国千人调查揭秘:85%学生都用AI,首要目的不是偷懒
国外机构调查1047名学生,结果显示约85%学生过去一年用生成式AI处理课程作业,主要用于头脑风暴、答疑与备考。学生希望学校规范AI使用,教师用AI教学学生看法不一,AI重塑大学价值评估体系。
ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型
本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动两大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。
OpenAI 开源模型泄露:六大技术细节
OpenAI 可能发布的开源大模型细节泄露,包含两款模型,1200 亿参数 MoE 模型和 200 亿参数稠密模型,专注文本处理。还涉及训练技术、激活函数、上下文窗口、注意力机制及底层架构等方面的技术细节。
GLM4.5实测:审美不如R1,全栈还不大可用,别急冲
7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,全栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。
百度开源文心4.5系列10款模型,多项评测结果超DeepSeek-V3
今日百度正式开源文心大模型4.5系列10款模型,涵盖不同参数规模。该系列模型在多文本和多模态基准测试达SOTA,多项评测超Qwen3、DeepSeek - V3,还具备三大关键创新,获开发者关注。
从AI Agent到Agentic AI:开源如何助力开发者解决行业痛点?
2025年全球开源软件项目数量增长,中国企业贡献显著。字节跳动在火山引擎原动力大会开源开发者日上,多位负责人分享开源经验,探讨其为AI Agent带来的技术改变,展示解决行业痛点的理念与实战经验。
MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding
文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。