视觉-文本压缩」共找到 1202 篇相关文章

算法论文8

Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」

语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。

机器之心
推荐文章7

AI Native的组织架构应该是怎么样的?Block CEO:每家公司都可以压缩成一个agent

Block CEO Jack Dorsey 认为传统公司层级制度在 AI 时代已无必要,AI 可承担协调等功能。Block 以 AI 为中心重建公司,构建两个世界模型,搭建四层架构,裁员 40%,重新定义人员角色和 CEO 工作。

Founder Park
产品应用7

RAG性能优化:基于RAGFlow自定义解析工具实现文本结构化(含源码教学)

文章围绕RAG性能优化展开,指出RAGFlow框架中DeepDoc解析算法不足,介绍开源与商业化解析工具优劣势及API调用和本地部署特点,推荐TextIn xParse,给出RAGFlow+TextIn知识库构建方法,还探讨了RAG优化方案。

AINLPer
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。

开源星探
开源动态8

超过GPT-image-1!大黑马Black Forest刚开源新模型,只用文本实现一键PS

今日凌晨,Black Forest开源文生图模型FLUX.1-Kontext开发者版本,功能类似PS,用自然语言就能一键P图。测试显示它超GPT-image-1,成最强开源文生图模型之一,还在架构、训练、工程层面做了优化。

AIGC开放社区
算法论文8

ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」

文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。

机器之心
产品应用8

腾讯AngelSlim重磅升级!面向全模态的大模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
开源动态8

华为开源7B多模态模型,视觉定位和OCR能力出色,你的昇腾端侧“新甜点”来了

华为推出开源多模态模型openPangu-VL-7B,适配昇腾端侧。它推理性能性价比高,在多核心任务表现突出,技术报告还披露核心技术细节,为昇腾使用者带来新选择,丰富昇腾生态。

量子位
算法论文8

推翻「预测下一个token」范式!微信AI新研究:把token压缩成连续向量更具性价比

微信AI和清华团队提出新范式CALM,把token打包成连续向量,让大模型从预测下一个token转变为预测下一个向量。实验表明它能减少生成步骤,在平衡性能和计算成本时性价比更高。

量子位
开源动态8

全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度

Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。

机器之心