无损文本压缩」共找到 668 篇相关文章

算法论文8

Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」

语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。

机器之心
推荐文章7

AI Native的组织架构应该是怎么样的?Block CEO:每家公司都可以压缩成一个agent

Block CEO Jack Dorsey 认为传统公司层级制度在 AI 时代已无必要,AI 可承担协调等功能。Block 以 AI 为中心重建公司,构建两个世界模型,搭建四层架构,裁员 40%,重新定义人员角色和 CEO 工作。

Founder Park
产品应用7

RAG性能优化:基于RAGFlow自定义解析工具实现文本结构化(含源码教学)

文章围绕RAG性能优化展开,指出RAGFlow框架中DeepDoc解析算法不足,介绍开源与商业化解析工具优劣势及API调用和本地部署特点,推荐TextIn xParse,给出RAGFlow+TextIn知识库构建方法,还探讨了RAG优化方案。

AINLPer
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。

开源星探
开源动态8

超过GPT-image-1!大黑马Black Forest刚开源新模型,只用文本实现一键PS

今日凌晨,Black Forest开源文生图模型FLUX.1-Kontext开发者版本,功能类似PS,用自然语言就能一键P图。测试显示它超GPT-image-1,成最强开源文生图模型之一,还在架构、训练、工程层面做了优化。

AIGC开放社区
产品应用8

腾讯AngelSlim重磅升级!面向全模态的大模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
算法论文8

推翻「预测下一个token」范式!微信AI新研究:把token压缩成连续向量更具性价比

微信AI和清华团队提出新范式CALM,把token打包成连续向量,让大模型从预测下一个token转变为预测下一个向量。实验表明它能减少生成步骤,在平衡性能和计算成本时性价比更高。

量子位
算法论文8

Diffusion约2倍无损加速!训练-推理协同的缓存学习框架来了| HKUST&北航&商汤

HKUST、北航与商汤提出HarmoniCa框架,解决Diffusion模型推理慢、成本高问题。它通过SDT和IEPO机制,解决训练 - 推理脱节,在多模型上实现推理提速、质量提升,且训练推理开销低,已开源。

量子位
新闻资讯8

微软 CEO 纳德拉:离了 AI 软件开发没法想!编程如诗都是“压缩”。社区:必须拥抱变化。

微软CEO纳德拉在访谈中表示,如今软件开发离不开AI,AI编程已成标配。他强调AI本质是赋能人类的工具,还提及AI普及挑战,同时保持对AI局限性的清醒认知,分享领导哲学与诗意展望。

AI进修生
算法论文8

让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26

多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。

量子位