「结构化工作流」共找到 853 篇相关文章
舍弃 VAE,预训练语义编码器能让 Diffusion 走得更远吗?
纽约大学谢赛宁团队、清华&快手 Kling 团队的研究者指出 VAE 制约当前 Diffusion 范式,提出用预训练视觉模型作语义编码器改进。介绍了 VAE 不足及 RAE、SVG 工作如何解决问题,将扩散模型从‘压缩优先’转为‘语义优先’。
别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案
团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。
Agnes:不做通用型智能体丨对话全民AI应用平台Agnes AI
量子位智库对话Agnes AI创始人Bruce Yang,探讨多智能体在AI产品的应用。Agnes AI以Multi Agent架构为核心,上线四月日活破20万。其介绍了核心功能、单多智能体差异、评估维度等,还谈及目标人群、市场规模等内容。
用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式
随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。
Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞
多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。
超越90%城市规划师!清华、MIT等提出人机协作新范式 | Nature子刊
清华大学联手MIT等机构提出「大语言模型+规划师」新框架,让AI作「智能规划助手」。框架含概念设计、方案生成、效果评估三阶段,实验显示AI表现超九成人类规划师,未来将人机协同。
全球首个多智能体Eigent开源!内置200+MCP,支持SSO企业级
OWL团队开源多智能体Manus类工具Eigent,能多智能体协作处理复杂任务。它可整合工具和数据,处理任务时清晰拆解执行。有多种预定义智能体,内置200+MCP工具,还支持人工干预。
国内首个免费提供的深度研究,反而有市面上最好的体验
秘塔深度研究(https://metaso.cn/)上线,是首个将深度研究作免费基础功能的产品。它在算法、交互等多方面优化,降低成本、保障准确,还创新交互形式,搜索结果清晰有条理,体验佳。
我去,还能这么玩?AI新宠DocExt:纯本地文档抽取,开源免费还无依赖!你还在为OCR头疼吗?
DocExt 是 Nanonets 开源项目,为全流程无 OCR、零云依赖的本地文档结构化提取工具,适用于多种文档类型,支持字段与表格识别。它零 OCR 误差小、可本地部署,还能灵活接入模型。
中学生就能看懂:从零开始理解LLM内部原理【八】| 什么是残差连接?
本系列是对长篇文章《Understanding LLMs from Scratch Using Middle School Math》的解读笔记。本篇介绍残差连接,指出传统多层模型有网络退化和梯度传导困难问题,而残差连接能缓解,还说明了其工作原理和可行性。