选择性生成框架」共找到 3474 篇相关文章

算法论文8

内存直降50%,token需求少56%!用视觉方式处理长文本

在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。

新智元
算法论文8

“掩码即武器”,四款扩散LLM全部破防 ? 上交&上海AI Lab发现dllm致命安全缺陷

上海交通大学、上海人工智能实验室等团队研究指出,扩散语言模型(dLLMs)有根本性架构安全缺陷。他们提出DIJA攻击框架,能让多个dLLMs大概率生成有害内容,还呼吁从多方面加强dLLM安全。

深度学习自然语言处理
算法论文8

ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链

随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。

机器之心
算法论文7

告别RAG相似匹配!百度Agentic-R为多轮搜索重塑检索器

传统检索增强生成(RAG)有“单跳”局限,多跳推理易出错。人大高瓴与百度提出面向智能搜索的检索器训练框架 Agentic - R,采用双视角打分和双向飞轮模式,在多数据集上表现出色。

PaperAgent
算法论文8

无VAE扩散模型! 清华&可灵团队「撞车」谢赛宁团队「RAE」

清华大学智能视觉团队和快手可灵团队联合推出《Latent Diffusion Model without Variational Autoencoder》,提出 SVG 框架,用预训练视觉特征编码器替代传统 VAE,解决了传统「VAE + Diffusion」范式的效率与通用性痛点。

机器之心
开源动态8

CVPR 2026 | 1B模型也能当多镜头导演?大连理工&快手可灵开源力作MultiShotMaster

大连理工与快手可灵团队推出MultiShotMaster框架,能在1B左右小参数量级模型实现导演级镜头调度和连贯叙事,支持多图参考、主体运动控制。论文录用至CVPR 2026,代码已开源,还获AAAI CVM Workshop竞赛冠军。

机器之心
算法论文8

AI学会左脚踩右脚自进化?Meta华人新研究改写Agent法则

Meta华人学者Jenny Zhang联合多机构研究者提出新智能体框架HyperAgents(DGM - H)。它打破任务能力与自我改进能力需对齐的局限,能跨任务自我改进,还自动生成基础设施,或改写Agent竞争规则。

新智元
推荐文章7

深度解析世界模型:新范式的路线之争,实时交互与物理仿真

文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频与3D结构化两条路线,介绍不同公司产品并以四象限框架分类。

海外独角兽
算法论文8

训练成本暴降99%,35秒出1分钟高清视频!英伟达MIT等引爆视频AI革命

英伟达联合MIT、港大团队提出SANA - Video架构,其核心是创新的全局线性注意力Diffusion Transformer训练框架和全局显存恒定的KV缓存机制。它训练成本低、速度快、可部署,重新定义AI视频生成效率极限。

新智元
开源动态8

阿里开源创新AI Agent:媲美Deep Research,Github每日增长第一

人类信息检索能力受限,OpenAI的Deep Research虽能解决难题但闭源。阿里巴巴通义实验室开源AI Agent框架WebSailor,在多基准测试表现出色,核心技术围绕复杂任务生成和强化学习模块展开,在Github成绩亮眼。

AIGC开放社区