文本驱动动作生成」共找到 1298 篇相关文章

算法论文8

ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架

北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”两阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备可解释性和可编辑性。

机器之心
算法论文8

LLM 长文本处理的“不可能三角”?我们用 E2LLM 把它破解了!

文本理解与推理是LLM的难题,存在效果、速度、兼容性的“不可能三角”。蚂蚁集团和华东师范大学提出E2LLM新范式,实现三者平衡,在效果和效率上表现出色,开启长文本处理新篇章。

PaperAgent
开源动态8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
产品应用8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。

机器之心
开源动态7

国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板

港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。

DeepTech深科技
产品应用8

中文版Nano Banana来了?Qwen-Image-2.0炸场:1K长文本硬吃,中文生图彻底不拧巴了

AI生图曾有文本长易糊、指令复杂就出错、中文渲染差等问题。阿里新发布的Qwen-Image-2.0能处理1K token长文本,理解复杂指令,中文渲染佳,还能多图编辑,国际评测表现也靠前,阿里云百炼已开通API邀测。

量子位
算法论文8

RL加持的3D生成时代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场

强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。

机器之心
算法论文8

清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026

大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。

AI科技评论
产品应用7

AI驱动的卡片笔记项目

Blinko是AI驱动的卡片笔记项目,方便快速捕捉和组织灵感。有AI增强笔记检索、数据所有权保障等特性,支持多平台,还具备离线语音识别功能,支持多种AI模型,是开源项目。

GitHubStore
推荐文章7

规范驱动开发:瀑布模型回潮

规范驱动开发(SDD)重拾编码前写大量文档理念,虽为AI编程提供框架,但可能让敏捷性被Markdown文档掩埋。文章探讨为何迭代性自然语言方法更契合现代开发需求,指出SDD存在诸多不足。

InfoQ